在一批计算化学 Agent 任务中,71 次运行没有提交报告,其中大部分被归为工程或记录问题。本文记录几类失败原因,以及统计任务成绩时需要注意的口径。
阅读全文 - Read more »

重复运行得到相近的评审结果,只能说明判分比较稳定。结合计算化学评测中的数据,讨论稳定性、共同漏检和裁判核验。
阅读全文 - Read more »

不同 LLM 列出的问题数量,既受发现能力影响,也受拆分习惯影响。先将评审结果归并成问题矩阵,才能比较它们查到了什么、漏掉了什么。
阅读全文 - Read more »

计算化学 Agent 的报告可能与实际计算不符。本文通过两个例子,说明为什么需要分别检查任务完成度和报告忠实度,并追溯原始计算文件。
阅读全文 - Read more »

Tennisbot v7 是一个基于 OpenAI Agents SDK 的多会话、多 Agent 个人助手。本文从入口与目录结构讲起,沿着 WebUI/CLI 两条执行链路下钻到会话存储、handoff、工具与多模态输入,记录它如何在“可自修”的约束下迭代到可用形态,并给出关键设计取舍与踩坑复盘。
阅读全文 - Read more »