Agent 任务失败的归因与统计 发表于 - Posted on 2026/09/15 字数 - Word count: 1.1k 阅读时间 - Reading time ≈ 4 mins. 在一批计算化学 Agent 任务中,71 次运行没有提交报告,其中大部分被归为工程或记录问题。本文记录几类失败原因,以及统计任务成绩时需要注意的口径。 阅读全文 - Read more »
LLM 判分的稳定性与准确性 发表于 - Posted on 2026/09/15 字数 - Word count: 1.1k 阅读时间 - Reading time ≈ 4 mins. 重复运行得到相近的评审结果,只能说明判分比较稳定。结合计算化学评测中的数据,讨论稳定性、共同漏检和裁判核验。 阅读全文 - Read more »
LLM 评审结果的归并与比较 发表于 - Posted on 2026/09/15 字数 - Word count: 1.1k 阅读时间 - Reading time ≈ 4 mins. 不同 LLM 列出的问题数量,既受发现能力影响,也受拆分习惯影响。先将评审结果归并成问题矩阵,才能比较它们查到了什么、漏掉了什么。 阅读全文 - Read more »
计算化学 Agent 的报告核验 发表于 - Posted on 2026/09/15 字数 - Word count: 1.1k 阅读时间 - Reading time ≈ 4 mins. 计算化学 Agent 的报告可能与实际计算不符。本文通过两个例子,说明为什么需要分别检查任务完成度和报告忠实度,并追溯原始计算文件。 阅读全文 - Read more »
我喜欢的音乐 发表于 - Posted on 2026/02/06 编辑于 - Edited on 2026/02/27 字数 - Word count: 2.6k 阅读时间 - Reading time ≈ 9 mins. 阅读全文 - Read more »
Tennisbot (v7):多会话多 Agent 个人助手的架构与开发日志 发表于 - Posted on 2026/01/16 字数 - Word count: 3.3k 阅读时间 - Reading time ≈ 12 mins. Tennisbot v7 是一个基于 OpenAI Agents SDK 的多会话、多 Agent 个人助手。本文从入口与目录结构讲起,沿着 WebUI/CLI 两条执行链路下钻到会话存储、handoff、工具与多模态输入,记录它如何在“可自修”的约束下迭代到可用形态,并给出关键设计取舍与踩坑复盘。 阅读全文 - Read more »
使用codex进行Vibe-Coding的过程记录 - Process Log of Vibe-Coding with Codex 发表于 - Posted on 2025/10/12 编辑于 - Edited on 2025/10/26 字数 - Word count: 1.1k 阅读时间 - Reading time ≈ 4 mins. 阅读全文 - Read more »
干涉花纹 发表于 - Posted on 2025/09/02 编辑于 - Edited on 2025/09/20 字数 - Word count: 115 阅读时间 - Reading time ≈ 1 mins. 阅读全文 - Read more »
夏末 发表于 - Posted on 2025/08/28 编辑于 - Edited on 2026/03/17 字数 - Word count: 104 阅读时间 - Reading time ≈ 1 mins. 阅读全文 - Read more »