LLM 判分的稳定性与准确性
使用 LLM 判分时,通常会重复运行几次,检查分数或问题条数是否稳定。但稳定性与准确性是两件事。模型也可能稳定地漏掉同一个问题。
在两个计算化学任务上,三个判分模型分别进行了两类审查:只读报告、核对固定清单;读取报告和运行轨迹,自行查找证据。
实验涉及 12 个被评模型。清单审查计划对每份报告重复三次,轨迹审查重复两次;未提交报告或缺失的评审记录不计入对应统计。
重复评审是否一致
比较两次评审时,除了问题数量,还可以看它们是否发现了相同的问题。这里使用 Jaccard,即两次发现集合的交集大小除以并集大小。
例如,两次评审各发现 6 个问题,其中 4 个相同,合起来一共是 8 个不同问题,Jaccard 就是 4/8=0.5。两次条数完全相同,内容却只有部分重合。
按本次实验的条目匹配规则,结果如下:
| 审查方式 | 内容 Jaccard |
|---|---|
| 报告与固定清单核对 | 0.78–0.81 |
| 报告与运行轨迹核对 | 0.44–0.60 |
固定清单限制了检查范围,因此更容易得到相近的结果。但部分清单条目对几乎所有报告都被判为“不满足”。这可以说明普遍缺项,却未必有助于区分报告质量。
清单本身也需要审核。要求是否与任务目标有关、能否仅凭报告判定、是否把可选分析写成了硬性要求,都会影响结果。如果清单漏掉了重要检查项,重复运行也很难补上这个缺口。
轨迹审查的自由度更大。模型自行决定看哪些文件、是否检查解析脚本、查到什么程度就停止,因此两次运行可能找到不同的问题。
注:Jaccard 描述的是发现内容的重合程度,不是判断正确率。
共同遗漏与人工核验
一份报告称所有结构的虚频数为零,但原始输出中存在 −110.22 cm⁻¹ 的频率。三个判分模型的相关运行均未指出这一矛盾。
这里需要核实的是报告是否如实描述输出。至于该虚频对应什么运动、是否需要重新优化,还需要进一步检查振动模式,不能仅凭“出现了负数”就完成全部科学判断。
因此,多次评审一致也不能替代原始文件核验。比较判分模型时,需要准备一组已经核实的问题,检查模型能否命中,并抽查它额外提出的问题是否成立。人工记录也可能出错,同样需要保留证据位置。
本次复盘从人工记录中选取了 13 条报告与实际执行不符的问题,逐条回查原始文件。三个判分模型至少一次命中的数量分别为 12、6、11 条。这说明它们对这组已知问题的覆盖存在差异,但不能直接视为对全部错误的召回率,更不能代替误报检查。
人工评分也有尺度差异。对于“报告称无虚频,实际存在虚频”的同类问题,不同审核者分别扣了 4、3、20 分。因此,比较模型与人工的一致性时,最好先比较双方是否确认了同一个事实,再比较扣分尺度。
比较条件与使用方式
此外,本次实验中,不同判分模型使用了不同的运行框架。框架会影响工具调用和文件访问,因此发现问题数量的差异,不能全部归因于模型能力。
重复次数和归并规则也应保持一致。增加运行次数后,“至少一次发现”的比例通常会提高;改动问题匹配规则,也会改变内容 Jaccard。不同设置得到的数值不宜直接放在一起排名。
目前更合适的做法,是结合重复评审、问题归并和人工抽查。稳定性可以作为一个指标,但不足以单独决定使用哪个模型判分。