运行时 · 基准测试
我们衡量的是一具身体,而非一颗头脑。
一个单次准确率分数衡量的是一个罐子。Perslis 的评分标准是:工作能否可靠地被完成——并且持续保持完成状态。
大多数模型基准测试报告的是在固定测试集上的首次准确率。那告诉你的是关于一颗头脑的事。它对以下问题只字未提:一个运维运行时能否可靠地完成一项任务、能否避免交付一个错误答案,以及是否以你愿意支付的成本做到。Perslis 在留出的任务上,由它自己的符号层评判,用四项运维指标来评估。我们完整公开方法论;数字来自可复现的实时运行,而非凭空断言。
各项指标
每项指标针对运行时辜负操作者的一种不同方式——不只是「答案对不对」,而是「工作到底有没有完成、是否被错误地宣告完成,以及它花了多少成本」。
1 · 已验证的完成率
运行时完成并独立验证的任务所占比例——测试已运行、不变量已成立、证据已封存。一个貌似合理但未经验证的答案计为失败,而非部分完成。这是头条数字,它被刻意设计得比首次准确率更难。
2 · passk — 重复下的可靠性
在 k 次独立尝试中每一次都通过的任务所占比例。一具身体必须可依赖,而不是靠运气:三次里成功一次的运行时不具备运维能力。passk 像生产环境那样惩罚方差。
3 · 错误割接率
针对遗留系统重建与迁移:运行时把一个结果宣称为「等价」或「已完成」而实际上并非如此的频率。目标定为零。一个被交付的错误「是」比一个缓慢的「否」更糟,因此该指标被相应地加重——符号预言机的存在正是为了把它压下去。
4 · 成本对结果之比
每个已验证、已部署结果所消耗的 token 与美元——而非每次 API 调用。这是操作者真正支付的指标,它鼓励在简单步骤上调用廉价模型,只在昂贵模型真正物有所值的地方才用它们。
测试框架
- 留出任务:运行时未曾见过的运维任务——代码变更、集成,以及具有已知正确结果的遗留系统重建。
- 符号裁判:由舰长(Captain)依据编码规则与封存的证据裁决通过/失败,因此评分不是模型给自己打分。
- 跨模型扫描:同一批任务在多个模型上运行,以表明运行时的贡献可与任何单一模型的智商分离开来。
- 可复现:每一个上报的数字都附带任务集、随机种子以及可重跑它的凭据。一个你无法复现的基准测试就是营销。
结果
测试框架已就位;下表的数据会随着实时运行的完成而填充。我们宁愿展示一个空白单元格,也不愿给出一个我们无法为之背书的数字。
| 指标 | Perslis(最佳选路) | 单一前沿模型,无运行时 |
|---|---|---|
| 已验证的完成 | 等待实时运行 | 等待实时运行 |
| pass5 | 等待实时运行 | 等待实时运行 |
| 错误割接率 | 目标:0 | 等待实时运行 |
| 成本对结果之比 | 等待实时运行 | 等待实时运行 |
为什么这套衡量方式会胜出
随着模型智商走向商品化,首次成绩榜趋于收敛——每个人的头脑差不多一样聪明。剩下的差距在于运维层面:谁能可靠地完成、谁能避免那个自信的错误、谁能以可负担的方式做到。这些都是身体指标,也正是企业会为之买单的那些。Perslis 就是为了在持久优势所在之处被精确衡量而打造的。