代表严谨操作基准测试的 Perslis 机器鳄鱼

运行时 · 基准测试

我们衡量的是一具身体,而非一颗头脑。

一个单次准确率分数衡量的是一个罐子。Perslis 的评分标准是:工作能否可靠地被完成——并且持续保持完成状态。

摘要

大多数模型基准测试报告的是在固定测试集上的首次准确率。那告诉你的是关于一颗头脑的事。它对以下问题只字未提:一个运维运行时能否可靠地完成一项任务、能否避免交付一个错误答案,以及是否以你愿意支付的成本做到。Perslis 在留出的任务上,由它自己的符号层评判,用四项运维指标来评估。我们完整公开方法论;数字来自可复现的实时运行,而非凭空断言。

各项指标

每项指标针对运行时辜负操作者的一种不同方式——不只是「答案对不对」,而是「工作到底有没有完成、是否被错误地宣告完成,以及它花了多少成本」。

1 · 已验证的完成率

运行时完成并独立验证的任务所占比例——测试已运行、不变量已成立、证据已封存。一个貌似合理但未经验证的答案计为失败,而非部分完成。这是头条数字,它被刻意设计得比首次准确率更难。

2 · passk — 重复下的可靠性

在 k 次独立尝试中每一次都通过的任务所占比例。一具身体必须可依赖,而不是靠运气:三次里成功一次的运行时不具备运维能力。passk 像生产环境那样惩罚方差。

3 · 错误割接率

针对遗留系统重建与迁移:运行时把一个结果宣称为「等价」或「已完成」而实际上并非如此的频率。目标定为。一个被交付的错误「是」比一个缓慢的「否」更糟,因此该指标被相应地加重——符号预言机的存在正是为了把它压下去。

4 · 成本对结果之比

每个已验证、已部署结果所消耗的 token 与美元——而非每次 API 调用。这是操作者真正支付的指标,它鼓励在简单步骤上调用廉价模型,只在昂贵模型真正物有所值的地方才用它们。

测试框架

结果

测试框架已就位;下表的数据会随着实时运行的完成而填充。我们宁愿展示一个空白单元格,也不愿给出一个我们无法为之背书的数字。

指标Perslis(最佳选路)单一前沿模型,无运行时
已验证的完成等待实时运行等待实时运行
pass5等待实时运行等待实时运行
错误割接率目标:0等待实时运行
成本对结果之比等待实时运行等待实时运行
这个主张并不是「我们的模型更聪明」。而是「同一个模型,给它一具身体,就能完成更多工作、交付更少错误答案」。这正是这些数字被设计出来所要证明的。

为什么这套衡量方式会胜出

随着模型智商走向商品化,首次成绩榜趋于收敛——每个人的头脑差不多一样聪明。剩下的差距在于运维层面:谁能可靠地完成、谁能避免那个自信的错误、谁能以可负担的方式做到。这些都是身体指标,也正是企业会为之买单的那些。Perslis 就是为了在持久优势所在之处被精确衡量而打造的。