返回工程笔记
评测口径2026-09-091 分钟阅读

这个栏目写什么,以及不写什么

开栏说明。这里只发能复现的东西——每个数字带口径,每次口径更正都写清楚它对我们是有利还是不利。

这是占位文,用来说明栏目的定位与投稿口径。真正的第一批文章由团队来写。

只发能复现的东西

我们对外说过一句话:没有口径的准确率,不是一个数字。 那这句话就得有个兑现的地方。

一篇合格的文章至少要能回答:

  • 用的什么数据集、多少题、排除了哪些类别
  • 抽取模型、答题模型、判官模型分别是什么型号
  • 跑了几轮,轮与轮之间差多少
  • 如果给出对比,对手是我们自己跑的还是引用的自报值

拿不到这些的对比,我们不发。

口径更正也要写

改口径最容易被怀疑的地方,是「你是不是挑了对自己有利的算法」。

所以更正必须连同方向一起写:这次更正让我们的数字变高了还是变低了。 有一次我们把对抗题算进了分母,而业界五家 harness 全部排除它; 按业界口径重算之后,我们的绝对值降了,领先幅度反而略高。 两件事都要写出来,只写后者就是挑好听的说。

也写砸掉的事

系统出错不可怕,可怕的是出错了什么都不说。这个栏目会写那些静默失败: 不报错、不告警、跑批还「正常结束」,而结果是错的。

写它们不是为了显得坦诚,是因为这类问题只有被写下来才会被记住 —— 我们自己就是在把某次事故写进 README 之后,才给它加上护栏的。

不写什么

  • 不写没有落地代码的路线图
  • 不写拿不到口径的竞品对比
  • 不写客户的名字,除非对方明确授权

先在同一把尺子下跑一遍,再谈别的。

你有评测集,我们接进去跑;没有的话就用第三方统一 harness,判官与答题 prompt 都不由我们决定。两边都能复现的结果,才值得拿出来比。

© 2026 Reglos. 保留所有权利。