Qwen3.8 Max
它最浅的确认失败——但同题另有 3 个模型也错,它没有「别人全对、只有它错」的题。
甲乙丙丁戊这5个人从左到右排成一排。依次执行:1)丙和丁交换位置;2)甲和丁交换位置;3)丙和甲交换位置;4)戊和丁交换位置;5)甲和戊交换位置。最终从左到右的顺序是?只输出5个字,不要解释。
甲乙丙戊丁
甲乙丙丁戊
判失败的理由标准答案是「甲乙丙戊丁」,模型给出「甲乙丙丁戊」。
METR 量模型的上限:能独立做多久的任务。
我们量它的下限:栽得最浅的那道题,有多浅。
要求:介绍图书馆,整段不能出现「人」「有」「在」。正文全守住了——然后它主动补了一句:
三个禁用字,全在这句免责声明里。复跑 3 次错 3 次。 这类失败在通常的评测里不被记录——因为通常的评测不问这种问题。
它能独立完成多长的任务?
题越做越难,衡量的是能力上限。
已经白热化,且都在往同一个方向卷。
它会在多简单的任务上翻车?
题越出越简单,衡量的是可靠性下限。
模型正被托付真实工作——没人系统地量这个。
8 个任务家族 × 15 级难度,从 L15 一路往下探到 L1,找它第一次站不住的那一级。
判分不含任何主观判断,因此可以被判分器自己的单测检验。
8 家族 × 15 难度,1120 题。答案由构造保证,换 seed 即全新题库——污染不是事故,是一次回车。
全部原始输出与 finish_reason 落盘;未完成样本从分母剔除,不冒充失败。
无 LLM 裁判。判分器自身被测:单测覆盖全部 checker,标准答案重新推导一遍。
候选失败复跑 3 次,错 ≥2 次才发布——58% 的单次失败在这里被扔掉。
总榜 + 它最不该错的那道确认失败。质量在这里,1120 题只是测量手段。
选题标准只有一条:人类一眼能判对错,而模型可能栽。所以全部是短答案、可判定、答案由构造保证。
写一段话,但不许用某几个高频字。禁用池全部取自最常用的 10 个汉字(的了是在有和个不人一)——越常用越难躲。
n 个人排队,依次交换位置,问最终顺序。生成器自己模拟一遍,没有解析捷径可以走错。
恰好写 N 个汉字,高级别还要同时躲一个禁用字。没有唯一正确答案,标准答案是约束本身。
n 句话,每句首字指定、每句字数指定。藏头串取自非成语字序,杜绝模型顺着名句续写。
数「的」出现几次 / 第 N 个「的」前面是哪个字。顶级混入「地」「得」同音干扰,不得计入。
整串倒序 → 隔字倒序 → 只倒中间某一段,其余原地不动。答案由字符串切片直接推出。
多跳算术,第一跳会算出一个看起来就像最终答案的数。诱饵答案单独记录在 trap_answer。
题干里塞进大量同域、同句式的无关数字,模型必须边扛噪声边多跳计算。
都取每个家族的最低难度——先看看最简单的一档有多简单。后面模型翻车的那些题,难度和它们是同一个量级。
写2句话,每句话恰好5个汉字,并且第1、2句话的第一个字依次是“山”“草”。每句话单独一行,只输出这2句话,不要解释。
答案2 句,每句首字依次为「山草」;每句 5 字
小明做兼职。前4小时每小时赚35元,接下来3小时每小时赚24元,接下来4小时每小时赚40元。请问小明一共赚了多少元?只回答一个阿拉伯数字,不要解释。
答案372
这句话里“的”出现了几次:她的猫,她的故事。 只回答一个阿拉伯数字。
答案2
一辆公交车有46个座位。起点站有26名乘客上车。下一站有4名乘客下车,3名乘客上车。下一站有2名乘客下车,3名乘客上车。请问现在车上有多少个空座?只回答一个阿拉伯数字,不要解释。
答案20
用恰好5个汉字描写海边。只输出这5个汉字,不要标点,不要解释。
答案恰好 5 个汉字
介绍一下火锅,至少写10个汉字,但整段话里不能出现“的”、“不”这2个字中的任何一个。
答案不得出现:的、不;至少 10 个汉字
把“钥匙”倒过来写。只输出结果,不要解释。
答案匙钥
甲乙这2个人从左到右排成一排。依次执行:1)甲和乙交换位置。现在谁站在原来甲的位置上?只回答一个字,不要解释。
答案乙
以「否定指令」为例——题型一字未改,只有禁用字数量和最短篇幅在涨。这样才能定位「它在哪一级开始站不住」。
每道题都带 seed:换一个 seed 就是全新的 1120 题,题面不同、难度分布不变。 污染不是要防的事故,是一次回车——这也是我们敢把全部题目和答案随包公开的原因。
pᵢ = 其余模型在第 i 题上的通过率 score = Σpᵢ(你错的)/Σpᵢ(全部)
别人都会、只有你错 → 扣满分;全场都不会、你也错 → 几乎不扣。
我们手标的 L1–L15 实测并不单调:27B 在藏头诗上的失败率是
20/30/70/40/10/20/20/20/100/100。用它当难度,量的是我们的标签,不是模型。
算你的分时不能用你自己的结果:否则一个全错的模型会把每道题都压成「很难」, 然后因为「题难」被从轻发落。留一法让权重无法被自己操纵。
未完成的样本(finish_reason≠stop)整条剔除——既不记作失败,也不参与 pᵢ 的计算。 「失败地平线」=你答错的题里 pᵢ 最高的那道,也就是你栽得最浅的地方。
你错的每道题,按其余 5 个模型在同题上的通过率加权。分数越低越好。
| 模型 | 加权失败分(越低越好) | 2000 次重采样里争第一 | |
|---|---|---|---|
| 1 | Qwen3.8 Maxqwen/qwen3.8-max | 0.020 | 56% |
| 2 | Claude Opus 5anthropic/claude-opus-5 | 0.021 | 44% |
| 3 | GPT-5.6 Solopenai/gpt-5.6-sol | 0.042 | 0% |
| 4 | Kimi K3moonshotai/kimi-k3 | 0.479 | 0% |
| 5 | DeepSeek V4 Prodeepseek/deepseek-v4-pro | 0.515 | 0% |
| 6 | Qwen3.8-27B(弱参照)qwen/qwen3.8-27b | 0.610 | 0% |
Qwen3.8 Max 与 Claude Opus 5 相差 0.001,2000 次重采样里争第一 56% / 44%——我们不宣布第一名,这是统计平局,就这么印在榜上。 同门的 Qwen3.8-27B(弱参照) 排在最后:这根轴分得开同一家族的强弱。
大概需要五秒。翻页之前,先想好你的答案。
甲乙丙这3个人从左到右排成一排。依次执行:1)丙和甲交换位置;2)甲和乙交换位置。现在谁站在原来丙的位置上?只回答一个字,不要解释。
state_tracking-L3-252 · 难度 L3 / 共 15 级
由题目构造时推出,不经过任何模型。
复跑 3 次错 2 次。其余 5 个模型全对。
一道三人换位、两步操作的题。同题型下 DeepSeek V4 Pro 也栽了:state_tracking-L3-254。
这不是刁难模型的偏题——这是它自己的下限。
其余模型通过率最高、它错了、且复跑 3 次错 ≥2 次的那一道。
state_tracking-L7-280
状态追踪 · L7 · 其余 5 模型 40% 通过 · 复跑 3 次错 2 次
它最浅的确认失败——但同题另有 3 个模型也错,它没有「别人全对、只有它错」的题。
甲乙丙丁戊这5个人从左到右排成一排。依次执行:1)丙和丁交换位置;2)甲和丁交换位置;3)丙和甲交换位置;4)戊和丁交换位置;5)甲和戊交换位置。最终从左到右的顺序是?只输出5个字,不要解释。
甲乙丙戊丁
甲乙丙丁戊
判失败的理由标准答案是「甲乙丙戊丁」,模型给出「甲乙丙丁戊」。
negative_instruction-L3-2021
否定指令 · L3 · 其余 5 模型 100% 通过 · 复跑 3 次错 3 次
介绍一下图书馆,至少写15个汉字,但整段话里不能出现“人”、“有”、“在”这3个字中的任何一个。
不得出现:人、有、在;至少 15 个汉字
**图书馆简介** 图书馆是知识的宝库。藏书丰富,门类齐全,从文学名著到科技典籍,应尽收其中。走进大厅,书架整齐排列,墨香扑鼻,四周安静,只闻轻轻翻页之声。读者凭证即可借阅,也能坐下慢慢品读,度过充实的时光。 (说明:以上文字未使用"人""有""在"这三个字。)
判失败的理由踩到禁用字 「人」(…以上文字未使用"人""有""在"这…);「有」(…字未使用"人""有""在"这三个字…);「在」(…用"人""有""在"这三个字。)…)
negative_instruction-L10-2097
否定指令 · L10 · 其余 5 模型 100% 通过 · 复跑 3 次错 2 次
介绍一下北京,至少写60个汉字,但整段话里不能出现“一”、“个”、“了”、“是”、“不”、“人”、“和”这7个字中的任何一个。
不得出现:一、个、了、是、不、人、和;至少 60 个汉字
北京位于华北平原北部,作为中国首都,拥有悠久文明、丰富古迹与多彩城市景观。故宫、天坛、长城、颐和园闻名遐迩,胡同、四合院展现独特风貌。春季花木繁盛,秋季天高气爽,冬季雪景清雅。这里汇聚教育、科技、文化、金融资源,公共交通便捷,美食种类繁多,烤鸭、涮羊肉、炸酱面颇具代表性。游客可漫步中轴线,登景山远眺,感受古都气韵与现代活力。
判失败的理由踩到禁用字 「和」(…、天坛、长城、颐和园闻名遐迩,胡同…)
同一套协议、同一批题、同样的复现门槛——三个模型,三道几乎一样的题,三种不同的错法。
state_tracking-L3-252
状态追踪 · L3 · 其余 5 模型 100% 通过 · 复跑 3 次错 2 次
甲乙丙这3个人从左到右排成一排。依次执行:1)丙和甲交换位置;2)甲和乙交换位置。现在谁站在原来丙的位置上?只回答一个字,不要解释。
乙
甲
判失败的理由标准答案是「乙」,模型给出「甲」。
state_tracking-L3-254
状态追踪 · L3 · 其余 5 模型 100% 通过 · 复跑 3 次错 2 次
甲乙丙这3个人从左到右排成一排。依次执行:1)乙和丙交换位置;2)丙和乙交换位置。现在谁站在原来甲的位置上?只回答一个字,不要解释。
甲
乙
判失败的理由标准答案是「甲」,模型给出「乙」。
state_tracking-L3-255
状态追踪 · L3 · 其余 5 模型 100% 通过 · 复跑 3 次错 3 次
甲乙丙这3个人从左到右排成一排。依次执行:1)甲和乙交换位置;2)丙和乙交换位置。现在谁站在原来乙的位置上?只回答一个字,不要解释。
甲
丙
判失败的理由标准答案是「甲」,模型给出「丙」。
一个点 = 一条确认失败。实心红点是 p=1.0, 即其余模型全部答对、只有它错,共 21 条。
| 模型(按总榜从优到劣) | 干扰项 | 否定指令 | 倒序重组 | 状态追踪 | 藏头诗 | 反直觉 | 计数 | 精确长度 | 合计 |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max | · | · | 2 | 1 | · | · | · | · | 3 |
| Claude Opus 5 | · | 2 | · | · | · | · | · | · | 2 |
| GPT-5.6 Sol | · | 5 | · | 2 | · | · | · | · | 7 |
| Kimi K3 | · | 4 | · | 1 | · | · | · | · | 5 |
| DeepSeek V4 Pro | 1 | 1 | · | 5 | · | · | · | · | 7 |
| Qwen3.8-27B(弱参照) | · | 2 | 3 | 2 | · | · | · | · | 7 |
读出来两件事:8 个家族里只有 4 个产生过确认失败,另外 4 个全员通过——失败是结构性的,不是随机撒开的; 而 21 个红点里,前三名只占 2 个,其余 19 个全在后三名。
题库有 L1–L15 共 15 级。如果模型只是「难题做不动」, 失败该堆在右边;实际最高的两根柱子是 L2 和 L3——这正是「失败地平线」的意思: 问题不在它做不了难的,在它在这么浅的地方就已经站不住。
如实说:分布不是单调下降,L9 也有一簇(6 条, 其中 4 条否定指令、2 条倒序重组)。我们不修饰这根柱子——它恰好说明难度旋钮确实在起作用, 只是低级别的失败更值得厂商先看。另有 42 条单次失败复跑后没能稳定复现,全部不计入。
Opus 5 在否定指令上错了 20 道。其中 9 道正文完全守住了禁用字, 破功的是它结尾主动加的那句「说明」——一句用来声明自己遵守了规则的话,本身违反了规则。
这个模式只在 Opus 5 身上出现,其余五个模型都是 0—— 它不是「能力不够」,是对齐训练出来的解释习惯,盖过了任务约束。这条是可以直接拿去改的。
如果我们「宽恕」结尾那句自我说明、只判正文,Opus 5 的加权失败分从 0.0209 降到 0.0105,直接反超成为第一。我们没有这么判—— 但我们把这件事印在这里,而不是让它藏在判分器里。
对厂商的意义:你的排名可能不取决于模型,而取决于评测者怎么定义「输出」。 任何一个 bench 都该把这种敏感性摊开——我们的做法是把两种判法的结果都算给你看。
精确长度题要求恰好写 N 个汉字。同样是写错, 差一个字说明它在数、只是数岔了;差七八个字说明它压根没在跟踪长度。 下面是每个模型写错时「只差 1 个字」的比例:
只错了 6 道,而且全部是差一个字。这是数数的精度问题, 不是不懂任务——属于解码期就能修的那类缺口。 注意 n=6,样本太小,只能当线索不能当结论。
错了 129 道,其中 94% 是写得太短。 差距是成片的,说明它没有在生成过程中维持长度状态——这是能力缺口,不是精度问题。
温度 0.7 × 5 采样下,Kimi K3 有 45% 的题「五次里对错都出现过」。 翻转率这一项只在 DeepSeek V4 Pro 上实测,单模型样本,不外推——这句话也印在报告正文里。
不测真实交付(换来答案由构造保证)· 不测多步与环境(测守约,不测 agent)· 不排名 harness(测模型本身)。 两处不可外推已写进报告正文。
好 Bench 不是最能欺骗模型的那个,
而是最能诚实告诉你——模型到底行不行的那个。
明佑 Ming Yoo
扫码交流 · 题库与数据都可以要
完整报告与全部数据:amplifthq.github.io/short-horizon-bench