刚刚!Claude Fable 5,又拿第一了
(来源:新智元)

新智元报道

Claude这次,真把AI编程榜单打出断层了!
就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。
紧追其后的GPT-5.6 Sol,分数只有它的三分之一!
排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。

更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。
要知道,在开源世界里,Python语料大约是Ada的230倍。
但到了Fable 5这里,成绩居然只下降3个百分点。

这就有意思了。
如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。
而现在的结果,却指向另一种可能——
最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。
卡死在100%通关线
100亿Token极限测试
具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。
在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。
接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一点点写出一个行为一致的新程序。
最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。
并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。
只要漏掉一个边缘案例,整次运行仍然按失败计算。

为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。
论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。
在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。
整个过程,更像一场持续数天的调试,而不是一次生成。

gotree的例子最直观。
这个生物信息学工具原本有大约1.6万行Go代码和40多个命令。
Claude Opus 4.7花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%。
虽然漏掉了一个处理日期注释的冷门边界,被MirrorCode的100%通关线拦了下来,但它已经把原本按周计算的工程量,压进了十几个小时——
Epoch估计,如果不使用AI,人类工程师想要完成同一任务至少需要2到17周。
语料荒漠里,Fable 5只掉了3分
MirrorCode论文曾用StarCoder的公开训练混合作为参照。
其中Python约占8%,Ada只有0.034%,前者大约是后者的230倍。

当然,我们无法知道闭源模型到底见过多少Ada代码。但拿公开生态作参照,Ada有多稀缺已经足够直观。
这门语言主要出现在航空航天、国防和其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不能与Python、JavaScript或者Go相比。
而Fable 5显然不是在把Go代码逐句翻译成Ada。
它更像是先摸清原程序究竟怎么工作,再换一门语言,把同样的行为重新造出来。

相比之下,其他模型就没这么稳了。
GPT-5.6 Sol从24%降到19%,GPT-5.4从21%降到12%,GPT-5.5更是从17%掉到5%。语言一换,差距立刻被放大。
把整个项目交给AI
如今,Cursor已经让数百个Agent协作近一周,从零写出超过100万行、分布在1000个文件里的浏览器代码。
Anthropic则让16个Claude Agent并行跑了近2000次会话,最终搭出一套10万行、能够编译Linux 6.9内核的C编译器。
OpenAI披露的截至5月Codex个人用户样本中,70.2%至少提交过一次预计超过一小时人类工作量的任务;25.6%提交过超过八小时的任务。
人们交给AI的单位,正在从一段代码、一个bug,变成一个下午、一周,甚至整个项目。
MirrorCode的64%,正是对这种「项目级委托」的一次量化。
它说明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立做完一部分中大型软件。
对每一个正在把工作交给AI的人来说,变化已经近在眼前——
以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。
代码会越来越便宜。
而那些能把问题说清楚、把结果验明白的人,会越来越值钱。
参考资料:
https://epoch.ai/MirrorCode
编辑:摩西
相关推荐
规则越多,AI 越蠢?Claude Code 核心工程师自曝 Fable 5 最强用法
小米罗福莉称Fable 5为阶段性成果,世界模型处早期
跨越安全红线后重启:Anthropic Fable 5全面接入GitHub Copilot,押注长周期自主编程
Claude Code 80%的提示词说删就删,Anthropic用Fable 5打了个样:AI行业的“降本”才刚刚开始
低成本复刻Fable 5的路找到了:OrcaRouter多模型组队,性能反超
千问Qwen3.8官宣!2.4T参数开源,直指Fable 5
500 家企业逃离 Claude,DeepSeek 把 token 价格打穿了!
全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型
阿里全面禁用Claude,禁令于7月10日正式生效
K3发布48小时,服务器满载、英伟达暴跌、Anthropic连夜改订阅
网址: 刚刚!Claude Fable 5,又拿第一了 https://www.xishuta.cn/newsview152251.html
推荐科技快讯
- 1问界商标转让释放信号:赛力斯 95792
- 2报告:抖音海外版下载量突破1 25736
- 3人类唯一的出路:变成人工智能 25175
- 4人类唯一的出路: 变成人工智 24611
- 5移动办公如何高效?谷歌研究了 24309
- 6华为 nova14深度评测: 13155
- 7滴滴出行被投诉价格操纵,网约 11888
- 82023年起,银行存取款迎来 10774
- 9五一来了,大数据杀熟又想来, 9794
- 10手机中存在一个监听开关,你关 9519
