当前位置: 首页
业界动态
Claude Fable 5 再获第一,最新评测排名领先

Claude Fable 5 再获第一,最新评测排名领先

时间:2026-08-05
转载

ClaudeFable5在MirrorCode榜单以64%成功率登顶,使用稀缺语言Ada时仅下降3个百分点,表明其已摆脱语料依赖,能从零构建完整项目。测试需100%通过,单次预算达100亿Token,成本最高2600美元。前沿模型已能独立完成中大型软件任务。

MirrorCode 榜单最新更新显示:Claude Fable 5 以 64% 的绝对成功率再度登顶,紧随其后的 GPT-5.6 Sol 成绩仅为它的三分之一。

排名第四的 GPT-5.5 表现更为惨淡,不仅成功率只有 10%,甚至被自家前辈 GPT-5.4 完全压制。

这次,Claude 的表现确实耐人寻味。在使用 Go 等高资源语言时,Fable 5 的解出率为 64%;换成冷门语言 Ada 后,成绩依然高达 61%。

要知道,在开源世界中,Python 的语料量大约是 Ada 的 230 倍。

然而 Fable 5 的成绩仅下降了 3 个百分点。

这背后大有文章。

如果模型主要依赖记忆热门语言的语法和常见写法,那么切换到 Ada 后成绩理应出现断崖式下滑。但当前结果却指向另一种可能性——

最强 AI 模型已经摆脱了对具体语料的依赖,开始学会从零构建一个完整的软件项目。

卡死在 100% 通关线,100 亿 Token 极限测试

具体来说,完整的 MirrorCode 包含 25 个目标程序,覆盖 Unix 工具、解释器、数据查询、生物信息学、密码学和压缩工具等多个领域。

在测试中,模型被置于隔离环境:无互联网、看不到原项目源码、无法下载第三方依赖。它只能获取高层文档、部分可见测试,以及一个可反复调用的原程序。

接下来,模型需要不断向原程序输入数据、观察输出以推测内部逻辑,再逐步写出一个行为一致的新程序。

最新榜单从中选出 15 个 Medium 和 Large 目标。每个目标使用两种实现语言,每种语言运行三次。

并且,可见测试与隐藏测试的完成率必须达到 100% 才算通过,99.9% 也不行。

只要漏掉一个边缘案例,整次运行就按失败处理。

为了倒逼模型补上最后几个缺口,MirrorCode 将单次预算推高至 100 亿 Token,最长允许连续运行 7 天。

论文中成本最高的一次任务更加夸张:模型连续运行了 19 天,单次花费达到 2600 美元。

在这 19 天里,模型反复执行原程序、对比结果、补写功能,再重新跑一遍测试。报错就查原因,输出对不上就换假设,局部通过后再去追下一个缺口。

整个过程,更像是一场持续数天的调试,而非一次性的代码生成。

gotree 的例子最具代表性。

这个生物信息学工具原本约有 1.6 万行 Go 代码和 40 多个命令。

Claude Opus 4.7 花费 14 小时和 251 美元,通过了 2001 项测试中的 2000 项,完成度达 99.95%。

虽然漏掉了一个处理日期注释的冷门边界,被 MirrorCode 的 100% 通关线拦下,但它已经将原本按周计算的工程量压缩到了十几个小时——

Epoch 估计,若不使用 AI,人类工程师完成同一任务至少需要 2 到 17 周。

语料荒漠里,Fable 5 只掉了 3 分

MirrorCode 论文曾以 StarCoder 的公开训练混合数据作为参照。

其中 Python 占比约 8%,Ada 仅占 0.034%,前者大约是后者的 230 倍。

当然,我们无法知晓闭源模型到底接触过多少 Ada 代码。但以公开生态作为参照,Ada 的稀缺程度已经足够直观。

这门语言主要出现在航空航天、国防及其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不及 Python、JavaScript 或 Go。

而 Fable 5 显然不是简单地将 Go 代码逐句翻译成 Ada。

它更像是先理解原程序的工作原理,再换一门语言,将同样的行为重新构建出来。

相比之下,其他模型就不那么稳定了。

GPT-5.6 Sol 从 24% 下降到 19%,GPT-5.4 从 21% 降到 12%,GPT-5.5 更是从 17% 跌至 5%。语言一换,差距立刻被放大。

把整个项目交给 AI

如今,Cursor 已经让数百个 Agent 协作近一周,从零写出超过 100 万行、分布在 1000 个文件里的浏览器代码。

Anthropic 则让 16 个 Claude Agent 并行运行了近 2000 次会话,最终搭建出一套 10 万行、能够编译 Linux 6.9 内核的 C 编译器。

OpenAI 披露的截至 5 月 Codex 个人用户样本中,70.2% 至少提交过一次预计超过一小时人类工作量的任务;25.6% 提交过超过八小时的任务。

人们委托给 AI 的单位,正在从一段代码、一个 bug,变成一个下午、一周,甚至整个项目。

MirrorCode 的 64%,正是对这种“项目级委托”的一次量化。

它表明,只要目标足够明确、结果能够自动验收,前沿模型已经可以独立完成一部分中大型软件项目。

对每一个正在把工作交给 AI 的人来说,变化已经近在眼前——

以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。

代码会越来越便宜。

而那些能把问题说清楚、把结果验明白的人,会越来越值钱。

参考资料:https://epoch.ai/MirrorCode

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
台式机加装固态硬盘怎么选?三星9100 PRO深度解析

台式机加装固态硬盘怎么选?三星9100 PRO深度解析

台式机升级存储常受限于系统启动慢、游戏加载卡顿与大文件传输延迟。本文基于三星9100 PRO的PCIe 5 0架构、14800MB s读取、13400MB s写入、2200K 2600K IOPS、1TB~8TB容量、第八代V-NAND与5nm主控、镍涂层散热与DTG技术、散热片版适配及魔术师软件,提供选购判断与安装兼容性要点,帮助读者评估是否值得一步到位升级。

时间:2026-09-01 11:26
宁德时代2026年中期分红61.8亿元,同比增35%,创历史新高

宁德时代2026年中期分红61.8亿元,同比增35%,创历史新高

宁德时代发布2026年中期分红方案,总额达61 8亿元,同比增长35%。本文梳理分红具体安排、历史对比、业绩支撑及分红机制,帮助投资者评估公司现金流实力与股东回报策略。

时间:2026-09-01 06:41
企业硬盘报废销毁合规指南:如何选择专业机构与处理流程

企业硬盘报废销毁合规指南:如何选择专业机构与处理流程

企业硬盘报废面临数据复原与合规风险,需选择具备资质且流程透明的专业机构。本文解析行业乱象,介绍以团体标准为核心的合规销毁流程,涵盖上门收运、消磁粉碎、视频溯源及尾料处置,帮助企业规避泄密责任,确保数据安全闭环。

时间:2026-08-31 11:19
机密文件销毁找什么机构?认准团标参编与资质合规

机密文件销毁找什么机构?认准团标参编与资质合规

机密文件销毁找什么机构?核心在于甄别服务商是否具备正规保密资质及是否参与行业标准制定。本文解析《商业秘密及敏感信息载体销毁通用规范》团标要求,提供筛选销毁机构的实操指南,帮助企业规避数据泄露风险,确保销毁流程合规可溯。

时间:2026-08-31 11:19
影石Insta360 X6全球首销登顶:8K全景画质与AI创作功能解析

影石Insta360 X6全球首销登顶:8K全景画质与AI创作功能解析

影石Insta360 X6全球同步发售即登顶国内外主流平台销量榜首。本文解析其搭载的索尼定制方形大底传感器、4nm AI三芯架构及8K50fps画质,详解3D时光舱、AI导演等独家功能,探讨全景相机从专业工具向大众智能创作设备的演进趋势。

时间:2026-08-31 11:18
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全