Bun 用 11 天迁移 53 万行代码,AI 编程基准还可信吗?
16 万美元完成 3 个工程师一年的工作,但排行榜连谁更强都答不清楚。
Editor's Note
2026 年 5 月,Bun 创始人 Jarred Sumner 用 64 个 AI 实例,在 11 天内完成了 53 万行代码的语言迁移。6 个平台的测试全部通过,API 成本为 165,000 美元。按 Bun 的估算,这项工作原本需要 3 名工程师投入一年。
两个月后,OpenAI 审计 SWE-Bench Pro,发现其中 27%—34% 的任务存在设计缺陷,并撤回了对这套基准的推荐。GPT-5.6 在另一套编程基准中排名第一,在 SWE-Bench Pro 上却落后 Claude Fable 5 近 16 个百分点。
真实工程展示的能力越来越强,排行榜给出的答案却越来越不一致。市场需要重新判断:什么才是 AI 编程能力,以及这种能力值多少钱。
Bun 是一款每月下载量达到 2200 万次的基础开发工具,Claude Code 也建立在它之上。它拥有约 53 万行源代码。2025 年底,Anthropic 收购 Bun,创始人 Jarred Sumner 随后加入 Anthropic。
2026 年 5 月,Sumner 决定将 Bun 从 Zig 完整迁移到 Rust,以解决长期存在的稳定性问题。他没有为此另组工程团队,而是让 64 个 Claude Fable 5 实例并行工作,并设计了相互审查的质量控制流程。
11 天内,这些实例完成了 6502 次代码提交。6 个操作系统平台的测试全部通过,没有跳过任何测试。API 成本为 165,000 美元。
这是目前公开披露的最大规模 AI 代码迁移项目之一。
两个月后,OpenAI 发布了对 SWE-Bench Pro 的审计。这套基准从真实开源项目中抽取任务,用于测试模型能否提交通过验证的代码,也是目前最常用的 AI 编程基准之一。
过去 8 个月,前沿模型在这套基准上的最高分从 23.3% 升至 80.3%。但 OpenAI 的审计发现,其中 27%—34% 的任务存在设计缺陷:部分测试只接受一种实现方式,其他正确答案也会被判错;部分题目则遗漏了关键需求。OpenAI 因此撤回了对 SWE-Bench Pro 的推荐。
GPT-5.6 在两套基准中的相对排名完全不同。
在 Artificial Analysis Coding Agent Index 上,GPT-5.6 Sol 得分为 80,高于 Claude Fable 5 的 77.2;在 SWE-Bench Pro 上,GPT-5.6 的得分为 64.6%,Claude Fable 5 则为 80%。

同一个模型,在两套基准中得到相反的排名。如果排行榜无法稳定回答谁更强,SpaceXAI 以 600 亿美元收购 Cursor时,市场又该依据什么判断它的价值?