烧掉 5000 亿 token,让 Agent 反编译一款射击游戏
开发者 Maurice 用 Claude 和 Codex 订阅跑了三个月:先是 4 个 Agent,最后 16 个并行。前期代码看着很美、语义却全错,直到改成「逐字节比对原编译结果」的硬验证,99% 的函数还原,83% 字节级一致。
为什么重要 他的结论很扎心:别靠 Agent 互相评审,给它一个只会说 PASS 或 FAIL 的验收器;便宜的小模型有了硬反馈,一样能干大活。HN 上已有 50 多分、30 多条讨论。
开发者 Maurice 用 Claude 和 Codex 订阅跑了三个月:先是 4 个 Agent,最后 16 个并行。前期代码看着很美、语义却全错,直到改成「逐字节比对原编译结果」的硬验证,99% 的函数还原,83% 字节级一致。
为什么重要 他的结论很扎心:别靠 Agent 互相评审,给它一个只会说 PASS 或 FAIL 的验收器;便宜的小模型有了硬反馈,一样能干大活。HN 上已有 50 多分、30 多条讨论。