先声明:我是 [Tura]( https://github.com/Tura-AI/tura) 的维护者。这不是独立评测;完整方法、图表和公开产物在文末链接。想请大家重点挑一挑下面这个“按任务形态路由”的结论有没有遗漏。
我把 DeepSWE v1.1 的记录和一次 eza ( Rust → Python 、52 项检查)的行为兼容重写放在一起看。结论不是“Max 总是更强”,而是 Max 多买到了搜索、回滚、再试和 agent 回合;这些回合有没有价值,取决于任务剩下多少不确定性。
| 任务形态 | High | Max | 通过率变化 | 成本 |
| --- | ---: | ---: | ---: | ---: |
| 范围明确的修复( DeepSWE ,7 个) | 64.3% | 57.1% | **-7.1 个百分点** | 2.53x |
| 功能实现( DeepSWE ,95 个) | 70.2% | 74.6% | **+4.4 个百分点** | 2.43x |
| 仓库重写( eza ,3 个 harness ) | 78.8–89.4% | 92.3–94.2% | **+4.8–13.5 个百分点** | 2.27–3.27x |
113 个 DeepSWE 任务的总体平均是:High 69.4%、每任务 $3.47 ; Max 72.7%、每任务 $8.39 。也就是 **+3.3 个百分点,成本 2.42 倍**,输出 token 2.11 倍、输入 2.91 倍、时间 1.90 倍、步骤 1.66 倍。
所以我现在倾向的操作规则是:
1. 已经有 failing test 、定位范围较小的 bug ,先用 High ; High 失败且定位仍不确定再升级。
2. 常规功能实现也是 High 起步,除非一次失败的代价足以覆盖约 2.4 倍成本。
3. 大范围重写或迁移,Max 往往更有意义,因为兼容性、构建、测试和架构路径都还要探索。
4. Greenfield 目前只有“可能更适合 Max”的判断,没有配对的 High/Max 数据,别把它写成已证实结论。
需要强调两个边界:DeepSWE 的 7 个修复任务不足以证明“Max 会让修 bug 变差”; eza 的 High 是每个 harness 两次的均值,而 Max 是一次选定运行。数字适合做路由假设,不适合做万能默认值。
完整分析( 19 张表和原始图表): https://turaai.net/blog.html#is-gpt-5-6-sol-max-worth-it
复现数据: https://github.com/Tura-AI/benchmark/tree/main/blog_data/eza-replication-gpt56-max-20260717
如果大家有更合适的任务分桶、成本/通过率指标,或者认为这里的 DeepSWE 划分不够机械化,欢迎直接指出。更希望讨论“什么时候应该升级 effort”,而不是只比较某个模式的单点分数。
我把 DeepSWE v1.1 的记录和一次 eza ( Rust → Python 、52 项检查)的行为兼容重写放在一起看。结论不是“Max 总是更强”,而是 Max 多买到了搜索、回滚、再试和 agent 回合;这些回合有没有价值,取决于任务剩下多少不确定性。
| 任务形态 | High | Max | 通过率变化 | 成本 |
| --- | ---: | ---: | ---: | ---: |
| 范围明确的修复( DeepSWE ,7 个) | 64.3% | 57.1% | **-7.1 个百分点** | 2.53x |
| 功能实现( DeepSWE ,95 个) | 70.2% | 74.6% | **+4.4 个百分点** | 2.43x |
| 仓库重写( eza ,3 个 harness ) | 78.8–89.4% | 92.3–94.2% | **+4.8–13.5 个百分点** | 2.27–3.27x |
113 个 DeepSWE 任务的总体平均是:High 69.4%、每任务 $3.47 ; Max 72.7%、每任务 $8.39 。也就是 **+3.3 个百分点,成本 2.42 倍**,输出 token 2.11 倍、输入 2.91 倍、时间 1.90 倍、步骤 1.66 倍。
所以我现在倾向的操作规则是:
1. 已经有 failing test 、定位范围较小的 bug ,先用 High ; High 失败且定位仍不确定再升级。
2. 常规功能实现也是 High 起步,除非一次失败的代价足以覆盖约 2.4 倍成本。
3. 大范围重写或迁移,Max 往往更有意义,因为兼容性、构建、测试和架构路径都还要探索。
4. Greenfield 目前只有“可能更适合 Max”的判断,没有配对的 High/Max 数据,别把它写成已证实结论。
需要强调两个边界:DeepSWE 的 7 个修复任务不足以证明“Max 会让修 bug 变差”; eza 的 High 是每个 harness 两次的均值,而 Max 是一次选定运行。数字适合做路由假设,不适合做万能默认值。
完整分析( 19 张表和原始图表): https://turaai.net/blog.html#is-gpt-5-6-sol-max-worth-it
复现数据: https://github.com/Tura-AI/benchmark/tree/main/blog_data/eza-replication-gpt56-max-20260717
如果大家有更合适的任务分桶、成本/通过率指标,或者认为这里的 DeepSWE 划分不够机械化,欢迎直接指出。更希望讨论“什么时候应该升级 effort”,而不是只比较某个模式的单点分数。