我发现有几个非常有趣的结论。
0 、harness 基本不影响模型表现。
1 、文章中的模型,在别家 harness 中表现比自家更好……
2 、Pi 的效率最高。
3 、综合完成度 CC 最高,但是代价是接近 Pi 两倍的 token 消耗量。
我发现有几个非常有趣的结论。
0 、harness 基本不影响模型表现。
1 、文章中的模型,在别家 harness 中表现比自家更好……
2 、Pi 的效率最高。
3 、综合完成度 CC 最高,但是代价是接近 Pi 两倍的 token 消耗量。
1
Tink 2h 39m ago
我之前用几个任务测了 Pi 和 CC,发现 Pi 确实非常省 token,但是质量一言难尽,问了几轮都达不到点子上,没办法换成 CC 一轮过去,然后又切回 Pi 继续干。
后面就是优先用 Pi,解决不了的,切到 CC 干完再切回去 |
2
longaiwp 2h 26m ago
其实从这个测评来看,国产模型用 CC 还是很有道理的
|
4
yh7gdiaYW 1h 13m ago
这两个评测集选择的非常差,SWE-bench Lite / Terminal-Bench 2 这俩在训练时已经污染了,pi 在新一点的评测集和实际项目表现中没有这么好
|
5
yh7gdiaYW 1h 10m ago
Terminal-Bench 2 的结果稍微正常点,SWE-bench Lite 的结果真是离了大谱,O/A 家的模型在对方的 harness 里居然跑分更高...我要是跑出这么个结果,不"优化"下数据都不敢拿出来
|
6
sentinelK OP |