• 请不要在回答技术问题时复制粘贴 AI 生成的内容
sentinelK
V2EX  ›  程序员

“马鞍税”,一篇非常有意思的 harness 横比文章

  •  
  •   sentinelK · 3h 29m ago · 1092 views

    https://harnesstax.github.io/

    46985516-e0e0-4fdb-850a-42080de8334c-image.jpeg

    我发现有几个非常有趣的结论。

    0 、harness 基本不影响模型表现。

    1 、文章中的模型,在别家 harness 中表现比自家更好……

    2 、Pi 的效率最高。

    3 、综合完成度 CC 最高,但是代价是接近 Pi 两倍的 token 消耗量。

    6 replies    2026-09-17 15:47:27 +08:00
    Tink
        1
    Tink  
       2h 39m ago
    我之前用几个任务测了 Pi 和 CC,发现 Pi 确实非常省 token,但是质量一言难尽,问了几轮都达不到点子上,没办法换成 CC 一轮过去,然后又切回 Pi 继续干。

    后面就是优先用 Pi,解决不了的,切到 CC 干完再切回去
    longaiwp
        2
    longaiwp  
       2h 26m ago
    其实从这个测评来看,国产模型用 CC 还是很有道理的
    sentinelK
        3
    sentinelK  
    OP
       2h 23m ago
    @longaiwp 千问系列就明确官方跑分都是 claude code 环境,反正模型结构注定放弃响应速度了,不如提高跑分上限。
    yh7gdiaYW
        4
    yh7gdiaYW  
       1h 13m ago
    这两个评测集选择的非常差,SWE-bench Lite / Terminal-Bench 2 这俩在训练时已经污染了,pi 在新一点的评测集和实际项目表现中没有这么好
    yh7gdiaYW
        5
    yh7gdiaYW  
       1h 10m ago
    Terminal-Bench 2 的结果稍微正常点,SWE-bench Lite 的结果真是离了大谱,O/A 家的模型在对方的 harness 里居然跑分更高...我要是跑出这么个结果,不"优化"下数据都不敢拿出来
    sentinelK
        6
    sentinelK  
    OP
       58 mins ago
    @yh7gdiaYW 可能是跟 claude code 接入 GPT 模型需要代理有关,代理还是有信息损失和额外干扰。

    不过这个结果确实有点娱乐效果。太逗了。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5319 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 24ms · UTC 08:46 · PVG 16:46 · LAX 01:46 · JFK 04:46
    ♥ Do have faith in what you're doing.