JoeJoeJoe
70.46D
V2EX  ›  OpenAI

7 月 9 日, OpenAI 主动承认用于代码评测的 SWE-Bench Pro 有约 30% 的任务有缺陷,导致分数失真,不再推荐它作为前沿模型的主要评测标准

  •  
  •   JoeJoeJoe ·
    PRO
    ·
    HelloWorldImJoe · Jul 9 · 1091 views
    6 replies    2026-07-09 13:11:29 +08:00
    HHHans
        1
    HHHans  
       Jul 9
    是不是测完发现自己的 5.6 跑分打不过 Fable
    loveshuyuan
        2
    loveshuyuan  
       Jul 9
    打不过 = 测试用例有问题
    diudiuu
        3
    diudiuu  
       Jul 9
    大家都有 30% = 没有缺陷
    zhmouV2
        4
    zhmouV2  
       Jul 9
    xai 发 grok4.5 的 benchmark 里面 SWE Pro 5.5xhigh 打不过 glm5.2
    JoeJoeJoe
        5
    JoeJoeJoe  
    OP
    PRO
       Jul 9
    @HHHans
    @loveshuyuan
    @diudiuu
    @zhmouV2

    哈哈哈哈 打不过 = 测试用例有问题, 一琢磨好像也能说的通.
    paopjian
        6
    paopjian  
       Jul 9
    我就好奇他们这测试集发出来没做过人工审查么, 没审查过也敢做指标, 现在好怕各种模型把测试集都练了, 那评估个屁
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   868 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 32ms · UTC 20:40 · PVG 04:40 · LAX 13:40 · JFK 16:40
    ♥ Do have faith in what you're doing.