sentinelK
V2EX  ›  DeepSeek

deepseek-flash 的第三方跑分趣闻

  •  
  •   sentinelK · 6h 33m ago · 488 views

    这次的 flash-v4.1 的第三方跑分释放了,数据源如下: https://artificialanalysis.ai/models/deepseek-v4-1-flash?pricing=blended-price#intelligence-breakdown ec8c111a-d4ac-4a9c-b666-e78156efa1ab-image.jpeg

    总体上是预期水平( artificialanalysis.ai 刚刚调整了整个总分的权重和算法),但是发现了个有趣的点,值得玩味。

    v4.1 的错误回答中,幻觉率非常大,也就是非常不懂装懂。 f03ec6d1-0474-403d-9464-a0ee8ebc5f43-image.jpeg

    幻觉率的公式是:错误答案 /(错误答案 + 部分答案 + 未尝试回答)也就是说,他有 96%的错误情形都是硬装。而不是放弃或者只回答一部分。

    这也就导致,v4.1 的平均任务花费 token 数,会更高(PS:GPT6 的平均 token 数确实很惊艳): 23b78075-c3d4-43b9-bf5e-9a8c30a7cf33-image.jpeg

    3 replies    2026-09-11 14:53:15 +08:00
    Insolitude
        1
    Insolitude  
       6h 10m ago via Android
    还真有这种感觉,用的自部署的 deepseek v4 flash ,在 Claude code 这种比较克制的 harness 上,容易代码没理清就开始提修复。到了 dsh 上,就比较奔放,问一个问题要从盘古开天辟地开始读代码,好处是确实看得比较透,坏处是 token 用量体感是 Claude 的 2-3 倍。
    loveqianool
        2
    loveqianool  
       5h 36m ago via Android
    这上面怎么没有豆包呀。
    sentinelK
        3
    sentinelK  
    OP
       5h 31m ago
    @loveqianool 这个有个筛选条件,你可以自选筛选哪些模型进入表格。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2778 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 25ms · UTC 12:24 · PVG 20:24 · LAX 05:24 · JFK 08:24
    ♥ Do have faith in what you're doing.