hachimen
V2EX  ›  OpenAI

感觉 codex 纯靠灌大量上下文来 reasoning

  •  
  •   hachimen · 4h 1m ago · 321 views

    codex 的 context compaction 比 claude code 频繁很多很多,并且一个问题必须指示它进行文献搜索或者 review 本地代码再回答,它的正确率才会高,否则一开口全是瞎编,还喜欢发散。

    最变态的是,codex 很喜欢乱发散,突然脑补出一个新的方向。更要命的是,紧接着和前面第一点联动,来一个 context compaction 。 一旦压缩完,codex 就把刚脑补出的东西,当作我要求他必须完成的主线任务了。非常逆天。我今天重置以后被它这个“特性”气了好几回了。发生了好几次“我没有要求你做过 xx”这样的对话。

    这一套组合拳比幻觉还恐怖。离开屏幕一会儿回来,就看到工程目录里多了一大堆压根不知道是什么的鬼东西,test 目录里的文件数量还蹭蹭蹭上涨。

    另一边我还在用 claude ,最让我感叹的是 claude 的第一直觉非常好,回答问题的第一句话的正确率非常高。尝试性的建议都必须要我一一确认(有点烦了已经),以及 claude 很喜欢反驳(但我感觉比 codex 这个全肯定 bot 好)。

    注:我用 agent 来写实验代码,因此在实验计划里推进是首位的。codex 这种乱发散的特性完全是给我帮倒忙(更别提一会儿就来一次 context compaction 的负面影响很大)。我看到网上有人说 codex 擅长 coding 和推理,claude 擅长做艺术设计,但实际上我使用下来完全是相反的。claude 给出的对比试验和消融实验的建议在 1-3 轮对话修改后,非常准确。而 codex 提出的实验建议基本上都是很形式的,每一项设计连对应“这一组实验想要回答什么问题”都做不到。

    4 replies  •  2026-10-08 04:32:16 +08:00
    chemzqm
        1
    chemzqm  
       2h 37m ago via iPhone
    是 sol 容易乱发散
    Philippa
        2
    Philippa  
       1h 44m ago
    opus5.5 100 usd 根本用不完,codex 200 usd astra 根本不够用(不开 fast ),而且 opus5.5 币 astra fast 还快,所以有重新利用 claude 起来了。openai 就是畜生,200usd 套餐砍了太多额度了。A\ 从来不封我号。
    Philippa
        3
    Philippa  
       1h 23m ago
    openai models 发散只是表面现象。gpt 的 models 都被训练快速解决问题,但是很少理解用户的意图,代码经常是不管以后维护/长期需要的,都是越快越好。codex 的 app 用 gpt astra 就算是问调查类问题,除非开了 xhigh ,high 或以下直接回答 model 本身的数据敷衍的。claude 的 models 在这方面也不行,但比 gpt 还是要好很多。
    Zhuzhuchenyan
        4
    Zhuzhuchenyan  
       54 mins ago
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   744 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 28ms · UTC 21:26 · PVG 05:26 · LAX 14:26 · JFK 17:26
    ♥ Do have faith in what you're doing.