codex 的 context compaction 比 claude code 频繁很多很多,并且一个问题必须指示它进行文献搜索或者 review 本地代码再回答,它的正确率才会高,否则一开口全是瞎编,还喜欢发散。
最变态的是,codex 很喜欢乱发散,突然脑补出一个新的方向。更要命的是,紧接着和前面第一点联动,来一个 context compaction 。 一旦压缩完,codex 就把刚脑补出的东西,当作我要求他必须完成的主线任务了。非常逆天。我今天重置以后被它这个“特性”气了好几回了。发生了好几次“我没有要求你做过 xx”这样的对话。
这一套组合拳比幻觉还恐怖。离开屏幕一会儿回来,就看到工程目录里多了一大堆压根不知道是什么的鬼东西,test 目录里的文件数量还蹭蹭蹭上涨。
另一边我还在用 claude ,最让我感叹的是 claude 的第一直觉非常好,回答问题的第一句话的正确率非常高。尝试性的建议都必须要我一一确认(有点烦了已经),以及 claude 很喜欢反驳(但我感觉比 codex 这个全肯定 bot 好)。
注:我用 agent 来写实验代码,因此在实验计划里推进是首位的。codex 这种乱发散的特性完全是给我帮倒忙(更别提一会儿就来一次 context compaction 的负面影响很大)。我看到网上有人说 codex 擅长 coding 和推理,claude 擅长做艺术设计,但实际上我使用下来完全是相反的。claude 给出的对比试验和消融实验的建议在 1-3 轮对话修改后,非常准确。而 codex 提出的实验建议基本上都是很形式的,每一项设计连对应“这一组实验想要回答什么问题”都做不到。