你的上下文被污染了?
这是一次还没有结论的观察。我只记录遇到了什么,以及到现在仍分不清的部分。
分工清楚时不错,换了之后越改越不对
一开始,GPT Chat 负责讨论、判断和 Review,Claude 负责实现,整体产出不错。
Claude 额度用完后,我改让 Codex 一边实现、一边 Review、一边继续改善。慢慢地,我觉得质量在下降:不是完全做错,而是局部改了很多处,真正不对的地方没有解决。
改了很多处,不等于改到了问题。
新开 Chat 有改善,但我同时换了两件事
新开一个 Codex chat 后,确实有一定改善。我开始怀疑,前面的上下文是不是在影响后面的判断。
后来新 chat 的 Review 仍不理想。我把页面交回 GPT Chat,它更快指出了我真正在意的问题。这时我才意识到,自己同时换了两个条件:上下文,和 reviewer。
我以为在试“上下文”,其实一次改了两个条件。
原因,我现在仍分不清
可能是上下文太长,或旧内容已经不相关;可能是旧方案在牵引后面的判断;可能是实现者自己 Review;也可能是模型差异,或几者叠加。
一些研究给了旁证:长上下文里,信息的位置会影响模型怎么用它1;已经出现的内容,即使无关,也可能牵引后面的输出2;但让模型对自己的结果反馈再修改,也并不天然无效3。所以我不下“实现者不能自己 Review”的结论,也不把这几次的表现当作工具的长期能力。
1. Liu 等,Lost in the Middle: How Language Models Use Long Contexts(2023)
2. Niu 等,Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMs(ACL 2025)
3. Madaan 等,Self-Refine: Iterative Refinement with Self-Feedback(2023)
比技巧更值得记住的,是失效的信号
连续几轮都在改,核心问题没变;Agent 一直围绕原方案局部优化;它越来越擅长解释当前方案,却没有重新质疑方向;我自己也开始觉得:怎么越改越不对。
出现这些信号时,我会试试 fresh chat、独立 reviewer、重新写下最后一次真正认可的目标,或暂停 polish,重新问“现在最大的问题是什么”。未必每次有效。
比找到一个永远正确的 Agent 工作流更重要的,可能是更早发现:当前这个工作流,什么时候开始失效了。