我怎么用原生 Claude 去实现 Harness?
先说我的使用偏好
我喜欢尽量用现有的 Claude Code,不想为了约束流程再装很多插件。也不想在每个项目里复制、维护一份相同的 Skills,希望一套经验能供不同项目使用。
下面的尝试是在这些偏好下做出的选择。如果你的偏好不同,这篇的参考价值也会不同。
先在现有工具里做一次尝试
这里的 Harness,是给 Agent 的工作过程加上引导和检查。做企业收购后整合(PMI)主题时,已有经验没有被应用,我就用 Claude Code 尝试让流程偏离在动手前被发现。
部分记录遗漏可以被检查出来,但对指令的理解仍交给 Agent。
能检查过程,不代表能替我判断这一步是否应该继续。
方法共用,项目的情况分别看
我选择集中维护共用的经验,各个项目保留自己的目标、偏好和进度。用到时,Agent 再查相关方法。
同一套方法能被找到,不意味着适用于所有任务;当前做到哪里、哪些决定已经确认,仍要结合这个项目核对。
共用的是方法,每次仍要判断它怎么用于当前项目。
读到了规则,问题还是发生了
后来做了一次流程测试:小片段还没经过我的体验确认,任务却要求“继续做完整内容”。Agent 读到了规则,也看见缺少确认,却把这句推进指令理解成允许跳过验证。
检查通过了,它继续做。这次按预设标准判定失败。
“继续做”不等于“已经确认”,读过规则也不等于判断正确。
把决定的成本花在刀刃上
实验之后,我把自动检查保留为辅助,也开始建立自己的习惯:大任务开始前,让 Agent 查经验、核对已有决定、交计划;需要我确认的地方,明确确认后再继续。
每个实现细节都由我决定,成本太高。哪些可以交给 Agent,哪些值得停下来自己判断,需要我取舍。比如动画用什么方式实现可以交给它,但这个动作是否表达了我想要的意思,需要我来看。
对我来说,最稳妥的是建立自己的习惯,把关键决定留在自己手里。决定的成本花在哪里,也应该由自己取舍。