Harness design for long-running application development
借 GAN 的对抗结构做 planner-generator-evaluator 三角色,每个 sprint 先签「契约」定义 done。
为什么值得读:solo $9 跑不动 vs harness $200 可玩的成本对比。最锋利的是「harness 每个组件 都编码了一个模型做不到的假设,模型升级就要逐一拆除」。
这是 harness-radar 的第一期精选。我们从 Anthropic、OpenAI、Cursor、Vercel、LangChain、 字节跳动、腾讯、美团的一手工程分享里,按「实践巧妙、工程严谨、大厂出品」三维打分定资格, 再按时效加权(近 4 个月 +2,超 8 个月 −2)定排序。每篇都读过正文、核过数据,不收二手解读。
借 GAN 的对抗结构做 planner-generator-evaluator 三角色,每个 sprint 先签「契约」定义 done。
为什么值得读:solo $9 跑不动 vs harness $200 可玩的成本对比。最锋利的是「harness 每个组件 都编码了一个模型做不到的假设,模型升级就要逐一拆除」。
知识自带生命周期治理——成熟度按引用自动升降级,「只进不出」的反模式被机制化解决。
为什么值得读:五层存储×五类知识×三级成熟度的知识架构;独立 Git 仓库即状态机, 三级渐进索引控制上下文成本;ARCHIVE 阶段自动提取知识回写,形成「交付即沉淀」的复利循环。
模型和框架不动、只加 Harness 基建,可交付性从 40-60 分不及格拉到 80 分。
为什么值得读:国内最硬核的一次公开实验:3 个主流模型×3 个主流框架×同一真实需求 各跑 100 次共 900 次。裸跑正确率超 80% 但可交付性仅 40-60 分;叠加上下文工程、架构约束、知识沉淀后, 正确率近 90%、可交付性 80 分。基建比选型更决定 AI Coding 能否真实交付。
命名了「context anxiety」——模型发现上下文快满时会开始拒绝任务。
为什么值得读:Keep Rate(代码留存率)比 benchmark 更贴近真实质量;按模型定制 harness、 会话中途换模型自动切换。
17 个专用工具砍到 2 个,成功率反而从 80% 升到 100%。
为什么值得读:反直觉的「addition by subtraction」。平均耗时 274.8s→77.4s,token -37%, 附新旧两版代码。
做 Agent 评测的团队,把评测方法论直接迁移成 AI Coding 治理框架:先人人对齐,再人机对齐。
为什么值得读:国内大厂最完整的一篇。Rule/Skill 分层固化共识、主 R 打样→SOP 分发→全组并行、 借业务需求零排期消化技术债。
给 agent 一张地图,而不是一本千页说明书。
为什么值得读:3 人 5 个月百万行代码、1500 个 PR 的极端实验。AGENTS.md 裁成 100 行目录 + 知识下沉 docs/ 渐进披露 + doc-gardening agent 保鲜。
旧提示必须是新提示的精确前缀——为命中 prompt cache,采样成本从二次降到线性。
为什么值得读:Codex 生产 harness 的逐层解剖:角色分级提示、改配置只追加不修改历史、 ZDR 无状态请求。有真实请求 JSON、SSE 事件流和具名 PR。
只改 harness 不动模型,Terminal Bench 2.0 从 52.8 拉到 66.5,Top 30 外进 Top 5。
为什么值得读:「harness 比模型重要」最硬的一次量化证明。三个具名中间件 + reasoning sandwich 预算调度,全程 trace 可复查。
「生成—剪枝—选择」三段式模块化 agent,75.20% Pass@1 登顶 SWE-bench Verified,MIT 全量开源。
为什么值得读:字节在 agent 上最硬的公开成果:对比 4 个 SOTA 基线平均 +10.22%, 代码和 trajectory 格式全公开。技术报告可对照复现。 三维满分,靠质量硬扛时效降权留榜。
三维分够格、但发布超 8 个月被时效降权的几篇开山之作,适合写「重读经典」篇。