Harness Picks · No.01

Harness 工程实践 · 精选十篇

2026-07-22 · 选自 3013 条候选 · 三维九分制 + 时效加权(近 4 个月优先)

这是 harness-radar 的第一期精选。我们从 Anthropic、OpenAI、Cursor、Vercel、LangChain、 字节跳动腾讯、美团的一手工程分享里,按「实践巧妙、工程严谨、大厂出品」三维打分定资格, 再按时效加权(近 4 个月 +2,超 8 个月 −2)定排序。每篇都读过正文、核过数据,不收二手解读

壹 · 加权 11

Harness design for long-running application development

Anthropic · Prithvi Rajasekaran · 2026-03-24 近 4 个月 · 巧妙 3 / 严谨 3 / 来源 3

借 GAN 的对抗结构做 planner-generator-evaluator 三角色,每个 sprint 先签「契约」定义 done。

为什么值得读:solo $9 跑不动 vs harness $200 可玩的成本对比。最锋利的是「harness 每个组件 都编码了一个模型做不到的假设,模型升级就要逐一拆除」。

贰 · 加权 10

Harness 不是目的,知识才是护城河——一个 AI 工程交付团队的知识沉淀实践

腾讯技术工程(原创)· 腾讯 AI Team · 2026-04-27 近 4 个月 · 巧妙 3 / 严谨 2 / 来源 3

知识自带生命周期治理——成熟度按引用自动升降级,「只进不出」的反模式被机制化解决。

为什么值得读:五层存储×五类知识×三级成熟度的知识架构;独立 Git 仓库即状态机, 三级渐进索引控制上下文成本;ARCHIVE 阶段自动提取知识回写,形成「交付即沉淀」的复利循环。

叁 · 加权 10

字节跳动技术副总裁洪定坤:AI Coding 的实践与探索

字节跳动 · 洪定坤(Force 2026 演讲全文)· 2026-06-24 近 4 个月 · 巧妙 2 / 严谨 3 / 来源 3

模型和框架不动、只加 Harness 基建,可交付性从 40-60 分不及格拉到 80 分。

为什么值得读:国内最硬核的一次公开实验:3 个主流模型×3 个主流框架×同一真实需求 各跑 100 次共 900 次。裸跑正确率超 80% 但可交付性仅 40-60 分;叠加上下文工程、架构约束、知识沉淀后, 正确率近 90%、可交付性 80 分。基建比选型更决定 AI Coding 能否真实交付。

肆 · 加权 10

Continually improving our agent harness

Cursor · Stefan Heule & Jediah Katz · 2026-04-30 近 4 个月 · 巧妙 3 / 严谨 2 / 来源 3

命名了「context anxiety」——模型发现上下文快满时会开始拒绝任务。

为什么值得读:Keep Rate(代码留存率)比 benchmark 更贴近真实质量;按模型定制 harness、 会话中途换模型自动切换。

伍 · 加权 9

We removed 80% of our agent's tools

Vercel · Andrew Qu · 2025-12-22 · 巧妙 3 / 严谨 3 / 来源 3

17 个专用工具砍到 2 个,成功率反而从 80% 升到 100%。

为什么值得读:反直觉的「addition by subtraction」。平均耗时 274.8s→77.4s,token -37%, 附新旧两版代码。

陆 · 加权 9

用 Agent 评测思路管理 AI Coding——31 万行代码 AI 重构的实践

美团技术团队 · 2026-05-07 近 4 个月 · 巧妙 2 / 严谨 2 / 来源 3

做 Agent 评测的团队,把评测方法论直接迁移成 AI Coding 治理框架:先人人对齐,再人机对齐。

为什么值得读:国内大厂最完整的一篇。Rule/Skill 分层固化共识、主 R 打样→SOP 分发→全组并行、 借业务需求零排期消化技术债。

柒 · 加权 8

Harness engineering: leveraging Codex in an agent-first world

OpenAI · Ryan Lopopolo · 2026-02-11 · 巧妙 3 / 严谨 2 / 来源 3

给 agent 一张地图,而不是一本千页说明书。

为什么值得读:3 人 5 个月百万行代码、1500 个 PR 的极端实验。AGENTS.md 裁成 100 行目录 + 知识下沉 docs/ 渐进披露 + doc-gardening agent 保鲜。

捌 · 加权 8

Unrolling the Codex agent loop

OpenAI · Michael Bolin · 2026-01 · 巧妙 2 / 严谨 3 / 来源 3

旧提示必须是新提示的精确前缀——为命中 prompt cache,采样成本从二次降到线性。

为什么值得读:Codex 生产 harness 的逐层解剖:角色分级提示、改配置只追加不修改历史、 ZDR 无状态请求。有真实请求 JSON、SSE 事件流和具名 PR。

玖 · 加权 8

Improving Deep Agents with harness engineering

LangChain · Vivek Trivedy · 2026-02-17 · 巧妙 2 / 严谨 3 / 来源 3

只改 harness 不动模型,Terminal Bench 2.0 从 52.8 拉到 66.5,Top 30 外进 Top 5。

为什么值得读:「harness 比模型重要」最硬的一次量化证明。三个具名中间件 + reasoning sandwich 预算调度,全程 trace 可复查。

拾 · 加权 7

Trae Agent:字节开源的仓库级 Coding Agent(附技术报告)

字节跳动 Trae Research Team · 2025-07 · 巧妙 3 / 严谨 3 / 来源 3

「生成—剪枝—选择」三段式模块化 agent,75.20% Pass@1 登顶 SWE-bench Verified,MIT 全量开源。

为什么值得读:字节在 agent 上最硬的公开成果:对比 4 个 SOTA 基线平均 +10.22%, 代码和 trajectory 格式全公开。技术报告可对照复现。 三维满分,靠质量硬扛时效降权留榜。

经典重读区

Timeless but Older

三维分够格、但发布超 8 个月被时效降权的几篇开山之作,适合写「重读经典」篇。

Effective harnesses for long-running agents
Anthropic · 2025-11-26 · 三维 8 · 长任务 harness 开山之作:双角色 + JSON 特性清单交接
Trae 核心成员复盘:从 Cloud IDE 到 2.0 SOLO,字节如何思考 AI Coding?
字节 Trae 核心成员 · 2025-07-23 · 三维 8 · 固定 workflow 让强模型「降智」
Context Engineering for AI Agents: Lessons from Building Manus
Manus · 2025-07-18 · 三维 7 · KV-cache 命中率反推三条设计规则
Advanced Context Engineering for Coding Agents
HumanLayer · 2025-08-29 · 三维 7 · RPI 三段式,含失败案例与开源 prompt 仓库
Effective context engineering for AI agents
Anthropic · 2025-09-29 · 三维 6 · 注意力预算心智模型
筛选方法:候选池来自 harness-radar 采集器。短名单 21 篇逐篇读正文核查,三维九分制定资格(≥6), 时效修正(近 4 个月 +2 / 超 8 个月 −2)定排序,取前十。国内渠道(腾讯技术工程 / 火山引擎 / 字节跳动技术团队公众号)经专项补捞,字节 2 篇、腾讯 1 篇、美团 1 篇入选。

观察名单:腾讯 CodeBuddy 2.0(被同厂更强者挤出)、字节《第一性原理拆解 Agentic Coding》、 TRAE《2026 企业级 AI 编程实践手册》、CodeBuddy 万字落地文、Thoughtworks 框架篇、TRAE SOLO GA、IGA Pages 教程。