在系列的第一篇里,我讲了那份让我开始在 Prolog 重建科技的不适。结尾,我答应过要把每个部分展开。先从我花了最久才弄懂的那个开始:harness。
先打个招呼,这里没有魔法公式。这是我读到的、我看到别的公司在做的,还有我们正在尝试做的,有对也有错。
我花了好几个月,去找一个词来指称一件我感觉到、却说不出口的东西。
缺的那个词
我看到三个人的公司,交付出以前需要三十个人才能交付的东西。我也看出,收益不在模型,因为模型大家用的都差不多。它在别的地方,而我没有那个词。
2026 年 2 月,OpenAI 发表了一篇叫 Harness Engineering 的文章,给了我那个词。
他们的定义以两句短话开头:“人类掌舵。Agent 执行。“紧接着的内容改变了思考的方式:一个工程团队的主要工作不再是写代码,而变成设计环境、明确意图,以及搭建让 agent 能可靠干活的反馈闭环。
那里面每一块都是实打实的活。设计 agent 运行的环境。讲清楚要做什么,也就是意图,而不是一步一步的操作。再搭起那些闭环,告诉 AI 它有没有做对,好让它自己纠正自己。
注意那句话里消失了什么:写代码。这不是 OpenAI 在说代码不重要。是 OpenAI 在说,当 AI 写掉大部分时,人的工作上移了一层。而当有东西出问题时,要问的问题也跟着变。不再是“再试一次,用点心”,而变成“环境里缺了什么能力,AI 才没做对”。bug 不再是 AI 的错(“它真笨”),而变成一个关于它周围缺了什么的问题。
所以,harness 就是把代码、流程和工作组织起来,好让 AI 看得见、看得懂、执行得了。它不是一件你买得到的工具。它是一种重新思考团队交付什么的新方式。
模型是一回事,harness 是另一回事
我找到的、把这件事钉住的最精炼的一句话,来自 LangChain 的工程师 Vivek Trivedy:“如果它不是模型,那它就是 harness。”
模型就是那个原始的 LLM。Opus、GPT,随便哪个。文字进,文字出,完了。而模型几乎人人都有。它是大路货。拿到 10% 的人和拿到 5 倍的人之间的差距,不在模型。
在 harness。harness 是其余的一切:代码、AI 可以调用的工具、它看得见的上下文、hooks、编排、它运行的 sandbox、记忆、业务规则。在活儿做完送到你手上之前,一切包裹着模型的东西。
harness 也没有一个好的中文译法。挽具、束具,意思都跑偏了。我就叫它“agent 的基础设施”,这么定了。
你也许已经听过“上下文工程”。它是这里面的一部分,是组织 AI 看得见什么的那部分。harness 更大:它包含上下文,但也包含工具、hooks、sandbox、持久化、编排。上下文是一块,harness 是整个。
模型 vs. harness
模型是通用商品,几乎所有人用的都一样。把 10% 的收益和 5x 的收益区分开的,是它周围的东西。
harness 就是让一切对 AI 可读
如果要我把 harness 归结成一条原则,就是这一条:让一切对 AI 可读。
上一篇里我讲过那个击中我的诊断。Prolog 的上下文散落各处。一块在 Notion,一块在 Drive,一块在 Jira、在 Figma。没有单一的来源。每次和 AI 的新对话都从零开始,因为它需要的信息散在五个地方,却在任何一个地方都没被整理过。
当你透过 harness 这面镜片重读这段,问题就一目了然。AI 看不见。而它看不见的,它就用不上。
CREAO 的 CTO Peter Pang 讲过一个看似激进、却完全说得通的决定:他把所有代码并进了一个单一的 monorepo。理由不是为了整齐。是为了让 AI 能一次看到全部。
这就是那份活。不是聪明的 prompt,不是什么小把戏。是把散落的、隐含的、只活在人脑子里的东西,整理到一个地方,写下来,让 agent 能取用。有时候很枯燥。但恰恰是这一点,把 10% 的收益和 5 倍的收益分开。
证据:3 个工程师,100 万行
我天生就对炒作抱有戒心。所以让我相信这不是一时风潮的,是一个带着数字的案例。
构建 Codex CLI(他们的命令行工具)的那支 OpenAI 团队,只有三个工程师。在几周之内,他们交付了大约一百万行代码:应用、基础设施、tooling、文档。而手写的代码是零行。这支团队自述的信条是“不手写任何代码”。大约一千五百个 pull request,全部合并,没有一个是人敲出来的。三个人掌舵,AI 建造。
别搞混:OpenAI 有 Codex,那是为代码训练的模型,还有 Codex CLI,那是工具。这三个人用模型,透过工具,去构建这个工具本身。东西在用它自己造它自己。
还不止于此。在整个 OpenAI 内部,Codex 评审公司 100% 的 pull request。
让我彻底信服的,不是 OpenAI 这个数字本身。而是 Peter Pang 在 CREAO,走了一条独立的路,没和任何人商量,得出了同一个结论。两个不同的地方在描述同一件事。当这种事发生时,通常就不是潮流了。是规律。
3 个人掌舵,AI 建造。零行手写代码。
no manually-written code 团队公开宣称的理念。而在整个 OpenAI,Codex review 了 100% 的 pull request。
AI-assisted 不等于 AI-first
这里我得对 Prolog 所处的位置说实话。
在用 AI 辅助工作和把 AI 放到工作中心之间,有一个几乎没人察觉的差别。
AI-assisted 是人在中心,AI 插在两端。同样的 sprint、同样的 board、同样的会议、同样的流程。AI 在原本就存在的流程里帮忙。收益是真实的,也是小的:10%、20%。大多数公司都在这里。Prolog 今天也在这里,我不会假装不是。
AI-first 是 AI 在中心,人掌舵。你假定 agent 是主要的建造者,并围绕这一点重做流程、架构,甚至组织。人来批评、验证、判断。收益是另一个量级:5 倍、10 倍。这是 Codex、CREAO 和 Anthropic 正在做的。
这个差别,用 Peter Pang 的话总结,是乘法级的,不是增量级的。这正是 harness 如此重要的原因。你没法靠把 AI 插进已有的东西里就抵达 AI-first。你是靠重建、让 AI 看得见、看得懂、执行得了,才抵达的。换句话说,靠做 harness。
而这不只是工程的问题
OpenAI 那句话,“主要工作不再是写代码”,是想着工程写的。但当我换掉主语重读时,它套进了科技里的每一个岗位。
产品不再只写文档;它让 agent 有能力提出方案。设计不再只画界面;它让 agent 有能力在系统里生成界面。QA 不再只手工跑测试;它让 agent 有能力做验证。数据不再只跑查询;它让 agent 有能力回答业务问题。
在所有这些岗位里,要问的问题都变成同一个:agent 要做这件事还缺什么能力,以及我怎么把它变得对它可见、可控。
我从中带走的
harness 不是一件你买得到的工具,也不是一个订阅得到的更好的模型。它是活儿。是把散在人脑子里、散在十个系统里的东西,整理到一个地方、变得可读,好让一台机器能用起来的那份活。
枯燥的一面是,它没有捷径。好的一面是,既然是活儿,那就做得了。我们正在这份活的中途:离 AI-first 还远,比两个月前更近。后面怎么走,我会继续讲。
参考来源
- OpenAI,Harness Engineering: leveraging Codex in an agent-first world(2026 年 2 月)。“人类掌舵,agent 执行”这句话和 Codex CLI 团队的案例都出自这里。
- Vivek Trivedy,LangChain,The Anatomy of an Agent Harness。“如果它不是模型,那它就是 harness”这个定义。
- Peter Pang,CREAO,关于把 AI 放到中心。让 AI 看到全部的 monorepo,以及那个乘法级的差别。
- How OpenAI’s Codex Team Works and Leverages AI,Eng Leadership Newsletter。Codex 团队的数字。