Harness的最佳实践:DSH的64天启示录

前一篇文章我做了 DeepSeek Harness(DSH)的 git 考古,拆解了它 64 天 12293 次提交背后的构建哲学——《用Agent造Agent:DeepSeek Harness的64天考古与自进化路径》。那篇是「DSH 是什么、怎么造的」。这篇是「DSH 的经验怎么用」——把那 64 天里被验证过的工程判断,提炼成普通团队可以落地的 AI 辅助开发实践。 先说清楚为什么值得这么做。DSH 不是又一个「我们用了 AI 写代码所以快」的故事。如果只是这个,Copilot 上市五年了,行业早该被颠覆。DSH 真正反常理的是:一个不到 20 人的团队,用 64 天长出一个 221 包的 agent 运行时,工程严谨度却高得不像 AI 写的——100% 测试覆盖率门、运行时断言强制不变量、设计决策可追溯到每个 commit。这不是「AI 写代码快」,是「harness 思维组织 AI 开发」。 这件事,恰恰是所有正在探索AI辅助研发(甚至是AI主导研发)的工程团队、乃至技术Leader或负责人们日日琢磨的核心命题——如何让AI提速的同时,守住工程严谨的底线;如何把AI从「脱缰的效率工具」驯化为「可控的研发协作者」。正因如此,这套从DSH 64天实战中淬炼出的方法论,绝非空泛的理论,而是值得每一支团队深思、拆解并落地的可行路径。 一、认知转变:从「用 AI 写代码」到「用 harness 组织 AI 开发」 市场上有四个比较成熟的 AI 辅助开发流派,先把它们摆清楚: 流派一:Copilot/Cursor 模式——AI 当打字员。人主导写代码,AI 补全和局部重构。这是目前最普及的模式,门槛低,但天花板也低——AI 只能在人画的圈子里做事,产出节奏受限于人的审查速度。 流派二:Claude Code/Codex 单 agent 模式——AI 当执行者。人给一个任务描述,AI 执行多步任务(改多个文件、跑测试、修 bug)。这是 Cursor Composer、Claude Code 的典型用法。天花板比流派一高,但问题是 agent 会自己跑偏,没有不变量挡着,跑几次就积累一堆边界情况。 流派三:Aider 模式——git commit 驱动。AI pair programmer,每次改动自动 commit,人通过 git history 审查。这个模式把 git 当成 AI 产出的审计层,是个好思路,但它只管「改了什么」,不管「为什么这么改」和「规则有没有被破坏」。 ...

Y | August 17, 2026 | 37 min | Shanghai

用Agent造Agent:DeepSeek Harness的64天考古与自进化路径

网上已经有不少技术博主在拆 DSH 的架构图,把它和 Claude Code、Codex CLI 并列比较,论证这套「一切皆插件」机制的优雅和影响力——这些分析有它们的道理,我也认同 DSH 的设计水准。但我想看的不是它长什么样,而是另一个更工程化的问题:这样一个被 DeepSeek 视为战略级产品的 agent harness,是怎么在 64 天里被造出来的? 答案写在仓库的 commit 历史里。从 6 月 10 日第一条提交到 8 月 13 日公开发布,64 天,12293 次提交,日均 192 次。这不是人类节奏,是 AI 辅助开发在版本控制系统里留下的沉积物。我用 git 考古翻了一遍这个仓库,反推一件更底层的事:顶级团队是怎么用 Agent 造出最强 Agent 的。事实上,Anthropic 的 Claude Code 团队和 OpenAI 的 Codex 团队大概率也是这么干的——只是他们的开发过程不公开。这次 DSH 把整个仓库开源,给了我们一个可以近距离观察顶级 AI 团队研发范式的窗口。这是我写这篇文章的起点。 三天前我写林俊旸把 20 亿估值押给 Agent,结论是他选了一条「模型 + 环境」的工程路线。文章里我反复引用 Lilian Weng 的判断:Claude Code、Codex 之所以强,不是因为底模最强,而是 Harness 设计最成熟。那篇文章发出去之后我一直在想一个更具体的问题:harness 到底长什么样? 8 月 13 日,DeepSeek 给了一个可以拆解的样本。他们把内部那个叫 DeepSeek Harness(dsh)的 agent 运行时开源了,MIT 协议,221 个 npm 包。和它同步发布的还有 DeepSeek-V4-Pro 正式版,以及一篇 80 多页的论文《A Programming Paradigm for Spatiotemporal Composability》。 ...

ylzhang | August 16, 2026 | 48 min | Shanghai

语用科技:林俊旸把20亿估值押给Agent,不再卷基础模型

五个月前我说他唯一的选择是创业;五个月后,他把赌注押给了 Agent。 8 月 12 日,林俊旸在 X 上发了一条「life update」:新公司叫 Pragmatik Labs(语用科技),简称 p7k,base 上海,做横跨数字与物理世界的下一代 Agent。距离他凌晨告别 Qwen 那条推文,大约五个月。我当时写过,创业是他唯一合理的选择——不是浪漫,是其他路都有逻辑断裂。现在答案出来了,比我预想的更激进:他没去卷下一代基础模型,也没停在应用层做个助手,而是把第一笔赌注直接押到了 Agent 上,数字和物理两条线一起开。 这一轮的数字很硬。高榕创投和 HSG(红杉中国)共同领投,腾讯和上海未来产业基金跟投,投后估值 20 亿美元,融资规模数亿美元1。The Information 今年 6 月援引知情人士的说法是,高榕和红杉各出约 1 亿美元,腾讯出约 2000 万美元2。一个产品、收入、甚至公开模型都还没有的公司,起步就站到了 135 亿人民币的估值线上。在国内大厂核心技术负责人离职创业的案例里,这可能是目前最高的起跑线。 更值得看的不是钱,是他用这笔钱买到的「不做什么」的权利。 五个月前那篇文,验证了一半 3 月 7 日我写《千问核心离职风波:林俊旸下一步是创业吗》,结论是创业是唯一能承接他全部资产的选择——全球开源社区的声誉、带得走的团队、被 Google DeepMind 公开抢人验证过的技术判断力。当时排除了回大厂、回学界、加入 DeepSeek 三条路,理由是它们都有结构性断裂。 五个月过去,前半段判断兑现了:他确实创业了,核心团队也确实跟着走了。但有一处我没猜对。我当时猜他的方向大概率落在两个区间里——开源模型基础设施,或者离钱近的 AI 应用层。理由是这两条都能最大化他「Qwen 系列开源」的存量资产,又不必正面硬刚算力这道生死线。 他选的 Agent 介于两者之间,却又比两者都更野心勃勃。数字 Agent 接近应用层,物理 Agent(具身智能)却是另一回事——它要的不是更多的 GPU 堆出一个更大的模型,而是让智能走进真实环境、完成长周期任务。这是一条我三月没敢给他规划的路线,因为它的工程难度和烧钱速度都远超做一个开发者工具。 回头看,他其实在离职前就把牌亮了一半。去年 10 月,他在千问内部牵头搭了一支机器人与具身智能团队3。也就是说,具身智能不是他离职后临时起意,而是大厂体制内想做、最终选择带出来独立做的事。这恰恰印证了三月那篇里的另一个判断:他走,是因为看到了技术负责人在体制内能触达的天花板。 不卷基础模型,是因为卷不动了,也是因为没必要卷 新公司没有公布模型参数,也没发产品。但官网把研究方向切成四块:Digital Agents、Physical Agents、Research to Product、Long Horizons4。前两块是业务主线,后两块是研发哲学——前沿研究要落进真实场景,再用真实反馈倒推下一步研究什么;同时留出资源探索突破现有范式的系统。 把基础模型放在身后,是一个值得拆解的决定。 一种读法是「卷不动」。顶级大模型的训练成本已经压垮了除最头部几家之外的所有玩家,Qwen 背后是阿里云的算力池,创业后这个优势瞬间归零——这是三月我就点过的硬约束。租算力贵,买算力要巨额融资,还要扛芯片管制。一个 20 亿美元估值的公司,无论如何也撑不起从零训一个 Qwen 3.5 量级模型的账单。继续做基础模型,等于把自己钉死在算力这根柱子上。 ...

y9 .Z | August 13, 2026 | 24 min | Shanghai

递归自我改进:从一杯咖啡到Harness Engineering

递归自我改进:从一杯咖啡到Harness Engineering 2024年,我去美国做访问研究,回程途经旧金山。去之前通过邮件约了几位行业朋友(网友,行业专家,AI公司员工),其中包括素未谋面的Lilian Weng。那时候她还在OpenAI负责安全系统,AI圈还没有后来那些人事震荡。 我乘地铁去了OpenAI当时的那栋小白楼。他们楼下有一家星巴克,我在那儿等她。下午两点,店里不少人带着电脑,三三两两在聊天。硅谷的星巴克就是这样,你分不清谁是来办公的、谁是来面试的、谁是刚从哪个会出来透口气的——但空气里确实有一种说不上来的东西,让人觉得这栋楼里正在发生什么。 那天我们聊的是很宽泛的话题——中美AI的差距和机会、算力成本下降的拐点、token价格降到什么程度会触发应用爆发。我当时也和他分享了在MIT上课时的一些分享:大模型的力量不在于参数规模,而在于电力和算力趋于平静之后,token成本降到极低基点时,整个行业的范式会发生变化。我们都没料到,后来DeepSeek横空出世,中国的开源路线以一种意想不到的方式验证了这个判断。 这些是后话了。真正让我想写这篇文章的,是今年7月4日Weng发表的那篇《Harness Engineering for Self-Improvement》,以及随后她官宣重返OpenAI领导递归自我改进(RSI)团队的消息。RSI不是新概念——1965年I. J. Good就提过了,几十年来更多是哲学讨论。Weng的贡献不在于"发现"RSI,而在于她给出了一条工程化的路径。她指出RSI可以发生在三个层面:模型权重、训练管道、部署系统。其中DeepSeek R1已经在训练管道层证明了自我改进的可行性——模型不需要人类标注,通过强化学习自己学会推理。而Weng选择的切入点是第三层:部署系统(Harness)——即使模型本身的推理能力不变,更好的工具调用、上下文管理、评估机制也能显著提升实际表现,而这些改进本身又可以被模型自动化。更值得追问的是:OpenAI为什么选一个做了七年安全的人来领导RSI?这篇文章,我想从技术的角度拆解。 一、RSI:一个60年的概念,为什么现在才可行 Lilian Weng的文章开篇直接切入主题:递归自我改进(Recursive Self-Improvement, RSI)。 这个概念可以追溯到1965年,英国数学家I. J. Good提出的"超智能机器"——一种能在所有智力活动中超越人类,并设计出比自身更好的机器的系统。2008年,Eliezer Yudkowsky将这个概念精确化为一个反馈循环:AI利用其当前的智能,去改进产生其智能的认知机制。 听起来很抽象。但Lilian Weng把这个抽象概念落到了实处。她指出,在现代AI语境下,这个反馈循环可以发生在三个层面: 模型权重层面:模型直接重写自己的参数。这是最理想但最难的路径,目前几乎不可行。 训练管道层面:模型改进生成训练数据、选择训练任务、优化训练策略。这是很多前沿实验室正在探索的方向。 部署系统层面:模型改进自己与外界交互的方式——如何调用工具、如何管理上下文、如何评估自身输出。 她明确选择了第三个切入点。原因很关键:原始模型和真实世界之间的这层,其重要性不亚于模型本身的原始智能。Claude Code和Codex的成功,不是因为它们的基础模型最强,而是因为它们的部署系统设计最成熟。 她用了一个词来描述这层部署系统:Harness。 二、Harness:模型与世界之间的操作系统 Weng在博客中用了一个精确的类比:Harness就像操作系统。你花在操作系统上的功夫,决定了CPU能发挥多大潜力。 在她的定义中,Harness是围绕在基础模型周围的整个系统,它负责: 编排执行流程(模型如何思考和规划) 定义工具调用(模型如何与外界交互) 管理上下文(模型感知和存储什么信息) 持久化产物(模型如何保存工作成果) 评估结果(如何判断模型表现好坏) 这个定义的精妙之处在于,它将原本分散的概念——Prompt Engineering、Agent Framework、Tool Use、Memory Management、Evaluation——统一到了一个更宏观的架构视角下。 更重要的是,她指出了Harness工程与传统Agent框架的区别: 维度 传统Agent框架 Harness工程 核心公式 agent = LLM + memory + tools + planning + action 额外加入workflow design, evaluation, permission control, persistent state 设计理念 Prompt模板 运行时系统设计 类比 IDE 操作系统 这个类比不是随便说的。Lilian Weng明确指出,Harness的设计应该参考操作系统的工程实践: ...

y9 .Z | August 5, 2026 | 33 min | Shanghai, China

Same Job, New Rules:创始人的不变与变

赫拉克利特说:“人不能两次踏入同一条河流。“创业这条河也不例外——河水在变,河岸在变,但过河这件事本身,从未改变。 什么变了 The Founder’s Playbook 最后一章叫"Same Job, New Rules”,开篇第一句话就点题:在 AI 时代,创始人的工作没有变——找到真实的问题,构建解决方案,把它变成一个重要的公司。变的是到达那里的路径。 过去九篇文章,我们逐层拆解了这条新路径的每个阶段。把"变了"的部分梳理一遍,你会看到一条很清晰的曲线。 Idea Stage 变了。过去验证一个问题要几个月的调研和几十场访谈。现在 AI 帮你做竞争分析、设计访谈框架、自动化外联,验证周期从几个月压到几周。但"验证"本身的必要性没变,反而因为构建成本降低而变得更重要——做错的代价低了,做错之后浪费的机会反而多了。 MVP Stage 也变了。过去一个原型需要一个团队几个月的工作。现在 agentic coding 让一个人一个下午就能做出一个看起来像那么回事的产品。但"产品市场契合"的标准没变——用户是否真的在乎,不会因为你的产品做得更快就自动成立。 Launch Stage 同样变了。过去从产品到公司需要招一个运营团队。现在 AI 工作流自动化让一个小团队能跑出大团队的运营效率。但"系统化运营"的目标没变——你需要不依赖创始人的系统。 Scale Stage 的变化更微妙。过去构建护城河要几年时间和大量资源。现在 AI 让领域知识的编码和用户数据的复利变得更快。但"护城河"的本质没变——时间积累的东西,仍然需要时间来积累。 什么没变 这是更重要的问题。 判断力没变。AI 能帮你做研究、写代码、起草文档、分析数据。但它不能告诉你"这个问题值不值得做”、“这个方向对不对”、“这个时机该不该出手”。这些判断需要你独有的上下文——你的行业经验、你的直觉、你对用户的理解。 领域知识也没变。AI 是通用智能,它不知道你所在行业的那些"只可意会不可言传"的东西。340B 药品项目的计费逻辑、建筑行业的合规要求、法律行业的风险偏好——这些需要真实经验的东西,AI 只能辅助,不能替代。 用户信任更没变。用户选择你的产品,不是因为你的 AI 有多强,而是因为他们相信你能解决他们的问题。信任来自真实的对话、可靠的交付、长期的承诺。这些 AI 帮不了你——只能靠你自己。 把这些串起来看,创业的本质没变:找到真实的问题,构建解决方案,把它变成一个重要的公司。这句话在 2020 年、2026 年、2030 年都成立。工具在变,但创业的核心——为真实的人解决真实的问题——从未改变。 路径压缩,本质不变 The Founder’s Playbook 用一句话总结了 AI 对创业的影响:AI 把每个阶段的时间轴压缩了——验证从几个月变成几周,原型从团队工作变成个人工作,运营从小团队变成 AI 加一个人。 但压缩的是时间,不是工作本身。你仍然需要验证、需要构建、需要发布、需要规模化。你仍然需要判断力、领域知识、用户信任。你仍然需要在每个阶段做出正确的选择——只是现在,你有更好的工具来执行这些选择。 这让我想到一个关于摄影的类比。数码相机和 Photoshop 让"拍一张好照片"变得前所未有的容易——你不再需要暗房、不需要对曝光的精确控制、不需要等胶片冲洗。但"什么值得拍"和"怎么构图"的判断力,仍然是摄影师的核心能力。工具变了,审美没变。 给 AI 原生创始人的三句话 读完这本书,走完这个系列,我想留三句话给正在或准备打造 AI 原生公司的创始人。 ...

y9 .Z | August 1, 2026 | 10 min | Shanghai