递归自我改进:从一杯咖啡到Harness Engineering

递归自我改进:从一杯咖啡到Harness Engineering 2024年,我去美国做访问研究,回程途经旧金山。去之前通过邮件约了几位行业朋友(网友,行业专家,AI公司员工),其中包括素未谋面的Lilian Weng。那时候她还在OpenAI负责安全系统,AI圈还没有后来那些人事震荡。 我乘地铁去了OpenAI当时的那栋小白楼。他们楼下有一家星巴克,我在那儿等她。下午两点,店里不少人带着电脑,三三两两在聊天。硅谷的星巴克就是这样,你分不清谁是来办公的、谁是来面试的、谁是刚从哪个会出来透口气的——但空气里确实有一种说不上来的东西,让人觉得这栋楼里正在发生什么。 那天我们聊的是很宽泛的话题——中美AI的差距和机会、算力成本下降的拐点、token价格降到什么程度会触发应用爆发。我当时也和他分享了在MIT上课时的一些分享:大模型的力量不在于参数规模,而在于电力和算力趋于平静之后,token成本降到极低基点时,整个行业的范式会发生变化。我们都没料到,后来DeepSeek横空出世,中国的开源路线以一种意想不到的方式验证了这个判断。 这些是后话了。真正让我想写这篇文章的,是今年7月4日Weng发表的那篇《Harness Engineering for Self-Improvement》,以及随后她官宣重返OpenAI领导递归自我改进(RSI)团队的消息。RSI不是新概念——1965年I. J. Good就提过了,几十年来更多是哲学讨论。Weng的贡献不在于"发现"RSI,而在于她给出了一条工程化的路径。她指出RSI可以发生在三个层面:模型权重、训练管道、部署系统。其中DeepSeek R1已经在训练管道层证明了自我改进的可行性——模型不需要人类标注,通过强化学习自己学会推理。而Weng选择的切入点是第三层:部署系统(Harness)——即使模型本身的推理能力不变,更好的工具调用、上下文管理、评估机制也能显著提升实际表现,而这些改进本身又可以被模型自动化。更值得追问的是:OpenAI为什么选一个做了七年安全的人来领导RSI?这篇文章,我想从技术的角度拆解。 一、RSI:一个60年的概念,为什么现在才可行 Lilian Weng的文章开篇直接切入主题:递归自我改进(Recursive Self-Improvement, RSI)。 这个概念可以追溯到1965年,英国数学家I. J. Good提出的"超智能机器"——一种能在所有智力活动中超越人类,并设计出比自身更好的机器的系统。2008年,Eliezer Yudkowsky将这个概念精确化为一个反馈循环:AI利用其当前的智能,去改进产生其智能的认知机制。 听起来很抽象。但Lilian Weng把这个抽象概念落到了实处。她指出,在现代AI语境下,这个反馈循环可以发生在三个层面: 模型权重层面:模型直接重写自己的参数。这是最理想但最难的路径,目前几乎不可行。 训练管道层面:模型改进生成训练数据、选择训练任务、优化训练策略。这是很多前沿实验室正在探索的方向。 部署系统层面:模型改进自己与外界交互的方式——如何调用工具、如何管理上下文、如何评估自身输出。 她明确选择了第三个切入点。原因很关键:原始模型和真实世界之间的这层,其重要性不亚于模型本身的原始智能。Claude Code和Codex的成功,不是因为它们的基础模型最强,而是因为它们的部署系统设计最成熟。 她用了一个词来描述这层部署系统:Harness。 二、Harness:模型与世界之间的操作系统 Weng在博客中用了一个精确的类比:Harness就像操作系统。你花在操作系统上的功夫,决定了CPU能发挥多大潜力。 在她的定义中,Harness是围绕在基础模型周围的整个系统,它负责: 编排执行流程(模型如何思考和规划) 定义工具调用(模型如何与外界交互) 管理上下文(模型感知和存储什么信息) 持久化产物(模型如何保存工作成果) 评估结果(如何判断模型表现好坏) 这个定义的精妙之处在于,它将原本分散的概念——Prompt Engineering、Agent Framework、Tool Use、Memory Management、Evaluation——统一到了一个更宏观的架构视角下。 更重要的是,她指出了Harness工程与传统Agent框架的区别: 维度 传统Agent框架 Harness工程 核心公式 agent = LLM + memory + tools + planning + action 额外加入workflow design, evaluation, permission control, persistent state 设计理念 Prompt模板 运行时系统设计 类比 IDE 操作系统 这个类比不是随便说的。Lilian Weng明确指出,Harness的设计应该参考操作系统的工程实践: ...

y9 .Z | August 5, 2026 | 33 min | Shanghai, China

你卖的是时间,还是系统

你卖的是时间,还是系统 我有个朋友,这些年一直在做"正确的事"——考了证,跳了几次槽,薪资翻了一倍,去年凑齐首付买了房。按世俗标准,他活得挺成功。 但前阵子喝酒,他说了句让我愣住的话:“我比五年前忙多了,赚的也多了,可我怎么觉得自己离’不干了’这件事越来越远?” 他不是矫情。他比五年前更离不开那份工作——房贷、生活成本、消费习惯,全都跟着收入一起上去了。收入涨了,但"一旦停下来就活不下去"这件事,一点没变。 这件事让我反复想一个问题:多数人一辈子都在打磨"卖时间"的能力——考更好的证、进更好的公司、拿更高的时薪。但很少有人停下来问一句:我能不能不靠卖时间活着? 这个问题的答案,才是普通人真正该想清楚的事。 打工的天花板,不是你不够努力 打工这件事,结构上就有一个绕不开的天花板:你卖的是时间,而时间是不可再生的。 一天就那么多小时,你能卖出去的份额是固定的。你确实可以通过提升技能把每小时卖得更贵,但这条路的尽头很明显——精力、注意力、体力都会衰退,而市场很少为一个四十岁的人付比二十五岁更高的时薪,除非你坐到了那个稀缺的位置。位置就那么几个,挤不进去是常态。 更隐蔽的问题是定价权。你创造的价值和到手的薪水之间,永远有一道缝。这不是黑心,是商业运转的基本条件——企业要赚钱,就必须用低于你产出的价格买你的时间。换句话说,打工这件事从设计上就决定了,你拿不到自己创造的全部价值。 所以靠工资实现"再也不用为钱工作",几乎不可能。不是因为你不努力,是因为这条赛道本身的奖励上限就在那里。 我见过真正不再为钱发愁的人,没有一个是靠工资爬上去的。他们手里都有某种"自己会生长"的东西——可能是公司股权、收租的房产、持续的版权收入、一个能自动获客的小生意。这些东西的共同点是:它们产生收入,但不消耗你的在场时间。 这才是"投资"两个字的真意。不是去股市追涨杀跌当韭菜,而是把你攒下的钱和本事,换成一种能自己增值的结构。 你真正该攒的,是"说不"的底气 那普通人前半段到底该攒什么? 不是职级,不是房产证,不是朋友圈里的体面。是一样很朴素的东西——选择权。说穿了,就是"我能不能对不想做的事说不"。 选择权不会凭空来,它靠几样东西撑着。最底下那层是钱,具体说是一笔够你不工作也活得下去的存款。数字因人而异,意义一样——它是你所有勇气的底座。没有这笔钱,老板让你加班你不敢拒绝,客户刁难你只能忍着,因为你知道一旦失去收入,生活马上就塌。我见过太多能力很强的人,就因为手头没有缓冲,被困在一个消耗他们的环境里动弹不得。 但光有钱不够。钱能买安全感,买不来方向感。所以更难攒的是第二样——一套能看懂世界怎么运转的脑子。这不是看书考证那种攒法,而是你真的在脑子里建立起判断力:一个生意凭什么赚钱,一个趋势会往哪走,一件事的代价藏在哪儿。这种判断没有捷径,得靠一次次复盘、一次次踩坑、一次次和比你聪明的人掰扯。它攒得慢,可一旦攒起来,别人很难偷走。 还有一样总被忽略,却是前两样的容器:身体和精神状态。长期高压下还能睡得着觉、扛得住事,这本身就是资本。我见过不止一个人,钱和脑子都到位了,身体先垮了,后半程直接没机会上场。 攒这几样东西的过程注定是闷的,因为它们都要求你把时间和钱花在"看不见回报"的地方——存钱、啃难懂的东西、保持健康。而周围人在做的,往往是相反的事。 让你的价值,不再按小时计费 攒到一定程度,问题就变了。不再是"我怎么卖得更贵",而是"我怎么不按小时卖"。 这是普通人最难的一跃——从出卖时间,变成经营一个能脱离自己运转的结构。 我不是劝所有人都去创业。创业是高风险的事,不是每个人都该碰。我说的是另一种可能:让你已经有的某种能力,脱离"一对一、按小时"的形态。 举个例子。一个做了十年财务的人,他最值钱的不是"会做账"这个动作,而是他对中小企业税务坑的判断——什么能抵扣、哪里有风险、怎么合规地省。如果只靠接单做账,那就是按小时卖。可要是把这套判断变成一门课、一套模板、一份咨询,同样一份本事,就能同时卖给很多人,不需要他每次都在场。 这就是"不按小时卖"的意思。你的价值被复用了。 走到这一步,通常得凑齐几件事。先得找到一个自己确实比多数人懂一点的窄领域,窄到没几个人跟你争,但有人愿意为此付钱。然后把这份本事变成一个别人能识别、能购买的东西——一篇文章、一个工具、一次咨询,总得有个具体形态。最后还得让自己被找到,在某个地方持续露面,让需要你的人知道你在。 哪件都不容易。但它们的回报,是把你的收入结构从"卖时间"换成"卖系统"。系统有个好处:你睡着的时候它也在转。 到这一步,财务自由这个词才有了点实感。它的重点从来不是"有多少钱",而是"你的收入还要不要你亲自到场"。 慢,但它是唯一的结构改变 说实话,这条路又慢又难,也没人保证你能走通。 它慢,因为攒钱、长判断力、找窄领域、做出产品,每一件都以年计。它难,因为它要求你在很长一段时间里做和周围人相反的事——别人消费你存钱,别人娱乐你学习,别人追热点你打磨一个没人知道的本事。它还孤独,前几年基本看不到反馈,连鼓励你的人都没有。 但我想了很久,还是觉得它值得。 因为它瞄准的不是"赚更多",而是"换一种活法"。前者是量变,后者是结构变了。一个月薪两万和一个月薪三万的人,本质上都在卖时间,都停不下来。但一个靠工资、一个靠系统,这是两种不同的生存结构。 多数人一辈子都在前一种结构里打转——更努力地卖,卖得更贵,卖得更久,直到有一天卖不动了。而那条少有人走的主线,是趁还卖得动的时候,悄悄搭一个不靠卖也能活的底。 不一定每个人都要走到终点。但至少别在打转的时候,以为自己在前进。 - FIN -

y9 .Z | August 3, 2026 | 11 min | zhejiang, China

Same Job, New Rules:创始人的不变与变

赫拉克利特说:“人不能两次踏入同一条河流。“创业这条河也不例外——河水在变,河岸在变,但过河这件事本身,从未改变。 什么变了 The Founder’s Playbook 最后一章叫"Same Job, New Rules”,开篇第一句话就点题:在 AI 时代,创始人的工作没有变——找到真实的问题,构建解决方案,把它变成一个重要的公司。变的是到达那里的路径。 过去九篇文章,我们逐层拆解了这条新路径的每个阶段。把"变了"的部分梳理一遍,你会看到一条很清晰的曲线。 Idea Stage 变了。过去验证一个问题要几个月的调研和几十场访谈。现在 AI 帮你做竞争分析、设计访谈框架、自动化外联,验证周期从几个月压到几周。但"验证"本身的必要性没变,反而因为构建成本降低而变得更重要——做错的代价低了,做错之后浪费的机会反而多了。 MVP Stage 也变了。过去一个原型需要一个团队几个月的工作。现在 agentic coding 让一个人一个下午就能做出一个看起来像那么回事的产品。但"产品市场契合"的标准没变——用户是否真的在乎,不会因为你的产品做得更快就自动成立。 Launch Stage 同样变了。过去从产品到公司需要招一个运营团队。现在 AI 工作流自动化让一个小团队能跑出大团队的运营效率。但"系统化运营"的目标没变——你需要不依赖创始人的系统。 Scale Stage 的变化更微妙。过去构建护城河要几年时间和大量资源。现在 AI 让领域知识的编码和用户数据的复利变得更快。但"护城河"的本质没变——时间积累的东西,仍然需要时间来积累。 什么没变 这是更重要的问题。 判断力没变。AI 能帮你做研究、写代码、起草文档、分析数据。但它不能告诉你"这个问题值不值得做”、“这个方向对不对”、“这个时机该不该出手”。这些判断需要你独有的上下文——你的行业经验、你的直觉、你对用户的理解。 领域知识也没变。AI 是通用智能,它不知道你所在行业的那些"只可意会不可言传"的东西。340B 药品项目的计费逻辑、建筑行业的合规要求、法律行业的风险偏好——这些需要真实经验的东西,AI 只能辅助,不能替代。 用户信任更没变。用户选择你的产品,不是因为你的 AI 有多强,而是因为他们相信你能解决他们的问题。信任来自真实的对话、可靠的交付、长期的承诺。这些 AI 帮不了你——只能靠你自己。 把这些串起来看,创业的本质没变:找到真实的问题,构建解决方案,把它变成一个重要的公司。这句话在 2020 年、2026 年、2030 年都成立。工具在变,但创业的核心——为真实的人解决真实的问题——从未改变。 路径压缩,本质不变 The Founder’s Playbook 用一句话总结了 AI 对创业的影响:AI 把每个阶段的时间轴压缩了——验证从几个月变成几周,原型从团队工作变成个人工作,运营从小团队变成 AI 加一个人。 但压缩的是时间,不是工作本身。你仍然需要验证、需要构建、需要发布、需要规模化。你仍然需要判断力、领域知识、用户信任。你仍然需要在每个阶段做出正确的选择——只是现在,你有更好的工具来执行这些选择。 这让我想到一个关于摄影的类比。数码相机和 Photoshop 让"拍一张好照片"变得前所未有的容易——你不再需要暗房、不需要对曝光的精确控制、不需要等胶片冲洗。但"什么值得拍"和"怎么构图"的判断力,仍然是摄影师的核心能力。工具变了,审美没变。 给 AI 原生创始人的三句话 读完这本书,走完这个系列,我想留三句话给正在或准备打造 AI 原生公司的创始人。 ...

y9 .Z | August 1, 2026 | 10 min | Shanghai

构建护城河:数据、知识与锁定——AI 时代的三种防御体系

中世纪欧洲的城堡有三种防御:护城河(让敌人难以接近)、城墙(让敌人难以突破)、和吊桥(让盟友自由进出)。AI 时代的护城河也有三种——数据飞轮、领域知识、和用户工作流锁定。 AI 让复制变容易,让积累变稀缺 2025 年,一个有趣的现象引起了投资圈的注意:一批 AI 原生公司的估值开始分化。有些公司功能看起来差不多,但估值差了一个数量级。区别在哪? 不是功能,是护城河。 在 AI 让"复制一个产品"变得越来越容易的时代,功能不再是壁垒。一个有充足资源的竞品可以用几周时间复制你的功能。那什么才是真正不可复制的? The Founder’s Playbook 给出三个答案。每一个都建立在时间积累之上——而时间,是 AI 无法加速的。 第一条护城河:数据飞轮 用户和产品互动时产生行为信号——哪些输出被接受,哪些被拒绝。这些信号随时间积累,变成你的产品路线图。 The Founder’s Playbook 把这叫做"复利价值":每一次改进让产品更有用,更多使用产生更多反馈,更多反馈驱动更多改进。这就是数据飞轮。 这种数据有三个关键属性。时间锁定——你买不到数千个用户在你的产品里优化工作流留下的行为指纹。上下文特定——这些数据是在你的产品、你的用户群体、你的使用场景中产生的,换个环境就不一样了。不可能被复制——即使竞品知道你有这个飞轮,他们也无法在短时间内重建。 书中给出了一个具体的练习:把你的产品互动数据(收集了什么、收集了多久、用户如何随时间互动)交给 Claude,让它识别三个最高信号的行为模式,然后设计一个反馈循环,把每个模式变成系统性的模型改进。最后,让它帮你起草一页"护城河叙事"——你的数据飞轮怎么转、转了多久、为什么一个有充足资源的竞品今天开始做,两年内也复制不了。 第二条护城河:领域知识外化 很多 AI 原生公司的创始人做的是高度具体的应用——他们在某个行业里亲身经历过的问题。Agentic AI 让这些没有工程背景的创始人也能用领域知识构建产品。 关键在于,把你的领域知识放进一个结构化的、AI 能访问的上下文里。通过长期对话、项目和记忆,把你的行业知识——行规、监管陷阱、边缘 case、为什么显而易见的答案行不通——放进 Claude 的上下文。然后把这些编码成 Skills,让 Claude 每次都以同样的方式执行。 书中举了一个挺精彩的例子:一个通用 AI 医疗计费工具会在 340B 药品项目上出错,但你的产品专门处理了这些逻辑。为什么?因为你有领域知识,而且你把它编码进了系统。 几个月后,这就变成了一种专有的知识基底,通用 AI 做不到。一个没有你这种领域经验的竞品,即使有同样的 AI 工具,也会在你的细分领域里反复踩坑。 我自己有一个略带刺刀味的判断:你的测试套件就是你的护城河的地图。 每一个你处理过的边缘 case,都是竞品还没踩到的坑。 第三条护城河:用户工作流锁定 数据飞轮让产品更难复制,但工作流锁定让产品更难离开。 用户在你的产品上构建了自动化,培训了团队,连接了数据源。他们开发的 prompt、优化的工作流、标准化的输出——都是围绕你的产品塑造的。这时候,换产品就不再是产品决策,而是一个全规模的运营项目。 The Founder’s Playbook 给出了一个实操方法:让 Claude 按集成深度映射你的客户群。对每个客户群体,识别他们在你的产品上构建了哪些工作流、依赖哪些集成。这显示了你的产品在哪里"粘"得牢,哪里还需要加深。 集成的数量和质量是关键。你提供的集成越多,客户就有越多表面面积来构建依赖你的工作流。Claude Code 帮你快速构建原生集成——数据管道、项目管理工具、用户依赖的其他系统。更深一层的锁定:构建 API、webhook 和 SDK,让客户不只是"用"你的产品,而是"在之上构建"——这是最深形式的锁定。 ...

y9 .Z | July 26, 2026 | 11 min | Shanghai

技术债与架构决策:为 Scale 打下地基

古罗马人在建造道路时,会先挖一条深沟,铺上多层砂石和碎石,最后才铺上平整的石板。他们知道:路能走多远,取决于地基有多深。今天,你的代码库就是那条路——而 CLAUDE.md 就是你的地基剖面图。 两种技术债 不是所有技术债都一样。理解这一点,是 Scale 阶段的第一课。 第一种是有意技术债——你在充分知情的情况下,选择用代码质量换速度。你知道这笔债的存在、它的规模、什么时候该还。这种债本质上是投资:你借了时间,计划在某个 sprint 里连本带息还清。 第二种是无意技术债——你不知道它存在,或者知道但不知道它有多大。它来自"先这样吧"的临时方案、来自"以后再重构"的承诺、来自那些"能跑就不要动"的模块。这种债是高利贷,利息在暗处累积,直到某天你发现已经还不起了。 在 AI 原型的场景里,The Founder’s Playbook 指出了一个特有的风险:agentic 技术债是一种"超级无意债"。 为什么?因为 agentic coding 工具移除了所有曾经控制什么进入生产的自然瓶颈。过去,代码要经过设计审查、代码审查、测试——每一步都是制衡。现在,一个 prompt 就能让代码进生产。速度是保证了,但质量控制的责任完全落到了创始人身上。这一层责任,是 agentic 工具不会主动告诉你的。 架构审计:看见你的地基 The Founder’s Playbook 建议在 Scale 阶段做一次完整的架构审计。 具体操作:让 Claude Code 审计代码库,产出一份结构脆弱性清单——哪里是脆的捷径、哪里测试覆盖不足、哪里模块边界模糊。然后让 Claude 对这份清单做优先级排序:什么会拖累下次发布,什么可以并行处理,什么是当前阶段能接受的。 这个审计的价值不只是"修 bug"。它强迫你看见自己的代码库——不是作为一个个文件,而是作为一个系统。我自己的经验是,大多数创始人在 Scale 阶段第一次真正"看见"自己的代码库,那种感觉有点像第一次站在高楼上俯瞰自己住了多年的城市:你突然意识到有些路是断头路,有些楼是没有地基的。 从"能跑"到"能扛" Scale 阶段的技术工作不只是修代码——它是围绕代码构建基础设施。 企业买家在签多年合同之前,要看的不是你的产品功能,而是你的组织能不能成为一个可靠的基础设施合作伙伴。他们要看产品文档、支持 playbook、SLA 承诺。签了之后,他们会要求你兑现。 The Founder’s Playbook 给出了一个三层方案。 第一层是文档:产品文档、支持 playbook、SLA——这些是企业采购团队期望看到的东西。AI 帮你起草和更新,但内容需要你的领域知识来校准。 第二层是代码:用 Claude Code 加固代码库,针对企业合同要求的特定可靠性和安全标准。构建日志、监控、事件响应工具、可观测性层——让 SLA 真正可执行,而不是一句口号。 第三层是运营:用 Claude Cowork 跑企业支持运营层。工单路由、升级工作流、文档更新(随产品变化自动触发)、续约追踪、企业客户成功依赖的报告节奏。 三个工具协同,让一个小团队能展示出比自身规模大得多的组织成熟度。这件事看起来是技术问题,其实是组织伪装问题——你得让外界觉得你"像那么回事"。 知识编码:把你的脑子变成系统 Scale 阶段最容易被低估的挑战,是创始人的制度知识。 ...

y9 .Z | July 21, 2026 | 11 min | Shanghai