今年6月,做出 Claude Code 的 Boris Cherny 说了句让不少人愣住的话:"我不再 prompt Claude 了。我设计 loop,让 loop 去 prompt Claude。"(据 The New Stack、Armin Ronacher 博客等报道)
这话出自 Claude Code 的创造者之口,分量不一般:最会用这个工具的人,选择不再亲手用它。
同一个月,Anthropic 发布了一份基于约 40 万个 Claude Code 会话的报告,结论看似矛盾,实则同一件事:AI 越会写代码,人的专业经验越值钱。
不再 prompt 的人
Cherny 不是孤例。Google Cloud AI 总监 Addy Osmani、OpenClaw 创始人 Peter Steinberger 几乎同时给出相同判断,业界把这套做法叫 Loop Engineering(来源:Obsidian 笔记《Loop Engineering 全面解析》,原文载公众号"划小船")。
核心是把人的判断前移到系统设计阶段:你定义什么算完成、什么算失败、什么时候停,循环自己去发现任务、规划、执行、验证、迭代。
有一条结构决策最要紧:验证环节必须由独立 Agent 执行,不能让写代码的 Agent 给自己的作业打分。
Osmani 给出的组件清单里,几个最要紧:触发任务的自动化心跳、隔离并行的 git 工作树、可验证的 Spec、独立验证的门控 Agent、写入 Memory 的迭代闭环。五个阶段 Discover、Plan、Execute、Verify、Iterate 首尾相接,人只在关键节点介入。
loop 看起来无人值守,转得好不好,取决于设计它的人。
40万个会话里的分工
Anthropic 的报告把这件事量化了。样本是 2025 年 10 月至 2026 年 4 月约 23.5 万人、40 万个会话。同一时期,Claude Code 用户平均每周使用 20 小时,GitHub 上有智能体活动的项目占比翻了一倍多。
56% 的会话在写代码、修代码或测试代码,17% 在部署和运行软件,14% 在规划和探索,13% 在分析数据、写文档。48% 的会话修改现有代码库,只有 14% 从零写起,约五分之一完全不碰代码。
分工很清晰:人做大部分规划决策(做什么),Claude 做大部分执行决策(怎么做)。平均而言,用户做出约 70% 的规划决策,只做出 20% 的执行决策;Claude 则承担约 80% 的执行决策。
一个典型会话约 4 个回合,每条用户提示平均触发约 10 个 Claude 行动,有时超过一百个。人决定造什么,智能体决定怎么造。
图注:用户领域经验越深,Claude 每条指令完成的行动越多,专家约为新手的15倍(来源:Anthropic《智能体编程与专业知识的持续回报》)
会转 loop 的,是专家
按最严格的"验证成功"口径(既判定成功、又有测试通过或代码提交等硬证据),新手会话只有 15% 达标,中级及以上为 28%–33%,部分成功口径则是 77% 对 91%–92%。
麻烦出现时差距更大:遇到错误的会话里,验证成功率从新手的 4% 升到专家的 15%。新手会把 19% 的受挫会话直接放弃(判定失败且一行代码没写),其他用户只有 5%–7%。
经验的价值,是能把智能体引回正确方向。专家每条指令让 Claude 执行的 git 行动约 59.6 次,新手只有 4 次,相差约 15 倍。
换句话说,同样一句"把这个问题修掉",专家说出来,Claude 干完的活是新手的 15 倍。差距不在工具,在提要求的人知不知道自己要什么。
图注:新手与专家的会话结局对比(数据:Anthropic 报告,制图:源势AI)
职称不重要,懂行才重要
报告还有第二个反直觉发现:职业背景没那么要紧。
在产出代码的会话中,软件工程师的验证成功率约 34%,其他职业约 29%,差 5 个百分点,七个月里既没扩大也没缩小。最大的十个职业都落在软件工程师 7 个百分点以内,管理职业甚至略高于软件工程师。
写代码的能力被智能体抹平了,对问题的理解没有。报告作者写道:收益主要来自胜任,而非精通——对领域的熟练掌握就能拿走大部分收益,深度精通只多一点点。这对企业是个好消息:不需要人人成专家,把团队里懂行的人放到设计 loop 的位置上,收益就已经到手。
同一段时间里,典型任务的估算价值平均上涨约 25%,构建类任务涨 43%,操作类涨 34%,AI 相关任务涨 37%;调试类会话占比下降近一半,更多人端到端地部署、运行、分析数据。
图注:七个月里"写代码/修代码"会话占比下降,典型任务价值持续上升(来源:Anthropic 报告)
源势AI观点:把判断写进门禁
两份材料互相印证的是同一件事:Loop Engineering 改变了人工作的形态,Anthropic 的数据则回答了形态之下什么决定成败——不是写代码的手速,是对问题的理解深度。
这正是我们做企业智能体落地的路线。给能源、金融客户搭 Agent,最值钱的工作不是写 prompt,而是把业务专家的判断翻译成验证标准:什么算通过、什么算异常、什么时候必须人工接管。业务专家不需要会写代码,他需要说清楚"什么算对"。
我们在这些行业做到的 AI 研判准确率 98.7%、人力节省 70%,靠的就是把专家经验写进 loop 的门禁,而不是写进聊天记录。
AI 写代码越来越快,判断力越来越贵。知道"做什么"的人,正在比知道"怎么做"的人更值钱。
两个值得盯住的信号
报告作者给自己留了两个观察指标,也值得每个做 AI 落地的人盯住。
其一,如果专业知识的回报开始下降,说明模型正在接管用户今天带入的判断,工具收益会扩散到专家之外。其二,如果非软件职业的成功率持续增长,说明软件生产正在变成各行各业的日常工作,而不再是一个职业的专利。
截至 2026 年 4 月,这两个拐点都还没出现:专家回报稳定,职业差距稳定。窗口期还在,但方向已经指明。对个人,答案是把精力花在理解问题上,而不是和 AI 比写代码。对企业,答案是趁早把专家的判断沉淀成可执行的验证标准——那是 loop 时代最硬的资产。