研究发现:AI 编码智能体写出更多代码,却没有更多软件
AI 编码智能体火了一整年,一项新研究泼了盆温度刚好的冷水:智能体确实让代码变多了,但软件并没有跟着变多。
发现了什么
研究给出的核心结论是,编码效率上的收益,几乎全被人类审查这个“瓶颈”吸收掉了。
拆开说就是:智能体写代码的速度快得飞起,一天产出顶过去一个团队;但这些代码要进主分支,必须过人这一关——读懂、验证、确认没有埋雷。审查者的时间是固定的,上游灌进来的代码越多,管道堵得越死。产出增加了,通过审查最终成为软件的那部分,没怎么变。
这个结论不意外,但数字扎心
用过编码智能体的开发者多半有体感:生成一大段代码只要几秒,判断它对不对要花二十分钟。AI 把“写”的成本打到了地板上,“信”的成本原地不动——整个工程的吞吐量,卡在了没被 AI 加速的那个环节上。
这跟工厂提速的道理一样:装配线快了十倍,质检工位只有一个,总产能看质检。
对团队意味着什么
如果这个结论成立,那团队优化投入的方向就该跟着变——继续堆智能体数量、比拼生成速度,边际收益会越来越薄;真正的杠杆在审查侧:自动化验证、更强的测试覆盖、形式化检查、按风险分级的人工抽审,把瓶颈段拓宽。
顺带说一句,“验证跟不上生成”这个困境并不只存在于编码。Anthropic 这周刚因为无法可靠控制智能体而关闭内部评测的外网访问,数学界面对 OpenAI 灌进来的几百份手稿把消化周期估算成了好几年。AI 负责生产,人类负责验证——这个新分工里,短板全在后者身上。