字母榜 昨天
AI代码过剩后,给代码“冲厕所”的公司贵了十倍
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

经常拿 AI 写代码的人都知道,写出能跑的程序不难,但你稍不留神,文件就莫名大了好几倍。

我曾经心血来潮让 AI 帮我写个网站,虽然用几句话就生成了,但打眼一看,它硬生生给我写了两千多行屎山。

在 AI 编程普及之前,写代码是最耗时的事情,但 AI 现在太厉害了,以前需要几个小时甚至几天才能完成的代码,现在分分钟就能整出来。

但问题是,代码是堆起来了,那些屎里淘金的脏活也堆了起来。

AI 可以一分钟写出几百行代码,但公司不可能因为它勉强能跑,就把这些代码直接扔给几百万用户。

一家给 AI 生成的代码 " 冲厕所 " 的公司,因此贵了近十倍。

8 月 12 日,据 TechCrunch 报道,为 GitHub Actions 提供持续集成(Continuous Integration,CI)基础设施的 Blacksmith 完成 4500 万美元 B 轮融资,估值达到 5.5 亿美元。而不到一年前,它的估值还只有约 6000 万美元。

Blacksmith 没有发明更聪明的 AI,也不负责帮程序员写代码。它做的是 AI 把代码写出来以后剩下的事情:跑测试、做构建,确认这些 AI 生成的代码,到底能不能安全地进入真正的软件。

让它身价暴涨的不是测试本身,是那些需要处理的代码,正在变得越来越多。

AI 写的代码,人类已经看不过来了

Blacksmith 很早就发现,代码变得有点太多了。

2025 年 9 月,公司在宣布 A 轮融资时披露,过去一年,在排除开发者人数增长的影响后,其现有客户运行的持续集成任务量,平均每个季度增长 60%。

Blacksmith 把这种变化归因于 AI 编程工具的爆发——毕竟人一天只有 24 个小时,能够生产的代码有限,后面的测试、构建和代码审查自然也有一个上限。

但 Coding Agent 的爆发改变了这个局面。

现在的多数编程 Agent 都可以读取代码库、修改多个文件、运行测试,再把结果交给人类,而不只是帮程序员补几行代码。更为重要的是,Agent 不仅不需要下班,不需要睡觉,还可以调度多个 Subagent,把一个复杂任务拆开,同时处理多个不同工作。

于是,代码生产开始摆脱 " 有多少程序员,就有多少双手 " 的限制,从手工作坊迈向工业时代。

Claude Code 负责人 Boris Cherny 的工作方式,已经有点像一座小型代码工厂。

今年 6 月,Boris Cherny 在 Fortune Brainstorm Tech 大会上说,自己已经 8 个月没有手写过一行代码。

取而代之的是,他开始管理一支越来越庞大的 Agent 队伍。Boris 表示,大会当天早上,他同时管理着 " 几百个 "Agent;有些时候,这个数字会变成几千,甚至几万个。

这种变化到底能把代码生产推到什么程度,OpenAI 也做过一个颇为极端的实验。

2025 年 8 月底,OpenAI 一个最初只有 3 名工程师的团队,从一个空白代码库开始,用 Codex 开发一款内部软件。

规则很简单:人类不直接写代码,应用逻辑、测试、CI 配置、文档、可观测性和内部工具,全部由 Codex 生成。

五个月后,这个代码库已经膨胀到约 100 万行,期间完成了约 1500 个代码合并请求(Pull Request,PR)。OpenAI 估算,同样的工作,如果全部由人类手写代码,大约需要十倍的时间。

有意思的是,OpenAI 称,他们经常看到单次 Codex 任务连续工作超过 6 个小时,很多时候,人已经睡了,Agent 还在继续干活。

代码生产的上限,就这样开始脱离人类的工作时间。

但很快,新的问题出现了:代码写得太快,人开始看不过来了。

OpenAI 在这次实验中直接写道:随着代码吞吐量增加,他们遇到的新瓶颈变成了 " 人类 QA 能力 "。

因为不管 Agent 能写多少代码,人类的时间和精力毕竟是有限的。

这个团队每周五都要拿出整整一天,专门清理所谓的 "AI slop",也就是 AI 写出的那些屎山代码。它们通常来自 Agent 在快速生成代码时带来的副作用:比如重复或错误的实现模式、不一致的代码风格,以及在系统中不断累积的技术债。

但很快,这事儿也有点干不过来了。

于是 OpenAI 又把 " 擦屁股 " 的工作交给了 Agent:让后台 Codex 任务定期扫描代码库,发现问题,自动提交重构 PR。甚至连大量代码 Review,也开始交给 Agent 之间互相检查,人类只在需要判断的时候介入。

也就是说,AI 开始同时出现在生产线两端:一边疯狂生产代码,另一边帮人寻找这些代码里的问题。

但中间那些必须实际跑完的测试、构建和 CI 任务,并没有消失。

Blacksmith 写了一句很直白的话:如果每一次代码修改仍然需要一个小时才能测试完,那么一个比人类快 100 倍的 Coding Agent,也没有太大意义。

AI 没有消灭软件开发的瓶颈。

它只是把瓶颈,从 " 这个代码到底怎么写 ",推到了 " 这么多代码到底怎么验 "。

AI 代码过剩后,给代码

" 冲厕所 " 的公司贵了十倍

要理解 Blacksmith 为什么能在不到一年的时间里从 6000 万美元涨到 5.5 亿美元,得先弄清楚这家公司的主要业务。

一段代码从程序员手里写出来,到真正出现在用户手机或者电脑上,中间还有很长一段路。

比如你给一个购物网站增加了新的支付按钮,代码写完以后,首先得确认它能不能正常编译;然后跑一遍自动测试,看看按钮能不能用;再跑更多测试,确认这次修改没有顺手把登录、购物车或者退款功能搞坏。

这些事情通常会被组织成一套自动流水线:程序员每提交一次代码,机器就自动把代码拉下来,重新构建软件、运行测试、检查结果。发现问题就打回去,全部通过以后,代码才有资格继续往下走。

而这个流水线,就叫作持续集成(Continuous Integration,CI)。

GitHub 自己的 GitHub Actions,就是最常见的 CI 工具之一。

而 Blacksmith 真正做的,是这套流水线下面的 " 执行层 "。

GitHub Actions 负责规定 " 要跑哪些测试、按什么顺序跑 ",Blacksmith 则提供真正执行这些任务的计算环境。

换句话说,Blacksmith 并不帮你写测试规则,而是提供机器,把构建、测试和部署这些任务真正跑完。

它最初的卖点也很直接:让 GitHub Actions 跑得更快、更便宜。

按照 Blacksmith 的说法,它使用高单核性能 CPU、本地缓存和 NVMe 存储来运行这些任务,大部分 CI 任务速度可以达到 GitHub 托管服务器的约 2 倍;一些 Docker 构建在缓存生效后可以获得更大的加速。对于开发者来说,迁移可能只需要修改一行 GitHub Actions 配置。

Blacksmith 创始人后来形容,CI 本质上就是 " 开发者的管道工程 "。他们甚至开玩笑说,想让 CI" 至少这一次变得性感一点 "。

但 AI 编程恰好把它最不起眼的地方,变成了优势:过去程序员一天提交几次代码,CI 就跑几次;现在 Agent 可以持续改代码、反复尝试,还能并行调用 Subagent,每一次修改都会触发新一轮构建、测试和验证。

Blacksmith 在 A 轮融资时就提到,随着 AI 代码生成工具的发展,代码数量的快速增加正在把 CI 推向新的瓶颈。为此,Blacksmith 没有简单依赖通用云计算资源,而是针对 CI 任务优化自己的硬件和软件栈,提供更快的执行速度、更高的并发能力,以及更适合测试流程的计算环境。

AI 越会写代码,Blacksmith 需要跑的机器反而越多,这门过去藏在软件开发后台的 " 脏活 ",就这样被 AI 放大了。

2025 年 9 月,Blacksmith 已经服务约 800 家组织;不到一年后,这个数字增长到 5000 多家。

公司的员工数量从约 10 人增加到 30 人左右,年化收入则从 1000 万美元进入 " 数千万美元 " 区间,据 TechCrunch 报道,一些最大的客户每年在 Blacksmith 上的支出已经超过 100 万美元。

今天的 Blacksmith,已经不满足于只做一个更快的 CI 执行层,它也开始把 AI 能力往上叠。

比如 Codesmith 可以读取代码仓库、修改代码并创建 PR,也可以根据 CI 失败信息辅助定位和修复问题;Test Analytics 负责整理测试失败信息;Testboxes 则会给 Agent 临时创建一个虚拟测试环境,让它把刚改完的代码真正跑一遍,如果失败,结果再返回给 Agent 继续修改。

一条新的软件生产线开始出现:Agent 写代码,Blacksmith 跑测试;测试失败,AI 总结问题;Codesmith 修改代码,再扔回 Testbox 重新测试。

于是,代码生产和代码验证,都开始变得越来越自动化、Agent 化。

但这里有一个关键区别。

AI 可以自己找 Bug、改代码,但最后那句 " 这段代码真的能用 ",不能靠它自己说,必须真跑一遍。

而只要真的运行,就会消耗真实的计算资源。模型可以把写代码的边际成本不断压低,但服务器不会因为代码是 AI 写的就少跑一次测试,量大再凑个满减。

Blacksmith 赚的,本质上是这最后一笔省不掉的钱。

AI 写代码的终点,

是一个更大的验收产业

事实上,过去一年,几乎所有主流 AI 公司都开始往代码生产线的后半段走。

Codex 刚推出时,OpenAI 还专门提醒用户:即使 Agent 已经可以自己修改代码、运行测试,在真正集成和执行之前,AI 生成的代码仍然需要人工 Review 和验证。

但很快,Codex 自己也开始做 Review。2025 年 9 月,OpenAI 披露,Codex 已经 Review 了公司内部绝大多数 PR,每天可以发现数百个问题,很多问题甚至在人类开始 Review 之前就被找出来。

Anthropic 也在做类似的事情。

Claude Code 在今年 3 月加入了自动安全审查能力,可以直接检查 PR 里的 SQL 注入、跨站脚本攻击(XSS)、身份验证漏洞、不安全的数据处理和依赖漏洞,并通过 GitHub Actions 自动运行。

但 Anthropic 同时强调,这套功能并不能取代既有的安全流程和人工 Review。

GitHub 的动作更加直接。今年 7 月 GitHub Code Quality 正式上线时,GitHub 在官方公告里甚至用了这样一句话:"AI accelerates code output, and Code Quality helps teams ship code they trust."

AI 正在加速代码产出,而 Code Quality 负责帮助团队交付 " 可以信任的代码 "。

这套产品会在 PR 阶段检查代码的可靠性和可维护性问题,并结合 Copilot Autofix 给出修复建议。GitHub 披露,其内部团队会在代码合并前解决 67.3% 的 Code Quality 问题。

过去几年,AI 编程最激烈的竞争发生在代码生成端:谁能写得更快,谁能处理更大的代码库,谁能完成更复杂的任务。

但当代码真的开始过剩,下一场竞争已经悄悄往后移动。测试、持续集成、代码 Review、安全检查,这些过去散落在软件开发流程里的环节,正在被重新拉到台前。

这甚至形成了一种和很多 "AI 替代软件 " 的故事完全相反的关系:模型越强,代码生成的成本越低;代码生成的成本越低,代码产量越大;代码产量越大,后面的测试、Review 和安全审查需求反而越多。

但 Blacksmith 和这些 AI 公司的位置又不太一样。

如果说 Code Review 是在给 AI 生成的代码 " 擦屁股 ",Blacksmith 做的,就是给 AI 生成的那些代码 " 冲厕所 "。

OpenAI、Anthropic 和 GitHub 正在争谁更会 Review 代码,而 Blacksmith 押注的,是这些判断最终都绕不开的一层基础设施。

Coding Agent 可以换,但验证基础设施不能省。不管代码是 Codex 写的、Claude Code 写的,还是人写的;也不管最后是谁负责 Review,只要想知道这段代码到底能不能跑,测试就必须真正执行。

这也是 Blacksmith 最早选择自建 CI 基础设施的原因,它没有简单地在 AWS 等公有云上租机器,而是针对编译、构建和测试这些 CI 任务,自己优化 CPU、存储、缓存和虚拟机调度。

Blacksmith 可以往上做 Agent 和测试环境,但它最难替代的资产,仍然是下面那层让所有代码真正跑起来的 CI 基础设施。

换句话说,别人争的是谁更会看代码,Blacksmith 赚的是代码最后必须跑一遍的钱。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 程序员 编程 b轮融资
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论