
编译 | 杨京丽
编辑 | 李水青
智东西 7 月 29 日消息,今天,AI 大牛、阿里云前副总裁、Lepton AI 创始人贾扬清,在离开英伟达约一个月后再次创业,宣布启动 Intent Lab,并建立了一支名为 Fleet 的自主 AI 团队,希望将用户提出的意图直接转化为生产级软件系统。

与主要负责编写代码的编程 Agent 不同,Fleet 试图承担一支完整工程团队的工作,从理解需求、设计架构、协调任务,到编写代码、测试验证和上线后的持续改进。
Intent Lab 此次公布了 Fleet 的三项早期成果:
一,通过重新设计大模型推理优化工具 TensorRT-LLM 代码,将 GLM-5.2 的推理速度提升了 534%。Intent Lab 称,这是目前GLM-5.2 的最快推理速度。
二,根据一条初始指令,从头构建匹配 SQLite 外部行为的数据库,整轮运行产生8720 万个输出 token,最终通过全部 600 万项验收测试,全部使用开源模型时,成本约为350 美元(约合人民币 2368 元)。
三,打造面向 Agent 的分布式文件系统 AgentFS,部分性能达到 EFS 的626 倍,并完成约 190 万个状态的形式化模型检查和约 300 项集成测试。
一、从理解意图到持续演进,包揽软件开发六个环节
Intent Lab 称,Fleet 的工作方式类似一支遵循工程原则的软件团队,整个开发流程包含理解、设计、协调、构建、验证和演进六个环节。
由于大多数项目都始于一个比较模糊的意图,Fleet 会先与用户共同明确目标,将其转化为具体结果,并确定约束条件和验收标准。此后的全部工作都会围绕这些标准展开。
完成需求理解后,Fleet 会权衡不同方案,确定符合要求的系统接口和架构,并持续记录每项决策会如何影响系统的其他部分。面对由多个组件组成的大型系统,它还会拆分任务、分配责任,并管理任务之间的依赖关系。
后续 Fleet 会一边实现系统,一边完善设计。当开发过程中出现新信息时,它会同步更新架构和代码,让设计方案与实际运行的系统保持一致。验证也会贯穿整个构建过程,Fleet 会综合使用形式化证明、集成测试和运行时故障注入等方法,尽可能在代码仍在变化时发现问题。
软件投入生产后,Fleet 的工作不会停止。它会继续观察系统的实际表现,并把使用情况、性能和成本等信息反馈到设计中,使得软件随着用户需求的变化持续改进。
二、GLM-5.2 推理速度提升 534%,达到 647token/s
Intent Lab 为 Fleet 设定的第一个任务,是重新设计英伟达大模型推理优化工具 TensorRT-LLM 的代码,让 GLM-5.2 在 Grace Blackwell 的计算节点上运行,并自主寻找、实现和验证优化方案。
由于 TRT-LLM 本身已经经过大量性能优化,想进一步提速并不容易。Fleet 最终从内核、运行时、通信和推测解码四个方面入手。
内核层面,Fleet 通过内核融合和 Agent 生成的 PTX、SASS 代码减少内核启动,推理性能提升24%;在运行时层面,利用 H2D 批处理实现稳态解码零拷贝,使性能提升16%;通信层面,将集合通信、残差相加和 RMSNorm 进行融合,使性能提升18%;在推测解码方面,加入 DSpark,一次提出并验证多个候选 token,将推理速度进一步提升约4 倍。最终,端到端推理性能较原版 TRT-LLM 提升534%。

整个优化过程由 Fleet 自主推进。系统先分析性能上限、识别瓶颈,再提出和验证优化方案。没有通过验证的方案会被放弃并重新尝试,通过验证的方案则会被保留,再进入下一轮优化。
测试结果显示,原版 TensorRT-LLM 运行 GLM-5.2 时的速度为102token/s,完成内核、运行时和通信优化后提升至161token/s,加入 DSpark 后达到647token/s,端到端性能提高 534%。

据 Intent Lab 称,这也是目前 GLM-5.2 所达到的最快推理速度。整个过程没有人工介入,都是由 Fleet 端到端完成。
三、一条指令从头构建数据库,产生8720 万个输出 token
Fleet 的第二个任务,是构建一个与现有系统兼容、但内部架构完全从头设计的新系统。
系统现代化并不是简单修改旧代码,而是在保持外部行为不变的情况下重新设计内部架构。在这个任务中,Fleet 没有参考 SQLite 的现有代码和文档,而是把 SQLite 测试集作为验收标准。
Intent Lab 只提供了一条指令:" 构建一个与 SQLite 兼容的 SQL 数据库引擎,使其能够通过全部 sqllogictest 测试用例,性能达到或超过 SQLite。"
Fleet 将工作分给决策、架构设计、编码、测试、审查和质量保障等不同角色。各角色在整个过程中反复协作,随着代码变化持续调整设计、进行测试和审查。
整轮运行共产生8720 万个输出 token。其中,编码占 38.6%,测试占 21.7%,决策和架构设计分别占 17.8% 和 13.3%,审查与质量保障合计占 8.6%。这意味着,构建数据库并不只是生成代码,大量工作也被用于设计、决策和验证。

Fleet 仅根据一行提示词就完成了数据库现代化改造,从头设计并验证系统,最终通过全部 600 万项验收测试。
同一套 Fleet 可以使用不同模型完成任务。使用 Opus 4.8 时,整轮运行成本约为2000 美元(约合人民币 13532 元);全部使用开源模型时,成本约为350 美元(约合人民币 2368 元)。
四、从头构建分布式文件系统,目录查询速度达到 626 倍
Fleet 的第三个任务,是在云环境中构建一个针对 Agent 使用方式优化的分布式文件系统,并严格检查其正确性和容错能力。
Agent 会频繁创建沙箱、扫描目录,并在共享云存储中处理大量小文件。Intent Lab 尝试了亚马逊 EFS 和 S3FS 等现成方案,但这些产品在 Agent 工作负载下均存在限制,因此 Fleet 从头构建了 AgentFS。
在 mdtest 测试中,AgentFS 执行目录和文件创建操作的速度为 EFS 的45 倍,文件读取速度为 EFS 的30 倍。在 Agent 经常使用的状态查询操作中,其优势更加明显:目录状态查询速度达到 EFS 的626 倍,文件状态查询速度达到 EFS 的625 倍。

在 Git 代码库测试中,AgentFS 克隆代码库的速度约为 EFS 的2.5 倍至 3 倍,查询代码库状态的速度约为6.9 倍至 9.5 倍,删除代码库的速度约为13 倍至 14 倍。测试分别使用 etcd 和 Kubernetes 作为小型与大型代码库。S3FS 未能完整检出 Kubernetes 代码库,因此只获得了部分结果。

除了性能,AgentFS 还接受了严格验证。Fleet 检查了 31 个模型中的约 190 万个可达状态,覆盖不同的并发顺序、系统崩溃和竞争情况。AgentFS 还完成了约 300 项集成测试,以及故障注入和模糊测试。
验证过程中,Fleet 发现了一处由编程 Agent 引入的 Bug,该问题可能导致分布式创建和删除操作出现数据损坏。修复并重新验证后,系统中的损坏状态被消除。
结语:从 "AI 写代码 " 走向 "AI 造系统 "
Intent Lab 尝试让多个 Agent 组成一支具备不同分工的自主工程团队。从推理引擎优化、数据库重建到分布式文件系统创建,Fleet 需要自己设计方案、协调任务、完成开发并验证结果。这意味着 AI 编程正在尝试跨过单纯的代码生成环节,进一步进入完整的软件工程流程。
不过,目前这些仍是 Intent Lab 公布的早期成果。自主 AI 团队能否稳定处理更复杂的真实项目,并以可接受的成本长期运行,还需要更多实践验证。
来源:Intent Lab、X


登录后才可以发布评论哦
打开小程序可以发布评论哦