来源:环球市场播报

戴夫・布朗在 AWS re:Invent 2025 大会介绍 " 地幔计划(Project Mantle)
作者:凯瑟琳・珀洛夫、凯文・麦克劳克林
2025 年初,亚马逊云内部气氛紧张。用于运行 AI 大模型的新服务 Bedrock 漏洞频发。知情人士透露,客户反复收到报错信息,有时需要等待数周才能拿到所需算力。
两名直接了解内情的人士称,在各类问题集中爆发之际,资深工程负责人安东尼・利戈里牵头团队,制定 Bedrock 重构方案 —— 也就是地幔计划(Project Mantle),旨在解决限流与报错问题,让这项服务具备扩容能力,服务更多用户。利戈里联合另外五位资深工程师,借助 AWS 自研 AI 编程工具 Kiro 打造 Mantle。
Mantle 于去年 12 月正式上线。数月之后,AWS 在 Bedrock 的模型矩阵中加入 OpenAI 模型(平台原本已接入 Anthropic 的 Claude 等模型),业务随即快速升温。
咨询公司 Caylent 首席技术官兰德尔・亨特表示,现在已经有一部分客户将云预算从微软 Azure 转移到 AWS。虽然 AWS 在云市场份额和营收规模上大于 Azure,但此前微软云是唯一可以提供 OpenAI 模型的平台,这让它领先其他云厂商。
他称:" 客户现在可以在 Bedrock 获得稳定可靠的性能,而在 Azure,性能表现难以预估。" 亨特说,他服务的金融客户在 AWS 上的开销自 5 月以来增长了四倍。在他看来,AWS 这项 AI 服务性能优于微软等竞品。
亚马逊 7 月披露,2026 上半年 Bedrock 新增客户数量已经超过该服务上线头两年总和;第二季度客户在 Bedrock 上的花费,超过此前所有季度的总和。亚马逊没有单独披露 Bedrock 营收,但财报显示 AWS 二季度增速提升 9 个百分点至 37%;微软 Azure 增速 42%,环比提升 2 个百分点。
微软在声明中表示:" 随着 AI 应用普及,工作负载从模型开发转向大规模推理与智能体应用,微软持续迭代 AI 技术栈,满足客户不断变化的需求与持续增长的 AI 算力需求。"
Bedrock 早期的困境说明:即便 AWS 是全球市场份额最高的云厂商,AI 巨大的算力需求也给它带来重重难题。
AWS 发言人在声明中表示:" 为跟上 Bedrock 激增的需求,我们从头重写推理引擎,兼顾性能与安全。这套方案已经获得客户广泛认可。Bedrock 是 AWS 史上增长最快、规模达数十亿美元的业务,已有数十万客户使用。"
技术难题
2022 年底 ChatGPT 发布拉开 AI 竞赛序幕,时隔近一年,AWS 在 2023 年秋季推出 Bedrock。亚马逊此前已经拥有 SageMaker 等 AI 工具,但在 AI 浪潮初期起步不顺,给微软创造机会。一名项目参与者称,AWS 工程师每周工作 60 小时,打造这项服务,让客户能够把云应用接入大语言模型。
AWS 推出这项新服务,部分原因是客户无法在原有系统上运行头部 AI 模型。和普通软件不同,大模型使用的是 AI 企业严格保密的专有权重,模型厂商不允许客户直接访问权重。
但仓促开发上线的 Bedrock,在后续两名项目参与者看来,产品有种 " 拼凑感 "。一位内部人士和另一名项目成员表示,原有架构无法充分利用 AI 芯片算力,导致客户频繁报错,限制 Bedrock 大规模扩容。
AWS 发言人回应:" 我们持续迭代服务,力求尽善尽美。但在我们这种体量下,偶尔会出现难以预见的问题,我们会识别、同步客户并尽快解决。"
与此同时,客户算力配额问题越来越突出。每个用户拥有基础算力额度,一旦用量上升就会被限流,需要等待 AWS 释放更多算力。一名前员工称,部分客户等待时长最长可达三周。
一名产品团队成员透露,2025 全年不断有客户投诉,亚马逊限制他们调用 Anthropic 模型。AWS 管理层一度担心 AI 代码初创公司 Lovable 会因为 Bedrock 调用 Claude 困难而迁出平台。
一名看到这份内部文档的人士称,2025 年初,AWS 销售团队传阅一份内部报告,指出 Bedrock 的技术缺陷正在阻碍获客。同期 The Information 报道,高层将 Bedrock 算力危机称作一场 " 灾难 "。
亨特表示,客户实测发现:2024 年,Bedrock 上运行 Anthropic 模型的吞吐(token / 秒)最高比直接对接 Anthropic 慢 63%。企业直连模型厂商,是通过 API 调用,模型本身依然托管在云服务器;Anthropic 除 AWS 外,还在谷歌云提供模型直连 API。
Bedrock 的问题甚至引发亚马逊其他业务线高管不满。两名听过相关谈话的人士称,时任亚马逊电商高级副总裁戴夫・特雷德韦尔在 2025 年初向 AWS 管理层表示,Bedrock 持续报错、算力紧张,让他想直接改用 OpenAI 原生模型(OpenAI 原生模型主要托管在微软 Azure)。一名接近亚马逊的人士对特雷德韦尔这番说法提出异议,特雷德韦尔现已转岗至 AWS。
Mantle 的解决方案
随后,利戈里提出打造 Bedrock 新版本的构想。在去年 12 月 AWS 年度 re:Invent 客户大会上,时任云服务器业务负责人戴夫・布朗推出 Mantle —— 支撑 Bedrock 运行的全新技术层。他介绍,Mantle 的目标是让 Bedrock 可以持续扩容,满足未来预期需求。
布朗在大会主旨演讲中说:" 随着模型迭代、使用量上涨,我们意识到推理需要一套全新架构。"(布朗近期离开 AWS,加入 Meta)
布朗同时指出初代 Bedrock 架构缺陷:它沿用传统 Web 服务的设计思路搭建。
但驱动应用的大模型运行过程,也就是推理,远比传统云业务复杂。传统云业务主要是客户存储、调取数据分析;推理需要随时调度足够服务器承接波动巨大的负载。2025 年,客户开始用 AI 处理更复杂任务,这一矛盾愈发明显。
布朗在 re:Invent 上称:" 推理的运行逻辑,和我们过去二十年持续优化的传统计算模式完全不同。"
Mantle 专门适配复杂 AI 任务尖峰负载:算力瞬间冲高,随后迅速回落。早期 AI 任务相对简单,旧架构尚可支撑,新的 AI 智能体长任务,则需要全新的算力分配机制,AWS 发言人如此说明。
为解决大规模场景下的算力尖峰问题,Mantle 新增功能:客户可对 Bedrock 内不同任务设置优先级,AWS 可以把更多算力分配给客户的高优先级任务。Mantle 还做了负载隔离,发言人打比方:就像演唱会场馆设置多个独立入口,单个客户的高负载只会占用自身配额,不会挤压其他客户资源。
AWS 还强化 Mantle 与已有服务 Journal 的兼容性。Journal 可以保存 AI 智能体的任务进度,长任务中途中断后无需从头重新运行,以此适配越来越多的长时 AI 任务。
参与 Mantle 研发的 AWS 前副总裁乔・马格拉莫罗夫,在今年 1 月 AWS 播客节目中表示:" 通过 Mantle,我们认识到推理本质上不完全是 Web 服务,更像一套调度系统。"(马格拉莫罗夫上月跟随布朗一同加入 Meta)
API 原生兼容
Mantle 实现对 OpenAI、Anthropic 原生 API 直接兼容。初代 Bedrock 要求客户编写定制代码,才能调用这些 AI 实验室的模型接口。
2026 年初 Mantle 全面落地。一名前员工说,客户申请扩容的等待时间,从 2025 年初的三周,在当年年底缩短至两天。亚马逊 CEO 安迪・贾西在 2026 致股东信中,将 Mantle 称为 " 大获成功的 Bedrock 服务的技术基石 "。
亚马逊称,2025 年后期,Bedrock 主要跑在自研 AI 训练芯片 Trainium 之上。在英伟达芯片持续供给受限的背景下,这为 AWS 新增算力来源。
当然,客户使用该服务偶尔仍会遇到延迟。一家借助 Mantle 在 Bedrock 调用 Claude 的企业经理表示,过去数月曾间歇性遭遇服务中断,最长一次持续约 11 小时。
AI 咨询公司 Loka 机器学习负责人博扬・亚基莫夫斯基称,已有六家客户转至 Bedrock 上运行 OpenAI 模型,不再直连 OpenAI 或者使用 Azure。
亚基莫夫斯基说:" 迁移有不少好处,推理速度更快、整体吞吐量更高;成本不变,其他参数也完全一致。"


登录后才可以发布评论哦
打开小程序可以发布评论哦