
两名知情人士透露,谷歌正在研发一款全新服务器芯片,这款芯片可将 Gemini 大模型的底层架构方案直接固化在硅基硬件中,能够极大提升谷歌面向用户提供 AI 服务的运行效率。
这款内部代号为 Frozen v2(固化二代)的芯片,用于缓解谷歌当前严峻的 AI 算力缺口。算力不足不仅引发了谷歌内部各部门矛盾,还导致谷歌云不得不回绝大量外部客户的算力采购订单。参与该芯片研发的工程师测算,按单位功耗可处理的 Token 数量(AI 算力核心计量指标)计算,该芯片正式落地后,能效可达谷歌现有最新一代自研 AI 张量处理器(TPU)的 6 至 10 倍。
该芯片命名为 Frozen(固化),源于其设计思路:将大模型的部分运算逻辑永久蚀刻在芯片硅片内部。工程师现阶段仍在敲定芯片核心功能模块、各单元协同工作机制。知情人士称,谷歌计划最早在 2028 年正式投产部署该芯片。
Frozen 项目并非用来替代谷歌现有的 TPU 张量处理器,而是开辟一条全新的自研芯片产品线。当下行业使用最广泛的英伟达 GPU、谷歌 TPU 均属于通用型 AI 加速芯片,能够兼容各式各样的 AI 模型。
通用芯片在运行不同大模型时,需要实时执行大量繁杂的运算调度判断;而 Frozen v2 将 Gemini 模型的部分固定运算逻辑内置在硬件层面,精简了芯片的运算步骤与数据搬运量。
知情人员表示,硬件内置运算逻辑能够缩短 AI 问答的响应时延,有望支撑谷歌落地一批全新 AI 应用。但这套方案也押注谷歌会长期沿用当前 Gemini 大模型的研发架构;只有后续迭代的 Gemini 模型基于芯片设计时的底层架构开发,这款芯片才能正常适配新一代模型。
研发人员补充,芯片保留了弹性调整空间,可通过更新模型权重(决定模型应答逻辑的核心参数配置)完成模型版本升级迭代。
谷歌官方发言人对外回应:谷歌各团队始终在持续研发、试验各类创新技术,力求为用户与企业客户交付性能、效率最优的 AI 服务。发言人还表示:并非所有研发项目最终都会量产落地,但这种全方位的技术探索,是谷歌全栈式 AI 布局的关键一环。
推理芯片为何成为行业研发热点
一大批企业都在布局 AI 推理芯片(承载大模型线上运行的算力硬件),既有 SambaNova、d-Matrix 这类初创公司,也包含 OpenAI、微软等科技巨头。各家的目标都是打造比英伟达 GPU 能效更高的推理芯片,缓解全球算力紧缺、算力成本高企的行业痛点。英伟达自身也在去年 12 月斥资 200 亿美元,收购推理芯片初创企业 Groq 的相关技术授权。
各家厂商的技术路线与谷歌 Frozen 方案存在差异,但 Frozen v2 的设计思路和加拿大芯片初创公司 Taalas 相近:二者均把特定 AI 模型的运算逻辑硬编码至芯片硬件。Taalas 已完成超 2 亿美元融资,投资方包含 Quiet Capital、富达投资。
Frozen v2 的设计源自初代 Frozen 方案,该初代构想由谷歌 DeepMind 首席科学家杰夫・迪恩牵头,计划直接将模型权重烧制在芯片硬件中。但这套多年前的方案存在明显短板:芯片只能适配固定版本的 Gemini 模型,硬件服役生命周期过短,最终被搁置。
另一名知情人士透露,谷歌团队目前正在权衡芯片内置固化数据的体量,在硬件能效与产品通用性之间寻找平衡点。
谷歌自研芯片的过往收益
谷歌多年的自研芯片布局已经兑现价值。今年谷歌正式发布第八代 TPU,并且开始直接向云客户售卖该芯片产品,正面冲击英伟达在 AI 芯片市场的垄断地位。谷歌已和 Meta 签署数十亿美元 TPU 供货协议,同时积极向其他原本忠实采购英伟达硬件的云厂商推销自家 TPU 产品。
依靠自研芯片搭配 Gemini 模型协同设计,谷歌目前运行自家大模型的硬件成本已经下降。只不过现有 TPU 仅嵌入了少量模型底层信息,集成度远不及 Frozen 系列芯片。
谷歌现阶段没有规划大规模量产 Frozen v2 芯片,产能规模远低于 TPU。较小的量产体量意味着谷歌无需在项目早期就引入外部设计、代工合作方。谷歌也将本次 Frozen 二代视作一次技术试验:待未来 AI 大模型架构趋于定型后,本次研发积累的经验,能够帮助工程师设计出更加专用化的高性能 AI 芯片。


登录后才可以发布评论哦
打开小程序可以发布评论哦