
编译 | 茄子
编辑 | 程茜
智东西 7 月 21 日消息,昨日,The Information 援引知情人士消息报道,谷歌正在研发一款面向Gemini模型的新型 AI 服务器芯片 Frozen v2。该芯片计划将 Gemini 模型部分架构直接集成到芯片中,通过减少运行过程中的计算决策和数据搬运,提升 AI 推理效率。
知情人士透露,谷歌工程师预估,按照单位功耗能够输出的 Token 数量计算,Frozen v2 的效率可能达到谷歌最新自研 AI 芯片的6 至 10 倍。
这款芯片在谷歌内部被非正式地称为 "Frozen v2"。知情人士称,谷歌希望借此缓解严重的 AI 算力短缺问题。算力紧张已经在谷歌内部引发矛盾,还迫使谷歌云拒绝部分外部客户的订单。
知情人士还透露,谷歌最快可能于 2028 年部署这款芯片,但该公司目前仍在确定 Frozen v2 的主要功能、各部分的协同方式,以及究竟要将多少模型信息固化在芯片中。
The Information 还提到,Frozen v2 并非谷歌首次探索模型专用芯片。此前,谷歌 DeepMind 首席科学家杰夫 · 迪恩(Jeff Dean)曾计划将模型权重直接固化到芯片中,但由于该方案的芯片只能适配特定版本模型、生命周期过短,最终被搁置。
一、把 Gemini 部分逻辑写入芯片,减少芯片数据搬运
当前主流 AI 芯片大多强调通用性和可编程能力,如英伟达 GPU 能够支持多种 AI 模型和计算任务。这类芯片需要支持多种不同 AI 模型,因此在运行过程中需要根据模型需求完成大量计算调度和决策。谷歌 TPU 也类似,虽然它针对 AI 进行了优化,但也需要兼顾不同模型运行需求。
而 Frozen v2 采用了不同思路。据爆料,谷歌计划将 Gemini 模型部分信息直接 " 固化 " 到芯片中,让硬件提前了解模型运行方式,从而减少执行过程中的决策步骤,以及芯片内部的数据移动。
简单来说,传统 GPU 更像一台能够运行各种软件的通用计算设备,而 Frozen v2 则更接近针对 Gemini 优化的专用硬件。这种设计可能带来更快的响应速度,并帮助谷歌降低 Gemini 模型运行成本。
不过,模型专用化也意味着更强绑定。如果未来 Gemini 模型采用新的底层架构,那么 Frozen v2 可能无法直接适配。谷歌因此仍需要在芯片效率和模型灵活性之间寻找平衡。
据知情人士透露,谷歌目前仍在决定 Frozen v2 中应该固定多少模型信息,以平衡性能提升和未来兼容能力。谷歌发言人在一份声明中称,研究团队一直在研究和试验新的技术,以提高面向用户和客户的系统性能与效率,并非所有研究项目都会投入生产,但这些探索是谷歌全栈技术路线的重要组成部分。
二、推理芯片竞赛升温,初代 Frozen 方案曾被搁置
过去几年,AI 基础设施竞争围绕训练展开。大规模模型训练需要大量 GPU 集群,英伟达凭借 GPU 生态占据主导地位。The Information 去年 12 月报道,英伟达去年 12 月通过一笔价值 200 亿美元(约合人民币 1353 亿元)的交易,获得了 AI 推理芯片创企 Groq 的相关技术授权。
包括 SambaNova、d-Matrix、OpenAI 和微软在内,多家公司都在开发 AI 推理芯片。这些公司的共同目标,是以比英伟达 GPU 更高的效率运行 AI 模型,缓解算力短缺并降低成本。
与此同时,加拿大芯片创企 Taalas 也采取了谷歌类似思路,将特定 AI 模型直接硬编码进芯片。Taalas 目前已经获得超过 2 亿美元(约合人民币 13.5 亿元)融资,投资方包括 Quiet Capital 和富达投资。
据 The Information 透露,Frozen v2 此前还有一个更激进的版本。由谷歌 DeepMind 首席科学家杰夫 · 迪恩主导的初代 Frozen 方案,曾计划直接将模型权重固化到芯片中。
但这种设计会让芯片只能运行某个特定版本的 Gemini。一旦模型更新,芯片便可能迅速失去使用价值。由于预期生命周期过短,谷歌最终搁置了初代方案。
据知情人士透露,Frozen v2 不再固化完整模型权重。但谷歌目前仍在评估应该锁定多少模型信息,以平衡灵活性与运行效率。
三、Frozen v2 并非取代 TPU,谷歌先将其作为技术试验
虽然 Frozen v2 受到关注,但知情人士透露,谷歌并没有计划用它替代 TPU。据报道,Frozen 项目旨在建立一条区别于 TPU 的新型自研芯片路线。
今年,谷歌发布了第八代 TPU,并开始直接向谷歌云客户推销这款芯片,挑战英伟达在 AI 芯片市场的主导地位。此外,谷歌还与 Meta 签署了价值数十亿美元的 TPU 租赁协议,并在尝试向其他云服务商销售 TPU。

The Information 称,相比单纯依赖英伟达 GPU,谷歌自研 TPU 已经帮助其降低 Gemini 模型运行成本。因为,谷歌在开发 TPU 时也考虑了 Gemini 的需求,只是 TPU 集成的模型信息远少于 Frozen v2。Frozen v2 面向 Gemini 进行更深度的定制,但适用范围也比 TPU 更窄。
据知情人士透露,谷歌目前没有计划让 Frozen v2 的产量达到 TPU 的规模。因为,较小的生产规模可以使谷歌在推出大型产品之前,更晚地引入外部芯片设计和制造合作伙伴。该知情人士还称,谷歌将这一代产品部分视为技术试验,并希望从中积累开发专用 AI 芯片的经验。
结语:用部分通用性换取更高推理效率
Frozen v2 并不是 TPU 的替代品,而是谷歌针对 Gemini 开辟的一条专用芯片路线。谷歌希望通过将部分模型架构和计算决策固化到硬件中,以减少推理过程中的计算步骤和数据搬运,从而以更低功耗处理更多用户请求。
不过,更高的专用化程度也意味着芯片与模型架构绑定得更紧。Frozen v2 最快要到 2028 年才能部署,届时 Gemini 底层架构能否保持稳定,以及 6 至 10 倍的预期能效提升能否在实际应用中实现,将成为决定这一项目价值的关键。
来源:The Information


