【CNMO 科技消息】8 月 7 日消息,AMD 于周四收盘后宣布收购 AI 芯片初创公司 Taalas,以强化其在 AI 推理领域的竞争力。Taalas 的核心技术是将模型权重直接蚀刻到硅片中,而非依赖传统的高带宽内存存储,这一方案有望将推理性能提升一个数量级甚至更多。

AMD
Taalas 成立于 2023 年,总部位于多伦多,其技术路线与常规 GPU 以及 Groq LPU、Cerebras 晶圆级加速器等数据流架构截然不同。该公司芯片不依赖 HBM 来存储模型权重,而是将其直接蚀刻进硅片,形成所谓的模型专用集成电路。芯片主要由两个区域组成:一是用于存储模型权重的掩膜 ROM 召回结构,二是用于存放 KV 缓存和微调适配器的 SRAM 召回结构。
今年 2 月,Taalas 发布了其首款测试芯片 HC1,采用台积电 6 纳米工艺制造。初步基准测试显示,该芯片运行 Meta 的 Llama 3.1 8B 模型时速度达到每秒 16960 个 token,这一成绩在当时是英伟达 GPU 的 48 倍、Cerebras 加速器的 8.5 倍。尽管 Llama 3.1 以当前标准来看已不算最新模型,但这款光罩尺寸的芯片主要目的在于验证技术概念的可行性。
Taalas 计划在今年夏季推出第二代 HC2 芯片,目标将单芯片支持的参数量提升至 200 亿。虽然这一数字听起来不算庞大,但通过与 GPU 类似的流水线并行方式,权重可以分布在多个加速器上运行。以单芯片 200 亿参数计算,仅需 50 颗加速器即可支持万亿参数级别的大模型,而 AMD 恰好拥有机架级计算平台和内部系统设计团队来满足这一需求。相比之下,英伟达近期发布的 LPX 系统运行同等规模模型需要数十颗 GPU 和至少 2000 颗 Groq LPU,Taalas 方案在空间占用和功耗效率方面优势明显。
据知情人士透露,AMD 计划将基于 Taalas 技术的芯片与其 Instinct 系列的 Helios 机架配对使用,形成一种分离式架构:计算密集型的提示词处理由 GPU 负责,而 token 生成任务则卸载到 Taalas 加速器上。另一种可能的部署模式是,客户先在 Instinct 加速器上部署和验证模型,待确认效果满意后再迁移至 Taalas 加速器,形成类似 tick-tock 的迭代节奏。
AMD 人工智能高级副总裁 Vamsi Boppana 在声明中表示,AMD 正在构建全栈式 AI 平台,为客户提供灵活性,使其能够为每一项 AI 工作负载部署最合适的计算解决方案。
不过,这项技术也存在明显的局限性。由于模型权重被固化在硅片中,一旦芯片部署完成便无法更换模型,任何超出 LoRA 适配器规模的改动都需要重新流片,不仅成本高昂而且周期较长。在 AI 模型几乎每月都有新版本推出的当下,这意味着采用 Taalas 技术的客户必须对模型选择有充分把握。Taalas 方面则表示,虽然新模型确实需要重新流片,但无需从头开始,只需更改两层金属层即可,成本和周期都大幅降低。
从应用场景来看,这项技术主要面向 AI 模型开发商、基础设施提供商和部分推理服务商。Taalas 此前曾表示,将模型权重蚀刻进硅片的成本比训练前沿模型低 100 倍。AMD 目前与 OpenAI、Anthropic 和 Meta 等主要模型厂商均保持着密切合作关系,未来看到 GPT 或 Claude 系列模型部署在 Taalas 与 Instinct 混合架构上并不令人意外。
此外,该技术对模型开发方式也可能产生深远影响。开发者近年来通过测试时缩放技术来降低模型幻觉,即允许模型在回答前进行更长时间的推理,但代价是消耗更多 token、成本上升且用户等待时间延长。如果 Taalas 技术能够将单 token 成本大幅降低并将输出速度提升 10 倍甚至 20 倍,模型开发商可能会进一步延长推理时间以换取更高的准确性。
此次交易预计将在第四季度完成,尚待监管部门批准。AMD 未披露具体交易条款,但据悉这是一次完整的收购而不仅仅是人才收购。这笔交易被视为 AMD 挑战英伟达在 AI 硬件领域主导地位的最新举措,与英伟达去年 12 月与 Groq 达成的 200 亿美元授权协议形成对标,目标都是让高性能推理服务在 AI 智能体等应用场景中运行得更快、更便宜。


登录后才可以发布评论哦
打开小程序可以发布评论哦