触摸史迹 9小时前
灵汐科技WAIC发布新集群 能效比提3-10倍 推理赛道变了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

WAIC 开展那天,灵汐科技的展台被挤得水泄不通,凑过来的全是 AI 圈内的从业者。大伙盯着屏幕上跳出来的参数,半天没回过神—— 30kW 的功耗,居然能跑出近 100P 的 FP16 算力?这可不是靠堆 GPU 堆出来的常规操作,是类脑架构往大模型推理赛道扔出的王炸,之前全行业默认 GPU 是推理的唯一答案,现在这条共识要晃悠了。

很多人没意识到,未来 AI 基础设施市场,八成份额都会落在推理侧,不是大家更关注的训练侧。之前整个行业把九成资源都砸去做大模型训练,现在训练跑完了,天天要高频调用的推理,才是真的决定 AI 能不能落地到各行各业的核心。现在 Token 经济火得一塌糊涂,AI 编程、生成、多智能体协同这些热门高价值场景,对首 token 延迟的要求已经从秒级直接压到了百毫秒以内。传统 GPU 架构绕不开 " 搬运数据再计算 " 的逻辑,天生就是延迟高、能耗大,怎么迭代都没法从根上解决这个问题。

就连英伟达都下场做 Groq 加码高速推理,说白了就是默认了传统 GPU 架构在推理场景的天生缺陷。行业找了好久,就等着一个跳出 GPU 路径依赖的新方案。类脑芯片存算一体、事件驱动、众核并行的特性,刚好戳中了推理场景最需要的低时延、低功耗痛点。这次灵汐发布的 LynAInfra128 算力柜,最让人意外的不是近 100P 的 FP16 算力,是整机功耗死死控在了 30kW 以内。换算下来,它的推理能效比比传统 GPU 方案直接涨了 3 到 10 倍,首 token 延迟直接压到了几十到百毫秒级别。

这套集群是用国内已经规模化商用的类脑芯片搭出来的,一个机柜塞进去 128 张 HP640 系列板卡,级联了数千颗类脑芯片,核心算力部件没用到任何国外货。它没走 GPU 堆晶体管提性能的老路,直接把计算单元搬到了存储单元旁边,省了一大堆数据来回搬运的能耗浪费。自研的 LynxLink 高速互联协议配上统一内存地址编译技术,既能单机柜纵向堆算力,也能多机柜横向无感级联,直接打破了单卡单节点的显存和算力上限。不管是小参数的垂直行业模型,还是超大规模的通用大模型,都能轻轻松松适配部署。

更良心的是,整套集群用的就是普通风冷散热,模块化设计完全兼容现有智算中心的机柜、供电、网络配套。客户不用花大价钱改造机房,就能直接上线用,部署门槛比大家想的低太多。之前行业算算力划不划算,都是看单位成本能买到多少 P 算力。现在灵汐这套方案,直接把衡量标准换成了单位瓦特能输出多少有效推理比特,玩起了 " 瓦特换比特 " 的全新评价体系。

这种范式切换带来的好处,一层层传下去全是惊喜。智算中心不用为了散热铺一大堆液冷管线,算力集群的碳排放直接降了一大截,刚好契合国家双碳战略的要求。企业客户的单位算力推理开销直接砍半甚至更多,大模型落地的整体拥有成本直接降了好几个档次。

往深了说,这套全链路自研的类脑算力方案,完全跳出了国外主导的 GPU 算力架构路线,给国产算力供应链补上了高速推理场景的关键一块。再也不用被海外芯片的供货节奏卡脖子,想扩产能就扩产能,想落地就落地,主动权全握在自己手里。

之前不少人都觉得,类脑芯片就是实验室里摆着的前沿概念,不知道猴年马月才能商用落地。谁能想到它这么快就完成了规模化商用,还直接做成了能对标 Groq 的高性能推理集群。这说明国产算力的创新路线,早就不是跟在海外 GPU 屁股后面追了,已经走出了一条完全不一样的新赛道。

未来两三年,智算中心的采购清单里,类脑算力的占比肯定会越来越高。说白了,对绝大多数客户来说,能少交电费、少改机房、延迟还更低的算力方案,没人会说不。大模型落地到千行百业,最头疼的从来都不是训练算力够不够强,而是推理侧的成本能不能压得足够低,延迟能不能做得足够小。这次灵汐的类脑架构给出的答案,直接把国产高速推理的天花板往上抬了一大截。接下来整个推理赛道的竞争逻辑,都得跟着这套新范式重新改写。

参考资料:人民日报 国产人工智能算力创新发展观察

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

gpu 芯片 ai 英伟达 基础设施
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论