新浪财经 23小时前
无问芯穹Agentic Infra战略发布,跨越计算规模将拓展至十万卡级
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

新浪科技讯 7 月 24 日下午消息,近日,无问芯穹首次公布 Agentic Infra 的 " 前店后厂一中心 " 战略布局,涵盖三大核心技术能力与产品服务体系:一," 算力集散中心 ",Agentic Infra 自主式基础设施平台;二,"Token 工厂 ",Agentic MaaS 大模型服务平台;三,"AI 生产力商店 ",Agentic Infra 行业解决方案。

据悉,这套 Agentic Infra 产品与服务体系立足基础设施,向下汇聚能源和芯片,向上支撑模型和应用,不仅可极致提升底层资源向 AI 生产力转化的规模和效率,更有着 Agentic AI 时代的 AI 原生能力——用基础设施智能体蜂群赋能资源规模扩展、提效 Token 生产,并支持 Agentic AI 的持续进化。

其中,无问芯穹 Agentic Infra 自主式基础设施平台—— " 算力集散中心 ",能把散落的、异构的算力资源统一汇聚、弹性调度、按需分发,为模型与应用层筑牢充足、稳定、可扩展的算力底座。目前,该系统已经受过三大类跨域算力聚合训练实践的生产级考验:

第一,超远距离聚合。无问芯穹已联合中国电信,完成国内首例超 4000 公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升 165%,验证了超远距离跨域集群协同训练的可行性。

第二,多数据中心聚合。打通 4 个不同代际、不同型号的 GPU 集群,联合训练近百亿参数大模型,四集群协同性能提升 41%,有效盘活了不同批次的存量异构算力。

第三,混合云算力聚合。实现本地私有集群与公有云算力的安全互通混训,整体性能提升 68%,帮助众多企业客户解决本地算力不足、云上资源却闲置的错配痛点。

目前,这套跨域训练系统已在全国部署触达超 37,000P 算力、覆盖 16 种主流芯片,盘活了广域分散的异质算力,使之成为 Agentic AI 时代的最坚实底座。

当下,强化学习成为下一代 AI 进步的重要手段。但相较传统预训练,强化学习 " 多角色协同 " 的特性使其对硬件种类需求更加复杂,规模量级也更加庞大。据悉,针对跨域强化学习场景,无问芯穹 Agentic Infra 自主式基础设施平台从网络、平台到框架做一体式深度优化,打通分散的异构集群,实现全局资源一盘棋调度。此外,公司还进一步将优化渗透进全链路的每一个环节,尤其是在跨域通信和容错这两个层面:通过优化计算通信重叠技术,让跨域通信效率直接提升 3-4 倍,实现通信开销 100% 全掩盖,训练不再因跨域通信产生额外耗时损耗;同时搭建了故障无感的训练机制,实现了跨域强化学习训练连续一周 0 中断稳定运行。让大规模跨域强化学习不仅可以 " 跑得通 ",还能 " 跑得快、跑得稳 "。

无问芯穹联合创始人兼 CEO 夏立雪表示,伴随着大规模跨集群强化学习训练技术的持续成熟突破,无问芯穹还将持续深耕并行策略、通信融合、智能算子、极致容错等核心技术," 未来,我们能够将跨域计算资源的支撑规模,持续拓展至十万卡级以上,支撑下一代 Agentic AI 的在线进化 "。(文猛)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 中国电信 基础设施 芯片 ai时代
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论