钛媒体 App 9 月 24 日,小米 MiMo 大模型负责人罗福莉宣布,MiMo 大模型下一代版本 MiMo-V3 将搭载全新自研架构,其核心技术 HySparse2 同步对外公开。据技术披露信息,HySparse2 是小米在大模型混合稀疏注意力领域的迭代,对比此前 MiMo-V2.6 搭载的混合 SWA 架构,在 100 万 Token 长度的测试场景下,实现了预填充计算量(FLOPs)降低 5.02 倍,KV 缓存占用直接缩小 4.5 倍。同时在长上下文权威评测 MRCRv2 和 RULER-v2 中获得更高得分,代表智能体推理流畅度的 AgentPPL 和长文本生成稳定性的 LongPPL 指标也实现显著下降,在大幅降低资源消耗的同时,模型的长文本处理与智能推理性能同步提升。(广角观察)


登录后才可以发布评论哦
打开小程序可以发布评论哦