智东西 21小时前
小扎高调开战闭源AI!推30B智能体模型,消费级显卡就能跑,杨立昆点赞
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

智东西

编译 | 茄子

编辑 | 程茜

智东西 8 月 11 日消息,昨晚,Meta 推出300 亿参数本地 Agent 模型 Muse Glimmer,并宣布开放权重,这也是 Meta 成立超级智能实验室后首次开放模型权重。

随后,Meta 创始人兼 CEO 马克 · 扎克伯格(Mark Zuckerberg)发长文阐述Meta 的超级智能路线,并呼吁减少美国对开源 AI 模型的限制,批评部分 AI 厂商通过封闭模型控制技术和用户,同时支持继续实施芯片出口管制

他还预告 Meta 即将开放最新旗舰模型Muse Spark 1.2 的权重

▲扎克伯格官宣开放 Muse Glimmer 权重并发长文(图源:X)

据技术博客称,Muse Glimmer 可以调用工具、进行多步推理、处理文字和图片,并在工具执行失败后分析问题并重新尝试。Meta 将其定位为本地个人 Agent 的基础模型,可用于整理文件、管理日程、起草消息、本地编程和函数调用等场景。

Meta 称,Muse Glimmer 针对持续运行的本地 Agent 工作流进行优化,量化后的体积不到 20GB,可以在部分 Mac 或配备单张消费级显卡的 PC 上运行,即使没有网络连接也能执行任务

Meta 前首席 AI 科学家、AI 公司 AMI Labs 创始人、图灵奖得主杨立昆(Yann LeCun)直接在扎克伯格评论区鼓掌称,(开放权重)是很棒的一步。

▲杨立昆评论(图源:X)

Meta 首席 AI 官、超级智能实验室负责人亚历山大 · 王(Alexandr Wang)称,Muse Glimmer 是一款300 亿参数稠密模型,采用 Apache 2.0 开源协议开放权重,可在24GB显存显卡上本地运行,且不会削弱智能体任务的执行稳定性

▲亚历山大 · 王官宣开放 Muse Glimmer 权重并预告开放 Muse Spark 1.2 权重(图源:X)

Meta 已在 Hugging Face 开放 Muse Glimmer 的模型权重,开发者可以下载并在本地部署。

▲ Muse Glimmer 的开放权重页面(图源:Hugging Face)

Muse Glimmer 发布后,多名开发者测试了它在个人设备上的运行效果。现有实测显示,该模型能够离线操作 Mac 应用、一次生成多款可运行游戏,并在单张 RTX 4090 上支持长上下文,但其响应速度、token 消耗和工具接口仍存在优化空间。

有网友实测称,Muse Glimmer 的着色器生成能力十分亮眼。他在 BF16 精度下对比 Meta Muse Glimmer 30B 与 Qwen 3.6 27B。他让二者生成 FBM 动态地形,Muse Glimmer 30B一次就能产出完整山地渲染图,Qwen 3.6 27B 重试 4 次输出的仍是模糊失效画面。

▲网友对比 Muse Glimmer 30B 和 Qwen 3.6 27B 的着色器生成能力(图源:X)

基准测试方面,在 Meta 公布的 22 项 Agent、编程、多模态和通用能力测试中,Muse Glimmer 拿下12 项 SOTA,优势主要集中在 Agent 任务和部分推理测试。但该模型在桌面操作、编程、多模态上弱于 Qwen 3.6;在两项安全测试中,Gemma 4 以更低的违规率和攻击成功率领先 Muse Glimmer。

▲ Muse Glimmer 在 Agent、编程、多模态测试中的表现(图源:Meta )

从技术路线看,Meta 称,Muse Glimmer 能够在本地运行,主要依靠知识蒸馏、4 比特量化和 DFlash 推测解码。Meta 将完整精度下超过 55GB 的模型压缩至不到 20GB,并利用配套草稿模型提高输出速度。

扎克伯格在长文中称,超级智能不应集中在少数公司或个人手中。Meta 超级智能实验室将恢复开放部分模型,面向数十亿用户提供免费或低价的个人 Agent,并允许有更高需求的用户付费购买额外算力;该公司还将推出连 Meta 自身也无法读取用户数据的完全私密模式。

▲ Meta 认为应将超级智能普及到每个人手中(图源:Meta )

此外,扎克伯格还在长文中宣布设立 " 未来属于每个人 " 基金(Future Is For Everyone Fund),用于支持 Meta 在美国建设和运营数据中心的社区。外媒 Axios 随后确认,该基金初始规模为 10 亿美元(约合人民币 68 亿元),将用于支持当地教师、急救人员以及能源和水务基础设施。

Muse Glimmer 开源链接:

https://huggingface.co/meta-models/Muse-Glimmer-30B

扎克伯格文章链接:

https://www.meta.com/thefutureisforeveryone/

一、三组网友实测:能操作 Mac、生成游戏,单卡支持 13 万 token 上下文

一位开发者通过 Cua Driver 验证了 Muse Glimmer 的本地电脑操作能力,他让 Muse Glimmer 在 Mac 本地操作备忘录和提醒事项。

在实测中,该模型结合 macOS 辅助功能接口与屏幕图像识别完成点击操作,完成了备忘录中新建清单、提醒事项中添加日程提醒任务。

▲ Muse Glimmer 在本地操作 macOS 备忘录(图源:X)

▲ Muse Glimmer 在本地操作 macOS 提醒事项(图源:X)

这位开发者称,这是他们第一次感到 "离线操作电脑" 真正具备了可用性。尽管 Muse Glimmer 在搭载苹果自研芯片的消费级设备上仍存在较高延迟,但如果任务对速度要求不高,这是他首款愿意推荐用于 " 启动后无需持续监督 " 工作流的本地模型。

不过,Muse Glimmer 在测试中也在操作上产生混乱。比如,在 Muse Glimmer 执行任务时,工具定义、屏幕截图和辅助功能树会迅速占用该模型上下文,测试团队精简工具接口后,Muse Glimmer 才顺利完成任务。

针对这一问题,这位开发者称计划减少工具及电脑状态信息的上下文占用,使模型能够将更多上下文用于任务本身,并连续运行更长时间。

AI 平台 Atomic Chat 对比了 Muse Glimmer、Gemma 4 31B 和 Qwen 3.6 27B 的本地编程能力。三款模型分别在配备 32GB 显存的 RTX 5090 上运行,并根据相同提示词一次生成《太空侵略者》《俄罗斯方块》和《打砖块》三款复古街机游戏。

▲ Atomic Chat 比较三款本地模型生成复古街机游戏的效果(图源:X)

Atomic Chat 称,Muse Glimmer 生成的三款游戏均可正常运行。《太空侵略者》中的敌机会随击杀加速,《俄罗斯方块》可以锁定方块并消除行,《打砖块》中的砖块也能正常击碎,测试过程中没有出现卡死或崩溃。

相比之下,Gemma 4 生成的《俄罗斯方块》存在方块堆积逻辑问题;Qwen 3.6 虽然完成了三款游戏,但《打砖块》中的部分球会直接穿过挡板。

不过,Muse Glimmer 也花费了更多时间和 token。其运行记录为 8.34 万 token、耗时 17.7 分钟,明显高于 Qwen 3.6 的 2.37 万 token 和 5.4 分钟,以及 Gemma 4 的 1.78 万 token 和 4.5 分钟。

▲ Atomic Chat 比较 Muse Glimmer、Gemma 4 31B 和 Qwen 3.6 27B 的本地编程能力(图源:X)

另一名开发者主要测试了 Muse Glimmer 在消费级显卡上的部署效率。他称,在单张 RTX 4090 上运行 UD-Q4_K_XL 量化版本时,该模型在不量化 KV 缓存、不开启 DFlash 推测解码的情况下,可配置 13 万 token 上下文,占用约 19.34GB 显存,输入预处理速度超过 3100 token/s,输出速度约为 50 token/s。

加入 DFlash 草稿模型后,Muse Glimmer 在 8 万 token 上下文下占用 23.93GB 显存,基本用满 RTX 4090,输出速度则提高至 75 token/s。

▲开发者在单张 RTX 4090 上测试 Muse Glimmer 的 UD-Q4_K_XL 量化版本效果(图源:X)

该开发者称,Muse Glimmer 通过让多组注意力查询共享同一组缓存数据,降低了长文本处理所需的显存。因此,他认为,在不压缩 KV 缓存精度的情况下,该模型也能在单张 24GB 显卡上支持 13 万 token 上下文。

▲开发者在单张 RTX 4090 上测试 Muse Glimmer(图源:X)

二、可调用工具并处理报错,官方演示从零开发智能家居面板

Meta 称,一个能够管理日程、起草消息和整理文件的个人 Agent,需要同时具备长流程执行、准确调用工具、多模态理解、长上下文记忆和指令遵循等能力。

Muse Glimmer 可以在多轮操作中维持任务计划,并按照工具预先定义的数据格式发起调用。如果工具执行失败或返回异常结果,模型可以判断错误原因并重新尝试,而不是直接停止任务。

该模型配备独立的感知编码器,可以同时处理文字和图片,理解软件截图、图表及文档。Muse Glimmer 还支持 100 多种语言,并允许开发者调节推理强度,在响应速度和输出质量之间进行选择。

Meta 展示了 Muse Glimmer 在 OpenCode 中完成长流程编程任务的案例。用户只提供了一条自然语言指令给模型,让它找到家庭网络中的 Home Assistant 智能家居系统,并为连接的影音接收器开发控制面板。

Muse Glimmer 首先制定任务计划,包括查找 Home Assistant、识别影音接收器、设计界面、编写代码并测试功能。随后,该模型调用多个网络工具,找到 Home Assistant 在局域网中的 IP 地址。

当模型发现缺少访问权限时,它没有继续尝试绕过认证,而是向用户索取连接方式和长期访问令牌。获得授权后,模型通过 Home Assistant API 识别出连接的影音接收器,并读取设备支持的电源、音量、音源、声音模式和分区控制等功能。

最后,Muse Glimmer 从零编写 HTML、CSS 和 JavaScript,生成一套响应式网页控制面板,并测试页面功能和不同尺寸下的显示效果。最终页面可以控制接收器开关、音量、音源、声音。

▲ Muse Glimmer 在 OpenCode 中开发影音接收器控制面板(图源:Meta)

三、22 项测试拿下 12 项第一,Agent 任务表现更突出

Meta 将 Muse Glimmer 与参数规模相近的 Gemma 4 31B 和 Qwen 3.6 27B 进行了比较。在不含安全测试的 22 项 Agent、编程、多模态和通用能力基准中,Muse Glimmer 取得12 项 SOTA

其中,Muse Glimmer 在检验大模型多工具串联调度能力的 MCP Atlas 和检验深度检索问答能力的 DeepSearch QA 中分别获得 75.5 分和 74.6 分,均超过另外两款模型;在编程测试 SWE-Bench Pro 中获得 51.2 分,略高于 Qwen 3.6 的 50.2 分;在数学测试 AIME 2026 中则以 94.7 分位列第一。

不过,Muse Glimmer 并未全面领先。Qwen 3.6 在部分桌面操作、编程和多模态测试中表现更好,Gemma 4 则在两项安全测试中取得更低的违规率和攻击成功率。

▲ Muse Glimmer 与 Gemma 4、Qwen 3.6 基准测试对比(图源:Meta)

四、模型从超过 55GB 压缩至不到 20GB,解码速度提升 3.1 倍

Meta 称,Muse Glimmer 的技术重点在于,在 300 亿参数规模下平衡 Agent 能力、运行速度和个人设备的内存限制。

该模型采用知识蒸馏路线,以更大的 Muse Spark 作为教师模型。预训练阶段,Meta 使用 Muse Spark 的输出进行 logit 蒸馏,并采用与教师模型相近的数据组合。

中期训练阶段,Meta 加入更长上下文、更多 Agent 任务和更丰富的推理轨迹;后训练阶段则结合监督微调、在线蒸馏和强化学习,覆盖通用、推理、编程及 Agent 等领域。

按照完整精度计算,Muse Glimmer 需要超过 55GB 内存,超出多数消费级显卡的容量。Meta 采用量化技术,将模型权重压缩至约 4 比特精度,使语言模型体积降至 20GB 以下。

压缩后的模型可以与负责图片理解的感知编码器、保存工作状态的 KV 缓存,以及用于推测解码的小型模型共同运行在 24GB 或 32GB 内存环境中。因此,Meta 所说的 " 消费级设备可运行 " 仍存在一定门槛,并不意味着所有普通电脑都可以部署该模型。

▲压缩后的模型可以与 KV 缓存和小型模型共同运行在 24GB 或 32GB 内存环境中(图源:Meta)

为缩短模型执行长推理及多步骤工具调用时的等待时间,Meta 还提供了一个基于 DFlash 的轻量级草稿模型。它会一次提出多组候选 token,再由 Muse Glimmer 并行验证,在保持最终输出质量的同时提高生成速度。

Meta 测试显示,DFlash 推测解码使 Muse Glimmer 在 RTX 5090 上的解码速度提升 3.1 倍,在 M5 Max 和 M4 Max 上分别提升 1.8 倍和 1.5 倍。

▲ DFlash 推测解码在不同硬件上的加速效果(图源:Meta)

Muse Glimmer 权重已经上传至 Hugging Face。Meta 称,Ollama、LM Studio 和 Unsloth 将提供支持,llama.cpp、ExecuTorch 和 MLX 等本地及端侧框架的优化集成也将陆续上线。

开发者还可以通过 vLLM 和 SGLang 部署模型,或利用 PyTorch 的 TorchTitan 功能进行定制训练。AMD、Arm、戴尔、英特尔和英伟达正在参与 Muse Glimmer 在不同设备上的性能优化。

五、扎克伯克长文详解 Meta 超级智能愿景,将为数十亿人提供免费 Agent

扎克伯格在长文中提出,Meta 将向数十亿用户和小企业提供免费或低价的个人 Agent,推出连该公司自身也无法读取用户数据的完全私密模式,并继续开放部分模型权重。Meta 将引入独立董事会审查发布标准,并考虑在训练期间向政府提供模型中间检查点用于模型治理。扎克伯格称,将加快芯片、能源和数据中心建设,并支持继续限制先进芯片对华出口。

为了将这套个人超级智能路线落地,Meta 计划从产品定价、隐私保护、模型开放和基础设施建设等方面采取具体措施。

第一,Meta 将提供免费或低价的个人 Agent。按照扎克伯格的设想,每个人都可以拥有一个了解自身目标和偏好的 Agent,用于处理健康、职业、财务、学习和家庭管理等任务,并通过手机、电脑和 AI 眼镜使用。需要更多计算资源的用户可以付费购买额外算力,Meta 还考虑采用动态竞价机制分配有限的计算资源,但尚未公布具体推出时间和收费方式。

第二,Meta 计划推出完全私密的个人 Agent 模式。在这一模式下,即使 Meta 也无法读取用户信息或将其提供给其他机构。本地运行的 Muse Glimmer 与这一方向相符,可以减少个人文件及任务数据上传至云端的需要。不过,Meta 尚未确认未来面向普通消费者的个人 Agent 是否会直接采用 Muse Glimmer。

第三,Meta 将继续开放部分模型权重。除 Muse Glimmer 外,该公司还将开放最新基础模型 Muse Spark 1.2。扎克伯格呼吁美国减少对开源 AI 模型的限制,并批评部分厂商通过封闭模型控制技术和用户。他认为,美国不应增加可能拖慢模型发布的统一审查流程,即使延迟一个月,也可能削弱美国 AI 公司的竞争优势。

第四,Meta 将继续建设支撑个人超级智能的芯片、能源和数据中心基础设施。扎克伯格认为,美国及其盟友虽然在芯片设计方面具有优势,但电力供应和数据中心建设速度仍是短板。与支持开放模型的立场不同,他同时支持继续限制先进芯片出口,认为这一政策现阶段可以减缓竞争对手训练前沿模型的速度。

在模型治理方面,Meta 计划由独立董事会批准模型发布的安全标准,并审查每次发布是否符合要求。扎克伯格称,超级智能如何部署不应由他或任何一名管理者独自决定。

针对网络安全等潜在风险,他提出,前沿 AI 实验室可以在模型训练期间向政府提供中间检查点和技术人员,帮助政府提前评估模型能力并加固关键基础设施。

结语:Meta 把个人超级智能路线落到本地 Agent

Muse Glimmer 将 300 亿参数 Agent 模型压缩至消费级硬件可以承载的范围,是 Meta 推进本地 AI 的一项实际进展。现有实测显示,该模型已经能够在断网状态下操作桌面应用、调用工具和完成编程任务,24GB 或 32GB 的内存要求也使其进入部分个人电脑的部署范围。

这款模型与扎克伯格长文提出的个人超级智能路线形成呼应:Meta 希望通过免费服务、开放模型和完全私密模式,让个人 Agent 覆盖更多用户。本地运行可以减少对云端算力和网络连接的依赖,也为处理文件、日程等个人数据提供更具隐私性的方案。

现阶段,Muse Glimmer 在运行延迟、token 消耗和工具接口方面仍有优化空间。随着模型进一步压缩、消费级硬件性能提升及本地工具生态完善,Agent 竞争将从云端模型能力延伸至个人设备上的任务执行效率和数据隐私。

来源:Meta、X

智东西(公众号:zhidxcom)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai muse 扎克伯格 亚历山大 mac
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论