芯硬件 昨天
iPhone 17 Pro Max搭档M4 Pro MacBook,27B大模型提速44%
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

苹果手机和笔记本搭档跑大模型?还真有点意思。

Qwen3.8-27B 是一款参数量适中、性能不俗的大模型,但是对显存与内存总量有较高的要求,常规 PC 很难满足。

比如 M4 Pro 处理器的 MacBook Pro,只配备了 24GB 统一内存,运行该模型时的预填充(Prefill)速度会受到极大限制。

网友 "StayLameBro" 突发奇想,把模型计算任务拆分给 iPhone 手机和 MacBook 笔记本,利用二者的合力突破 24GB 统一内存的限制,实现了预填充的显著加速。

它将二者通过 10Gbps 带宽的 USB-C 接口和数据线相连,又利用了一款名叫backburner的开源软件。

在预填充阶段,MacBook Pro 负责每个 256-token 批次的第 1~40 层运算,再把激活值(activations)传给手机。

iPhone 利用 A19 Pro 处理器的 GPU 图形核心,继续运行第 41~64 层。

与此同时,MacBook 开始处理下一批数据。

A19 Pro 处理器的 GPU 搭载了矩阵运算单元,支持 Metal 4 张量运算,这让手机负责的后半段模型预填充速度,比单靠手机 CPU/GPU 快了大约 2.4 倍。

在 140K 上下文长度下,相比单独使用 A19 Pro GPU,单个 token 的写入耗时从 279ms 下降到了 176ms,速度提升了约 37%。

以下是在相同环境下,向智能代理会话预填充 2000 token 文档时,单独使用 MacBook 和加上 iPhone 的性能对比:

8K 上下文:从 132 token/s 提高到 177 token/s,提升 35%。

16K 上下文:从 109 token/s 提高到 157 token/s,提升 44%。

32K 上下文:从 101 token/s 提高到 130 token/s,提升 29%。

48K 上下文:从 87 token/s 提高到 113 token/s,提升 30%。

上下文达到和超过 64K 之后,手机的任务会切换:最旧的 KV 缓存页面转移到手机保存,MacBook 完整运行全部 64 层。

对于每一个注意力层,手机会在 GPU 上对旧的 KV 做注意力运算,MacBook 再把结果和自身计算部分合并。

同时,手机的神经网络引擎(Neural Engine)也没有闲着。每 16K 长度的历史上下文,会被编译成神经网络引擎模型,将 KV 键作为权重。

此外,开启一个全新的 27K-token 智能代理会话,原版 llama.cpp 冷启动需要 245 秒,优化之后只用 MacBook 也需要 228 秒,而接入手机后只需要 168 秒,提升约 26%。

不过,这套方案也有一定的局限,尤其是在上下文在 64K 以内时,不会加速解码性能,这部分完全由 MacBook 负责。

只有上下文超过 64K 之后,手机才会参与到解码阶段,实际的生成速度最高达到了 30 token/s。

另外,只有预填充的 token 量大于约 512 时,手机才会加入预填充运算。

在一次真实会话里,36 次请求中有 7 次触发了手机参与,但这 7 次请求承载了约 83% 的 token 读取总量。

总的来说,即便只是一次简单的实验,也让我们看到了广阔的前景。

比如换成最新的 iPhone 18 Pro Max 手机和 A20 Pro 处理器、MacBook Pro 和 M6 处理器,又会提升多少?

比如换成最新的 DeepSeek V4.1-Flash、Qwen3.8-Flash-Next 模型,效果会如何?

也有人提出猜想:未来 iPhone、MacBook,会不会和内存、SSD 一样,进入算力、存储紧缺的时代?

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

iphone macbook macbook pro 神经网络 gpu
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论