苹果手机和笔记本搭档跑大模型?还真有点意思。
Qwen3.8-27B 是一款参数量适中、性能不俗的大模型,但是对显存与内存总量有较高的要求,常规 PC 很难满足。
比如 M4 Pro 处理器的 MacBook Pro,只配备了 24GB 统一内存,运行该模型时的预填充(Prefill)速度会受到极大限制。
网友 "StayLameBro" 突发奇想,把模型计算任务拆分给 iPhone 手机和 MacBook 笔记本,利用二者的合力突破 24GB 统一内存的限制,实现了预填充的显著加速。

它将二者通过 10Gbps 带宽的 USB-C 接口和数据线相连,又利用了一款名叫backburner的开源软件。
在预填充阶段,MacBook Pro 负责每个 256-token 批次的第 1~40 层运算,再把激活值(activations)传给手机。
iPhone 利用 A19 Pro 处理器的 GPU 图形核心,继续运行第 41~64 层。
与此同时,MacBook 开始处理下一批数据。
A19 Pro 处理器的 GPU 搭载了矩阵运算单元,支持 Metal 4 张量运算,这让手机负责的后半段模型预填充速度,比单靠手机 CPU/GPU 快了大约 2.4 倍。
在 140K 上下文长度下,相比单独使用 A19 Pro GPU,单个 token 的写入耗时从 279ms 下降到了 176ms,速度提升了约 37%。
以下是在相同环境下,向智能代理会话预填充 2000 token 文档时,单独使用 MacBook 和加上 iPhone 的性能对比:
8K 上下文:从 132 token/s 提高到 177 token/s,提升 35%。
16K 上下文:从 109 token/s 提高到 157 token/s,提升 44%。
32K 上下文:从 101 token/s 提高到 130 token/s,提升 29%。
48K 上下文:从 87 token/s 提高到 113 token/s,提升 30%。
上下文达到和超过 64K 之后,手机的任务会切换:最旧的 KV 缓存页面转移到手机保存,MacBook 完整运行全部 64 层。
对于每一个注意力层,手机会在 GPU 上对旧的 KV 做注意力运算,MacBook 再把结果和自身计算部分合并。
同时,手机的神经网络引擎(Neural Engine)也没有闲着。每 16K 长度的历史上下文,会被编译成神经网络引擎模型,将 KV 键作为权重。
此外,开启一个全新的 27K-token 智能代理会话,原版 llama.cpp 冷启动需要 245 秒,优化之后只用 MacBook 也需要 228 秒,而接入手机后只需要 168 秒,提升约 26%。
不过,这套方案也有一定的局限,尤其是在上下文在 64K 以内时,不会加速解码性能,这部分完全由 MacBook 负责。
只有上下文超过 64K 之后,手机才会参与到解码阶段,实际的生成速度最高达到了 30 token/s。
另外,只有预填充的 token 量大于约 512 时,手机才会加入预填充运算。
在一次真实会话里,36 次请求中有 7 次触发了手机参与,但这 7 次请求承载了约 83% 的 token 读取总量。

总的来说,即便只是一次简单的实验,也让我们看到了广阔的前景。
比如换成最新的 iPhone 18 Pro Max 手机和 A20 Pro 处理器、MacBook Pro 和 M6 处理器,又会提升多少?
比如换成最新的 DeepSeek V4.1-Flash、Qwen3.8-Flash-Next 模型,效果会如何?
也有人提出猜想:未来 iPhone、MacBook,会不会和内存、SSD 一样,进入算力、存储紧缺的时代?


登录后才可以发布评论哦
打开小程序可以发布评论哦