Skills Plugins MCP Prompt Model 导航 博客 资讯 我的中心

苹果 MacBook Pro 外接 iPhone 17 Pro Max 运行 AI 模型,预填充性能最高提升 44%

Qwen3.8‑27B 是一款性能不错的人工智能模型,但前提是设备拥有足够的显存与系统内存。搭载 M4 Pro 芯片的 MacBook Pro 仅有 24GB 统一内存,在运行该 AI 模型时,预填充速度会因此受到限制。据 Wccftech 报道,有一名用户通过 USB‑C 接口将 iPhone 17 Pro Max 外接至这台便携 Mac 电脑上,并借助自制软件,使得该 AI 模型的预填充性能最

正文

Qwen3.8‑27B 是一款性能不错的人工智能模型,但前提是设备拥有足够的显存与系统内存。搭载 M4 Pro 芯片的 MacBook Pro 仅有 24GB 统一内存,在运行该 AI 模型时,预填充速度会因此受到限制。据 Wccftech 报道,有一名用户通过 USB‑C 接口将 iPhone 17 Pro Max 外接至这台便携 Mac 电脑上,并借助自制软件,使得该 AI 模型的预填充性能最高提升了 44%。

IT之家注意到,为突破这台 Mac 24GB 统一内存的上限,Reddit 用户“u/StayLameBro”采用两种方式,把运算任务拆分交给 Mac 本机和 iPhone 17 Pro Max 协同处理。针对预填充加速,MacBook Pro 负责处理每一批 256 个 token 当中的第 1 至 40 层,再将激活值数据流传输到手机端;与此同时,iPhone 利用 A19 Pro 的 GPU 运行第 41 至 64 层,而 Mac 这边则已经开始处理下一批数据。依靠 GPU 运算,手机端的运行速度相比不使用 GPU 时提升约 2.4 倍。

整套方案里,神经网络引擎也没有闲置。每 16K 长度的旧上下文会被编译为一套神经网络引擎模型。在 140K 上下文长度下,相较于仅使用 A19 Pro 的 GPU,单 token 写入耗时从 279 毫秒缩短至 176 毫秒。拿将一份 2000token 的文件预填充并保存会话这项任务来看性能表现:上下文设为 8K 时,仅靠 Mac 本机的速度是每秒 132 个 token;外接 iPhone 之后达到每秒 177 个 token,性能提升 35%。上下文设为 16K 时,速度从每秒 109 个 token 上涨至每秒 157 个 token,增幅高达 44%。

当上下文窗口设置为 32K 时,预填充速度从每秒 101 个 token 提升至每秒 130 个 token,性能改善 29%。把 iPhone 17 Pro Max 外接在 M4 Pro 版 MacBook Pro 上,使用这套自制软件,按理可以得到十分出色的预填充速度。可惜正如这名 Reddit 用户指出的,现实并没有这么美好,这套方案还存在若干局限。举例来说,在 64K 以内的场景,手机并不会加速文本生成,文本生成的工作依旧全部交由 Mac 完成。

另外值得一提的是,驱动 iPhone 18 Pro 以及 iPhone 18 Pro Max 的 A20 Pro 芯片有望提供更大的性能余量。一方面它本身的整体性能更强;另一方面它配备双 16 核神经网络引擎。据称,针对专门适配神经网络处理器的任务,这款引擎的数据吞吐能力甚至超过该系统级芯片内置的 7 核 GPU。这套自制软件目前已经开源,可以在 GitHub 上下载,项目名称叫作“backburner”。

即便仅仅作为一项实验,也能够看出预填充速度提升带来的收益相当可观。后续自然还有继续挖掘性能潜力的空间;不过这或许也意味着,未来 iPhone 这类设备也有可能步入和内存、固态硬盘一样的供货紧缺阶段。

数据来源:公开 AI 资讯聚合目录,版权归原文作者及媒体所有;本站仅作索引与摘要展示,如有异议可联系我们删除。

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。