AI

什么是端侧 AI 转录?iPhone 如何在本地运行 Whisper(2026)

LoroNote Team16 min

端侧 AI 转录是指语音识别模型直接在手机上运行——你的音频压根不存在上传这一步。本文讲清从麦克风到文字之间实际发生的事、Neural Engine 扮演的角色、应用能装下多大的模型为什么取决于内存而不是算力,以及端侧真正做不到的事。

快速结论: 端侧 AI 转录,是指语音识别模型直接跑在你手机自己的处理器上——从录音到文字的整个过程中,没有任何数据离开手机。所以它的隐私不是承诺,而是结构:你的音频压根不存在上传这一步,开着飞行模式转写一次,任何人都能亲自验证。端侧也不等于不准——同样的模型权重,在哪里运行都产生同样的结果。端侧真正带来的是一道硬件门槛:应用能装下多大的模型,取决于手机的内存而不是算力,这正是有的应用悄悄跑着 Whisper 的小模型、有的却装下了 Large 家族的原因。下面按顺序看看,麦克风和文字之间到底发生了什么。

本文由 LoroNote 团队写于 2026 年 8 月 27 日。LoroNote 的 Whisper Large V3 Turbo 完全在设备上运行,所以这篇文章讲的就是我们自己的产品所依赖的那套机制。文中每个基准数字都附有一手来源,大部分汇总在我们经过核查的转写统计页(英文);唯一一个我们自己测的数字,文中有明确标注。

“端侧”到底是什么意思

所有转录服务干的活都一样,架构的差别只在一处:模型在哪里。

环节云端转录端侧转录
录音在你的手机上在你的手机上
上传音频被发往服务商的服务器这一环节不存在
语音模型在服务器 GPU 上运行在手机自己的处理器上运行
结果文字经网络传回文字在本地生成
离线可用不行可以——没有环节需要联网
谁能接触到音频你 + 服务商的基础设施只有拿着这部手机的人

要紧的是最后两行。离线可用不是端侧转录附送的功能,而是这种结构的副产品——管线里没有任何一步需要网络。隐私也出自同一个道理:从未被上传的音频,谈不上被留存、被泄露、被服务商查看,不是因为哪份条款承诺了克制,而是根本不存在需要克制的副本。这是对结构的描述,不是法律担保——它对你自己的保密义务意味着什么,要由你来判断;但技术事实本身,开个飞行模式就能核实。

处理管线:麦克风与文字之间的四步

OpenAI Whisper 这类现代语音模型按几个具体步骤处理音频,在端侧应用里,这几步全部在设备内完成。

  1. 重采样。 音频先统一重采样到 16,000 Hz——论文明确写道所有训练音频都用这个频率,所以更高的采样率还没等模型“听”就已经被丢掉了。这也是录音棚级采样率并不能提高准确率的原因。
  2. 声谱图。 波形会转换成梅尔声谱图——按 Whisper 论文的描述,以 25 毫秒为窗口、10 毫秒为步长计算的对数幅度表示。模型从来不“听声音”,它读的是一张近似图像的能量分布图:什么时间、哪些频率上有能量。
  3. 编码。 Transformer 编码器消化这张声谱图,把“声学上说了什么”压缩成内部表示。
  4. 解码。 Transformer 解码器一个词元一个词元地写出转写稿,写的时候同时参考音频表示和已经写下的文字——这既是 Whisper 的文字读起来流畅的原因,也是它会在静音上编出流畅句子的原因。

这四步没有一步在乎自己在哪里运行。服务器 GPU 和手机执行的是同一套权重上的同一套数学——手机芯片一旦跟上,端侧转录就成为可能,道理全在这里。

硬件:Neural Engine 负责什么

手机芯片早就不只是 CPU 了。苹果 A 系列芯片在 CPU、GPU 之外,还集成了一块专门负责神经网络运算的电路——Neural Engine;苹果自己在 iPhone 15 Pro 的新闻稿中说,A17 Pro 的 Neural Engine 速度最高可达上一代的两倍。实际上架的转写应用,会把模型转换成苹果的 Core ML 格式,让这块硬件高效执行编码器和解码器。

苹果 A16 Bionic 系统级芯片封装的示意图

苹果 A 系列芯片的示意图。这类芯片在 CPU 和 GPU 之外,还集成了在设备内执行语音模型运算的专用模块——Neural Engine。来源:

Wikimedia Commons (Henriok)

, CC0.

不过,实际卡脖子的不是芯片算得多快,而是模型装不装得进内存。OpenAI 公开的表格能让你直观感受这里的量级(参数量与参考内存占用,均为服务器 GPU 上的测量值):

Whisper 规格参数量参考内存相对速度(A100 上)
tiny3900 万约 1 GB约 10 倍
base7400 万约 1 GB约 7 倍
small2.44 亿约 2 GB约 4 倍
medium7.69 亿约 5 GB约 2 倍
large15.5 亿约 10 GB1 倍
turbo8.09 亿约 6 GB约 8 倍

这张表要老老实实附上两条说明。内存和速度两列是 OpenAI 在 GPU 推理下测的参考值——手机没有独立的显存池,实际上架的应用还会为 Core ML 做量化,占用和速度都会随之变化。所以别把它当成某款手机应用的规格表,而要当作各规格之间的比例关系来读。但恰恰是这个比例关系说明了问题:小模型轻轻松松就能装进手机,Large 家族不下真功夫做工程根本装不进去——所以一些知名 iOS 应用悄悄加载的是 small 或 medium,哪怕它们的桌面版跑的是 large。Whisper Large V3 Turbo——8.09 亿参数、解码器从 32 层砍到 4 层——正是为了把 Large 级的准确率塞进手机装得下的范围而生的;LoroNote 为什么选它,我们单独写过一篇。

端侧转录会损失准确率吗?

不会——这是关于端侧转录流传最广的误解。模型权重是确定性的数学:同一个规格的模型,在手机上和在服务器上产出同等质量的转写稿。端侧不是什么缩水模式。

应用之间真正不同的,是各自装的哪个规格,而这个差距不小——公开数据显示,同一基准下 Whisper 的小规格错误率约为 Large 级引擎的两倍。所以准确率的问题从来不是“云端还是设备”,而是要对每一款应用单独问一句“用的哪个模型”。从干净朗读语音到会议室的实测数字,见Whisper 到底有多准?

实际速度有多快?

这里有一个数字是我们自己测的,照例标明:在 iPhone 15 Pro 上,LoroNote 的转写速度约为实时的 19 倍——一小时的录音三分钟左右变成文字,全程在设备内完成(LoroNote 自测,2026-08-13)。作为另一个端侧引擎的参照,苹果 iOS 26 SpeechAnalyzer 的那次基准测试在桌面级 M2 Pro 上报告了约 12–40 倍实时的吞吐——那次测试测了什么、没测什么,我们专门分析过。

端侧的速度还有一个云端没有的属性:它完全属于你。没有排队,没有限流,没有按分钟计费——多转写一小时的边际成本是电量,不是账单。

端侧真正做不到的事

诚实的定义必须把局限也写进去:

  • 模型只随应用更新而进步。 云服务商可以一夜之间在服务器上换上更好的模型;端侧应用的模型打包在应用里,改进随应用更新到来,不会悄无声息地发生。
  • 大批量任务仍然是大硬件更快。 要为研究档案转写几百小时的音频,桌面 GPU 或付费云端队列比任何手机都快。
  • 天生多人的功能离不开服务器。 十个人在通话中同时查看、共同编辑的实时共享转写稿,本质是协作而不是转写——哪些场景仍然该选云服务,离线转写指南里有整理。
  • 持续运算要耗电。 转写是每段录音做一次的工作,不是常驻后台的负担,但长文件对芯片来说是实打实的劳动——要连续处理三小时的批量任务,插上电源比较稳妥。

这些局限没有一条动摇核心的交换:只要是你个人的录音——会议、讲座、访谈、随手记——活儿就在你已经拥有的硬件上干完,准确率由你选的模型决定,而且任何数据都不会离开设备。

常见问题

端侧转录真的保护隐私吗?

它的隐私属性来自结构:管线里没有上传环节,所以任何地方都不会产生一份可能被留存或泄露的音频副本。结构本身可以亲自验证——打开飞行模式转写一次就行。这个事实对你自己的保密义务意味着什么,只能由你判断;技术上确定的只有一点:音频不离开手机。

端侧转录离线能用吗?

能,这是结构决定的:管线里没有任何一步需要网络。模型随应用下载一次,此后在地下室、飞机上、飞行模式下,录音和转写照常进行。

端侧转录比云端转录更不准吗?

不会因为运行位置而变得不准——相同的模型权重在哪里都产出相同的质量。应用之间的准确率差异来自各自加载的模型规格,而促使一些应用选择小规格的压力正是手机内存。该查的是模型,而不是它在哪儿运行。

为什么有些 iPhone 应用跑的是小规格的 Whisper?

因为内存。OpenAI 的参考表从 3900 万参数一路排到 15.5 亿,大规格在考虑手机限制之前就要好几个 GB。把 Large 家族装进手机,需要实打实的工程投入——量化、Core ML 转换,再加上像 Turbo 那样把解码器砍到 4 层的提速设计——不是每款应用都愿意做。

苹果自带的听写也算端侧 AI 转录吗?

越来越算了。苹果 iOS 26 的 SpeechAnalyzer 和端侧 Whisper 应用一样完全在设备上运行,差别在覆盖面和门槛:截至 2026 年 8 月,苹果引擎支持 22 种语言,Whisper 约 100 种;SpeechAnalyzer 还要求 iOS 26。两个引擎的详细对比我们写过。

端侧转录费电吗?

转写是一阵集中的真实运算,不是持续的后台消耗——转的时候运行,转完就停。短录音基本无感;连续几小时的批量任务,就当作其他重负载一样,插着电做。

什么是端侧 AI 转录:写在最后

端侧 AI 转录不是云服务的缩水替代品,而是同一套数学在你已经拥有的芯片上运行。值得记住的定义有三部分:音频没有可走的上传环节(飞行模式可验证);准确率是模型规格的属性,与运行地点无关;应用能装下哪个规格,由手机的内存而不是速度决定。挑选端侧应用时,就问最后那一个问题——营销从来不会回答的那个:“所以,你装的是哪个模型?”

来源

各数字于 2026 年 8 月 27 日对照上述来源复核。

让声音变成文字 — 离线完成

LoroNote 在 iPhone 上直接转写会议、课程和访谈 — 私密、准确、不限量。

在 App Store 下载