
快速结论: 端侧 AI 转录,是指语音识别模型直接跑在你手机自己的处理器上——从录音到文字的整个过程中,没有任何数据离开手机。所以它的隐私不是承诺,而是结构:你的音频压根不存在上传这一步,开着飞行模式转写一次,任何人都能亲自验证。端侧也不等于不准——同样的模型权重,在哪里运行都产生同样的结果。端侧真正带来的是一道硬件门槛:应用能装下多大的模型,取决于手机的内存而不是算力,这正是有的应用悄悄跑着 Whisper 的小模型、有的却装下了 Large 家族的原因。下面按顺序看看,麦克风和文字之间到底发生了什么。
本文由 LoroNote 团队写于 2026 年 8 月 27 日。LoroNote 的 Whisper Large V3 Turbo 完全在设备上运行,所以这篇文章讲的就是我们自己的产品所依赖的那套机制。文中每个基准数字都附有一手来源,大部分汇总在我们经过核查的转写统计页(英文);唯一一个我们自己测的数字,文中有明确标注。
“端侧”到底是什么意思
所有转录服务干的活都一样,架构的差别只在一处:模型在哪里。
| 环节 | 云端转录 | 端侧转录 |
|---|---|---|
| 录音 | 在你的手机上 | 在你的手机上 |
| 上传 | 音频被发往服务商的服务器 | 这一环节不存在 |
| 语音模型 | 在服务器 GPU 上运行 | 在手机自己的处理器上运行 |
| 结果 | 文字经网络传回 | 文字在本地生成 |
| 离线可用 | 不行 | 可以——没有环节需要联网 |
| 谁能接触到音频 | 你 + 服务商的基础设施 | 只有拿着这部手机的人 |
要紧的是最后两行。离线可用不是端侧转录附送的功能,而是这种结构的副产品——管线里没有任何一步需要网络。隐私也出自同一个道理:从未被上传的音频,谈不上被留存、被泄露、被服务商查看,不是因为哪份条款承诺了克制,而是根本不存在需要克制的副本。这是对结构的描述,不是法律担保——它对你自己的保密义务意味着什么,要由你来判断;但技术事实本身,开个飞行模式就能核实。
处理管线:麦克风与文字之间的四步
OpenAI Whisper 这类现代语音模型按几个具体步骤处理音频,在端侧应用里,这几步全部在设备内完成。
- 重采样。 音频先统一重采样到 16,000 Hz——论文明确写道所有训练音频都用这个频率,所以更高的采样率还没等模型“听”就已经被丢掉了。这也是录音棚级采样率并不能提高准确率的原因。
- 声谱图。 波形会转换成梅尔声谱图——按 Whisper 论文的描述,以 25 毫秒为窗口、10 毫秒为步长计算的对数幅度表示。模型从来不“听声音”,它读的是一张近似图像的能量分布图:什么时间、哪些频率上有能量。
- 编码。 Transformer 编码器消化这张声谱图,把“声学上说了什么”压缩成内部表示。
- 解码。 Transformer 解码器一个词元一个词元地写出转写稿,写的时候同时参考音频表示和已经写下的文字——这既是 Whisper 的文字读起来流畅的原因,也是它会在静音上编出流畅句子的原因。
这四步没有一步在乎自己在哪里运行。服务器 GPU 和手机执行的是同一套权重上的同一套数学——手机芯片一旦跟上,端侧转录就成为可能,道理全在这里。
硬件:Neural Engine 负责什么
手机芯片早就不只是 CPU 了。苹果 A 系列芯片在 CPU、GPU 之外,还集成了一块专门负责神经网络运算的电路——Neural Engine;苹果自己在 iPhone 15 Pro 的新闻稿中说,A17 Pro 的 Neural Engine 速度最高可达上一代的两倍。实际上架的转写应用,会把模型转换成苹果的 Core ML 格式,让这块硬件高效执行编码器和解码器。

苹果 A 系列芯片的示意图。这类芯片在 CPU 和 GPU 之外,还集成了在设备内执行语音模型运算的专用模块——Neural Engine。来源:
Wikimedia Commons (Henriok)
, CC0.
不过,实际卡脖子的不是芯片算得多快,而是模型装不装得进内存。OpenAI 公开的表格能让你直观感受这里的量级(参数量与参考内存占用,均为服务器 GPU 上的测量值):
| Whisper 规格 | 参数量 | 参考内存 | 相对速度(A100 上) |
|---|---|---|---|
| tiny | 3900 万 | 约 1 GB | 约 10 倍 |
| base | 7400 万 | 约 1 GB | 约 7 倍 |
| small | 2.44 亿 | 约 2 GB | 约 4 倍 |
| medium | 7.69 亿 | 约 5 GB | 约 2 倍 |
| large | 15.5 亿 | 约 10 GB | 1 倍 |
| turbo | 8.09 亿 | 约 6 GB | 约 8 倍 |
这张表要老老实实附上两条说明。内存和速度两列是 OpenAI 在 GPU 推理下测的参考值——手机没有独立的显存池,实际上架的应用还会为 Core ML 做量化,占用和速度都会随之变化。所以别把它当成某款手机应用的规格表,而要当作各规格之间的比例关系来读。但恰恰是这个比例关系说明了问题:小模型轻轻松松就能装进手机,Large 家族不下真功夫做工程根本装不进去——所以一些知名 iOS 应用悄悄加载的是 small 或 medium,哪怕它们的桌面版跑的是 large。Whisper Large V3 Turbo——8.09 亿参数、解码器从 32 层砍到 4 层——正是为了把 Large 级的准确率塞进手机装得下的范围而生的;LoroNote 为什么选它,我们单独写过一篇。
端侧转录会损失准确率吗?
不会——这是关于端侧转录流传最广的误解。模型权重是确定性的数学:同一个规格的模型,在手机上和在服务器上产出同等质量的转写稿。端侧不是什么缩水模式。
应用之间真正不同的,是各自装的哪个规格,而这个差距不小——公开数据显示,同一基准下 Whisper 的小规格错误率约为 Large 级引擎的两倍。所以准确率的问题从来不是“云端还是设备”,而是要对每一款应用单独问一句“用的哪个模型”。从干净朗读语音到会议室的实测数字,见Whisper 到底有多准?
实际速度有多快?
这里有一个数字是我们自己测的,照例标明:在 iPhone 15 Pro 上,LoroNote 的转写速度约为实时的 19 倍——一小时的录音三分钟左右变成文字,全程在设备内完成(LoroNote 自测,2026-08-13)。作为另一个端侧引擎的参照,苹果 iOS 26 SpeechAnalyzer 的那次基准测试在桌面级 M2 Pro 上报告了约 12–40 倍实时的吞吐——那次测试测了什么、没测什么,我们专门分析过。
端侧的速度还有一个云端没有的属性:它完全属于你。没有排队,没有限流,没有按分钟计费——多转写一小时的边际成本是电量,不是账单。
端侧真正做不到的事
诚实的定义必须把局限也写进去:
- 模型只随应用更新而进步。 云服务商可以一夜之间在服务器上换上更好的模型;端侧应用的模型打包在应用里,改进随应用更新到来,不会悄无声息地发生。
- 大批量任务仍然是大硬件更快。 要为研究档案转写几百小时的音频,桌面 GPU 或付费云端队列比任何手机都快。
- 天生多人的功能离不开服务器。 十个人在通话中同时查看、共同编辑的实时共享转写稿,本质是协作而不是转写——哪些场景仍然该选云服务,离线转写指南里有整理。
- 持续运算要耗电。 转写是每段录音做一次的工作,不是常驻后台的负担,但长文件对芯片来说是实打实的劳动——要连续处理三小时的批量任务,插上电源比较稳妥。
这些局限没有一条动摇核心的交换:只要是你个人的录音——会议、讲座、访谈、随手记——活儿就在你已经拥有的硬件上干完,准确率由你选的模型决定,而且任何数据都不会离开设备。
常见问题
端侧转录真的保护隐私吗?
它的隐私属性来自结构:管线里没有上传环节,所以任何地方都不会产生一份可能被留存或泄露的音频副本。结构本身可以亲自验证——打开飞行模式转写一次就行。这个事实对你自己的保密义务意味着什么,只能由你判断;技术上确定的只有一点:音频不离开手机。
端侧转录离线能用吗?
能,这是结构决定的:管线里没有任何一步需要网络。模型随应用下载一次,此后在地下室、飞机上、飞行模式下,录音和转写照常进行。
端侧转录比云端转录更不准吗?
不会因为运行位置而变得不准——相同的模型权重在哪里都产出相同的质量。应用之间的准确率差异来自各自加载的模型规格,而促使一些应用选择小规格的压力正是手机内存。该查的是模型,而不是它在哪儿运行。
为什么有些 iPhone 应用跑的是小规格的 Whisper?
因为内存。OpenAI 的参考表从 3900 万参数一路排到 15.5 亿,大规格在考虑手机限制之前就要好几个 GB。把 Large 家族装进手机,需要实打实的工程投入——量化、Core ML 转换,再加上像 Turbo 那样把解码器砍到 4 层的提速设计——不是每款应用都愿意做。
苹果自带的听写也算端侧 AI 转录吗?
越来越算了。苹果 iOS 26 的 SpeechAnalyzer 和端侧 Whisper 应用一样完全在设备上运行,差别在覆盖面和门槛:截至 2026 年 8 月,苹果引擎支持 22 种语言,Whisper 约 100 种;SpeechAnalyzer 还要求 iOS 26。两个引擎的详细对比我们写过。
端侧转录费电吗?
转写是一阵集中的真实运算,不是持续的后台消耗——转的时候运行,转完就停。短录音基本无感;连续几小时的批量任务,就当作其他重负载一样,插着电做。
什么是端侧 AI 转录:写在最后
端侧 AI 转录不是云服务的缩水替代品,而是同一套数学在你已经拥有的芯片上运行。值得记住的定义有三部分:音频没有可走的上传环节(飞行模式可验证);准确率是模型规格的属性,与运行地点无关;应用能装下哪个规格,由手机的内存而不是速度决定。挑选端侧应用时,就问最后那一个问题——营销从来不会回答的那个:“所以,你装的是哪个模型?”
来源
- OpenAI,Whisper 代码仓库——模型规格表(参数量、参考内存、A100 GPU 上的相对速度)
- OpenAI,Robust Speech Recognition via Large-Scale Weak Supervision——16,000 Hz 重采样、梅尔声谱图前端、编码器-解码器架构
- Apple,iPhone 15 Pro 新闻稿——A17 Pro Neural Engine“最高快至上一代两倍”的表述
- Lyonesse,Apple’s New Speech API vs Whisper——SpeechAnalyzer 的吞吐区间及其限定条件
- LoroNote,AI 转写统计(英文)——附一手来源与核查日期的准确率数字汇总
各数字于 2026 年 8 月 27 日对照上述来源复核。
