指南

iPhone 说话人识别指南:自动分清谁说了什么

Loro 11 min

了解如何使用 LoroNote 自动区分会议和采访中的说话人、修改说话人姓名,以及批量纠正分配错误的片段。

转写稿能告诉你说了什么。但在会议、采访或多人讨论中,这只完成了一半——你还需要知道是谁说的

说话人分离会把录音划分成多个发言片段,并将每段内容归到对应的声音。LoroNote 直接在 iPhone 或 iPad 上完成分析,然后用不同颜色、说话人标签和时间戳整理转写结果。

本指南将介绍完整流程:识别说话人、检查结果、把默认标签换成真实姓名,以及纠正分配给错误说话人的片段。

快速了解

打开已经完成转写的录音,切换到显示片段,再使用说话人按钮。你可以让 LoroNote 自动判断人数,也可以直接指定 2 到 8 位说话人。

你想完成的操作操作位置
自动判断说话人数说话人菜单 → 自动检测
指定已知的参与人数说话人菜单 → 选择 2–8 位说话人
改名、添加或合并说话人已识别说话人编辑
修正单个片段对应转写片段旁的编辑按钮
将多个片段改到另一位说话人名下编辑 → 选择片段 → 更改说话人

识别之前的准备

无论是用 LoroNote 直接录制的内容,还是导入的音频文件,都可以使用说话人分离。想获得更稳定的结果,可以注意以下几点:

  • 将 iPhone 或 iPad 放在能清楚收录每位参与者声音的位置。
  • 不要挡住麦克风,也不要把设备放在口袋里。
  • 条件允许时,尽量避免多人同时说话。
  • 如果已经知道确切人数,请直接选择人数,而不是使用自动检测。

每位参与者都有一段不被打断的连续发言时,模型更容易学习并区分不同声音。

1. 选择自动检测或指定人数

LoroNote 顶部工具栏中位于刷新与更多按钮之间的说话人分离图标

打开录音,点击顶部工具栏中的说话人图标。在识别说话人菜单中可以选择两种方式:

  • 不确定录音中有多少人时,使用自动检测最方便。
  • 2–8 位说话人可以明确告诉 LoroNote 要寻找多少个不同声音,适合参与人数固定的采访、圆桌讨论和会议。

指定人数还可以减少把背景中的短暂声音或插话误判为新参与者的情况。

LoroNote 识别说话人菜单,包含自动检测以及二到八位说话人的选项
让 LoroNote 自动判断,或直接指定 2 到 8 位说话人。

2. 检查按颜色区分的转写

分析完成后,已识别说话人会显示找到的声音数量。在显示片段中,每位说话人都有自己的颜色,每个片段也会标注说话人和时间戳。

点击片段即可跳到音频中的对应时刻。检查说话人切换是否准确时,只需播放切换点前后几秒,确认声音变化与标签变化是否一致。

LoroNote 转写按蓝色和紫色说话人片段及时间戳整理
说话人颜色和时间戳让长对话也能快速浏览和回听。

3. 把“说话人 1”改成真实姓名

默认标签足以区分声音,但换成真实姓名或角色后,转写稿会更容易阅读和分享。

点击已识别说话人旁的编辑,打开说话人列表。你可以:

  1. 点击说话人名称,改成参与者的姓名或角色;
  2. 通过添加说话人补充缺少的参与者;
  3. 删除多余的说话人;其片段会合并到前一位说话人名下,因此操作后请检查相关内容;
  4. 点击完成保存。

对于定期会议,“采访者”“客户”“主持人”等角色有时比只写姓名更清楚。

LoroNote 编辑说话人姓名界面,显示三位说话人和添加说话人按钮
修改参与者姓名、添加缺少的说话人,或合并多余标签。

4. 纠正片段的说话人归属

即使整体识别效果很好,在插话、笑声或多人声音重叠的位置,也可能需要简单调整。

如果只有一个片段分错了,使用该片段旁的编辑按钮并选择正确说话人。如果不确定,可以先从时间戳开始播放,确认声音后再修改。

要一次纠正多个片段:

  1. 阅读切换到编辑
  2. 选择属于同一人的所有片段;
  3. 点击更改说话人
  4. 从列表中选择正确的人。

当同一位参与者在长录音中被拆成两个标签时,批量更改尤其方便。

LoroNote 中带有时间戳和编辑按钮的单个转写片段
只有一个标签错误时,可以直接编辑该片段。
LoroNote 中选中两个转写片段并显示更改说话人按钮
选择多个片段,一次将它们移到正确的说话人名下。

提高说话人分离准确度的技巧

  • 优先保证音质。 距离和环境噪声不仅影响转写,也会影响声音区分。
  • 知道人数时直接指定。 固定人数能为模型提供有效限制。
  • 先检查切换位置。 一人打断另一人或声音重叠时最容易出现错误。
  • 从时间戳回听。 通常只需要几秒音频就能确认正确说话人。
  • 分享前填写姓名。 “小李”或“产品负责人”比“说话人 1”更有用。
  • 重复错误使用批量编辑。 不必逐段修正同一个被拆分的说话人。

说话人分离能做什么,又有哪些限制

LoroNote 可以区分不同声音并归纳各自的发言,但不会自动知道参与者在现实中的身份。识别结果最初会使用说话人 1说话人 2等中性标签,真实姓名需要由你填写。

多人完全同时说话,是所有说话人分离系统最难处理的情况。这类片段可能需要少量手动修正。因此,LoroNote 同时提供时间戳播放、单个片段修改和批量重新分配。

与转写一样,说话人分析也在设备端完成。录音无需上传到转写服务器,因此也适合用于私密会议和采访。

常见问题

导入的音频文件也能识别说话人吗? 可以。导入文件并打开转写,然后按照 LoroNote 录音相同的方式运行说话人识别即可。

应该使用自动检测还是手动指定人数? 确切知道人数时建议手动指定;人数不确定或录音过程中发生变化时,使用自动检测更方便。

最多可以手动选择多少位说话人? 菜单提供 2 到 8 位说话人的固定选项,另外还支持自动检测。

识别后还能修改说话人姓名吗? 可以。通过编辑打开说话人列表,随时把默认标签改成姓名或角色。

多个片段都分错了怎么办? 进入编辑模式,选择所有相关片段,再使用更改说话人一起重新分配。

说话人识别需要联网吗? 不需要。LoroNote 直接在你的设备上处理音频。

让声音变成文字 — 离线完成

LoroNote 在 iPhone 上直接转写会议、课程和访谈 — 私密、准确、不限量。

在 App Store 下载