音频转录
AI 语音转文字与说话人识别
功能概述
音频转录模块将语音内容转换为精确的文字记录,支持多种语言和方言。系统提供多种转录引擎,在速度与精度之间灵活选择。
转录模式
| 模式 | 引擎 | 特点 | 适用场景 |
|---|---|---|---|
| Cheetah(极速) | SenseVoice | 秒级出稿,适合短音频 | 快速预览、会议速记 |
| Dolphin(平衡) | FunASR Paraformer-zh | 中文场景均衡之选 | 日常转录、播客 |
| Whale(最精准) | Whisper Large | 多语言高精度,含说话人分离 | 正式文档、多语言内容 |
| Whale EN(直接英文) | Whisper 原生翻译 | 直接产出英文转录 | 跨语言翻译场景 |
模式选择建议
- 不确定选什么:推荐 Dolphin(平衡),中文场景效果最佳
- 需要快速结果:选择 Cheetah(极速),速度最快
- 多语言内容:选择 Whale(最精准),支持 12 种语言
- 需要英文输出:选择 Whale EN,自动翻译为英文
操作流程
上传音频
- 进入音频模块,点击上传音频
- 支持格式:MP3、WAV、M4A、FLAC、OGG 等
- 文件大小限制:单文件最大 500MB
输入方式
系统支持三种输入方式:
- 上传文件:直接拖拽或选择音频文件
- 输入 URL:粘贴在线音频链接
- 本地路径:输入服务器本地文件路径
选择模式
根据需求选择转录模式。不确定时推荐使用 Dolphin(平衡) 模式。
开始转录
点击开始转录,系统自动处理。处理时间取决于音频长度和选择的模式:
- Cheetah:约 1 分钟音频 / 5 秒处理
- Dolphin:约 1 分钟音频 / 15 秒处理
- Whale:约 1 分钟音频 / 40 秒处理
查看结果
转录完成后,结果以时间轴列表展示,每条记录包含:
- 时间戳:起止时间(如
[00:15 -> 00:23]) - 说话人:如果启用了说话人识别,显示说话人标签
- 文本:转录的文字内容
说话人识别
Whale 模式支持说话人自动识别:
- 在转录前开启说话人识别开关
- 系统自动检测并标注说话人(如"说话人 A"、"说话人 B")
- 转录完成后,点击重命名可修改说话人名称
- 重命名后所有导出文件中自动替换
导出格式
转录结果支持 7 种导出格式:
| 格式 | 用途 | 特点 |
|---|---|---|
| TXT | 纯文本阅读 | 包含时间戳和说话人信息 |
| SRT | 视频字幕 | 标准 SubRip 格式 |
| VTT | Web 字幕 | WebVTT 格式,适合网页播放器 |
| CSV | 数据分析 | 结构化表格,可导入 Excel |
| JSON | 程序处理 | 包含完整元信息和分段数据 |
| DOCX | Word 文档 | 带格式排版,适合正式文档 |
| 打印存档 | A4 排版,含标题和元信息 |
导出步骤
- 在转录结果页面点击导出
- 选择目标格式
- 选择是否包含说话人信息
- 下载文件
转录历史
所有转录记录自动保存在转录历史中:
- 按时间倒序排列
- 支持搜索和筛选
- 可随时重新导出
- 点击任一记录可查看详情
常见问题
哪种模式最适合我?
日常中文转录推荐 Dolphin。多语言内容选择 Whale。需要快速结果选择 Cheetah。
说话人识别准确吗?
Whale 模式下的说话人识别在清晰的多人对话中表现良好。音频质量差或说话人过多时可能不够准确,支持手动修正。
支持实时转录吗?
Cheetah 模式接近实时,适合会议记录场景。完整实时流式转录在后续版本中支持。
离线能用吗?
Cheetah 和 Dolphin 模式支持离线转录(本地引擎)。Whale 模式需要联网使用云端 API。