音频转录

AI 语音转文字与说话人识别

功能概述

音频转录模块将语音内容转换为精确的文字记录,支持多种语言和方言。系统提供多种转录引擎,在速度与精度之间灵活选择。

转录模式

模式引擎特点适用场景
Cheetah(极速)SenseVoice秒级出稿,适合短音频快速预览、会议速记
Dolphin(平衡)FunASR Paraformer-zh中文场景均衡之选日常转录、播客
Whale(最精准)Whisper Large多语言高精度,含说话人分离正式文档、多语言内容
Whale EN(直接英文)Whisper 原生翻译直接产出英文转录跨语言翻译场景

模式选择建议

  • 不确定选什么:推荐 Dolphin(平衡),中文场景效果最佳
  • 需要快速结果:选择 Cheetah(极速),速度最快
  • 多语言内容:选择 Whale(最精准),支持 12 种语言
  • 需要英文输出:选择 Whale EN,自动翻译为英文

操作流程

上传音频

  1. 进入音频模块,点击上传音频
  2. 支持格式:MP3、WAV、M4A、FLAC、OGG 等
  3. 文件大小限制:单文件最大 500MB

输入方式

系统支持三种输入方式:

  • 上传文件:直接拖拽或选择音频文件
  • 输入 URL:粘贴在线音频链接
  • 本地路径:输入服务器本地文件路径

选择模式

根据需求选择转录模式。不确定时推荐使用 Dolphin(平衡) 模式。

开始转录

点击开始转录,系统自动处理。处理时间取决于音频长度和选择的模式:

  • Cheetah:约 1 分钟音频 / 5 秒处理
  • Dolphin:约 1 分钟音频 / 15 秒处理
  • Whale:约 1 分钟音频 / 40 秒处理

查看结果

转录完成后,结果以时间轴列表展示,每条记录包含:

  • 时间戳:起止时间(如 [00:15 -> 00:23]
  • 说话人:如果启用了说话人识别,显示说话人标签
  • 文本:转录的文字内容

说话人识别

Whale 模式支持说话人自动识别:

  1. 在转录前开启说话人识别开关
  2. 系统自动检测并标注说话人(如"说话人 A"、"说话人 B")
  3. 转录完成后,点击重命名可修改说话人名称
  4. 重命名后所有导出文件中自动替换

导出格式

转录结果支持 7 种导出格式:

格式用途特点
TXT纯文本阅读包含时间戳和说话人信息
SRT视频字幕标准 SubRip 格式
VTTWeb 字幕WebVTT 格式,适合网页播放器
CSV数据分析结构化表格,可导入 Excel
JSON程序处理包含完整元信息和分段数据
DOCXWord 文档带格式排版,适合正式文档
PDF打印存档A4 排版,含标题和元信息

导出步骤

  1. 在转录结果页面点击导出
  2. 选择目标格式
  3. 选择是否包含说话人信息
  4. 下载文件

转录历史

所有转录记录自动保存在转录历史中:

  • 按时间倒序排列
  • 支持搜索和筛选
  • 可随时重新导出
  • 点击任一记录可查看详情

常见问题

哪种模式最适合我?

日常中文转录推荐 Dolphin。多语言内容选择 Whale。需要快速结果选择 Cheetah。

说话人识别准确吗?

Whale 模式下的说话人识别在清晰的多人对话中表现良好。音频质量差或说话人过多时可能不够准确,支持手动修正。

支持实时转录吗?

Cheetah 模式接近实时,适合会议记录场景。完整实时流式转录在后续版本中支持。

离线能用吗?

Cheetah 和 Dolphin 模式支持离线转录(本地引擎)。Whale 模式需要联网使用云端 API。