音频转写以音频作为输入,并使用自动语音识别和自动发言人识别来生成文本输出。具体而言,系统使用 OpenAI Whisper 自动语音识别系统的专有实例。
可以在 页面中创建单语术语库,以提高 AI 转写针对专业或困难术语的准确性。为减少错误匹配,请将术语列表限制为不太可能与常用词或数字混淆的专业或困难术语,避免添加简短或通用的术语,并在最终确定前检查转写输出中是否存在误用的术语。
术语库会自动以只读模式与同一公司的所有用户共享。
Phrase Studio 会消耗 视频本地化时长。
使用场景示例
-
一段录制为 MP4 文件的 45 分钟客户访谈。
系统正在生成带有发言人识别的文本转写,可用于创建案例研究并为网站提取引语。
要创建音频转写项目,请遵循以下步骤:
-
在 Phrase Studio 中,点击 新建项目。
页面随即打开。
-
将文件拖放到上传区域,或点击 上传文件 以在您的系统中查找文件。
上传的文件将会显示。
-
(可选)指定上传文件中的 数量。
-
要手动设置发言人数量,请打开下拉菜单并选择 1 到 5 之间的值。如果文件中包含超过五名发言人,请使用默认的 选项。
-
-
为项目提供名称,并根据需要设置项目可见性:
-
新项目默认为公开。公开项目对公司内所有拥有 Studio 访问权限的用户可见。
-
取消选择 以创建一个仅对项目所有者可见的私有项目。如有需要,私有项目仍可与选定的用户共享。
-
-
手动选择 或启用 以进行自动检测。
-
如果需要,在 下,启用 并选择文件要翻译成的语言。
-
选择一个 以确定字幕显示规则。
启用 以便为每种语言选择个人资料。
-
根据需要,启用 ,以便为配音工作流选择现有的 发音 和相关对。
-
如果需要,请配置其他选项:
-
打开 部分,为原文和译文导入 SRT 或 VTT 格式<2> 的现有字幕文件。
系统将跳过带说话人识别的自动音频转写,并将现有字幕与视频对齐。由于 SRT/VTT 文件不包含说话人信息,用户需要手动创建并分配说话人。
-
打开 部分以覆盖账户级设置,并在项目级选择首选的 。
-
打开 部分以选择现有的术语库,或添加将在转写过程中用于检测和匹配相似发音词汇的术语。
-
打开 部分,选择要为上传的录音生成的所需摘要和见解,以及相关的 AI 模型。
-
-
点击 创建项目。
文件已上传并显示在 页面上。
点击录音名称以在编辑器中打开它,并在 和 选项卡中查看。如果需要,可以编辑这两种文本。
点击 下载 以选择转录和翻译内容并下载到您的系统。也可以下载 MP3 格式的纯音频轨道。