A transcrição de áudio usa áudio como entrada e utiliza Reconhecimento Automático de Fala e Identificação Automática de Locutor para gerar uma saída de texto. Especificamente, o sistema usa uma instância proprietária do sistema de Reconhecimento Automático de Fala OpenAI Whisper.
Bases de termo monolíngues podem ser criadas na página de para melhorar a precisão da transcrição de IA para termos especializados ou difíceis. Para reduzir correspondências falsas, mantenha as listas de termo limitadas a termos especializados ou difíceis que provavelmente não serão confundidos com palavras ou números comuns, evite adicionar termos curtos ou genéricos e revise a saída de transcrição quanto a termos aplicados incorretamente antes de finalizar.
Bases de termo são compartilhadas automaticamente com todos os usuários da mesma organização no modo não editável.
O Phrase Studio consome Horas de localização de vídeo.
Casos de uso
-
Uma entrevista com cliente de 45 minutos gravada como um arquivo MP4.
Uma transcrição de texto é gerada com identificação de locutor, que pode ser usada para criar um estudo de caso e extrair citações para um site.
Para criar um projeto de transcrição de áudio, siga estas etapas:
-
No Phrase Studio, clique em Novo projeto.
A página é aberta.
-
Arraste um arquivo para o campo de upload ou clique em Upload de arquivo para localizar um arquivo em seu sistema.
O arquivo enviado é exibido.
-
Opcionalmente, especifique o número de no arquivo enviado.
-
Para definir o número de locutores manualmente, abra o menu suspenso e Selecionar um valor de 1 a 5. Se o arquivo incluir mais de cinco locutores, usar a opção padrão .
-
-
Forneça um nome para o projeto e defina a visibilidade do projeto conforme necessário:
-
Novos projetos são públicos por padrão. Projetos públicos são visíveis para todos os usuários na organização que têm acesso ao Studio.
-
Desmarcar para Criar um projeto privado que é visível apenas para o proprietário do projeto. Um projeto privado ainda pode ser compartilhado com usuários selecionados, se necessário.
-
-
Selecionar manualmente o ou Ativar para detecção automática.
-
Se necessário, em , Ativar e selecionar o(s) idioma(s) para o qual o arquivo será traduzido.
-
O mecanismo de tradução é configurável.
-
Se for selecionado, o arquivo será transcrito, traduzido e dublado imediatamente, sem a oportunidade de verificar a tradução com antecedência.
-
-
Selecionar um para determinar as regras de exibição de legendas.
Ativar para selecionar um perfil para cada idioma.
-
Opcionalmente, ativar para selecionar pronúncias existentes e pares relacionados para fluxos de trabalho de dublagem.
-
Se necessário, configure opções adicionais:
-
Abra a seção para importar arquivos de legenda existentes no formato SRT ou VTT para os idiomas de texto original e tradução.
O sistema ignorará a transcrição de áudio automática com identificação de locutor e alinhará as legendas existentes com o vídeo. Os usuários precisam criar e atribuir locutores manualmente, já que arquivos SRT/VTT não incluem informações de locutor.
-
Abra a seção para substituir as configurações de nível de conta e selecionar o preferido no nível do projeto.
-
Abra a seção para selecionar um glossário existente ou adicionar termos que serão usados para detectar e encontrar correspondência de palavras com sons semelhantes durante a transcrição.
-
Abra a seção para selecionar os resumos e insights desejados que serão gerados para a gravação enviada, e os modelos de IA relevantes.
-
-
Clique em criar projeto.
O arquivo é enviado e exibido na página .
Clique no nome da gravação para abri-la no editor e visualizá-la nas guias e . Ambos os textos podem ser editados, se necessário.
Clique em download para Selecionar a transcrição e as traduções para download no seu sistema. Também é possível fazer download de faixas apenas de áudio no formato MP3.
Extrai insights estruturados e significativos, como resumos, sentimento, sinalizadores de qualidade ou problemas de segurança de legendas usando modelos de IA.
Insights criados na página de são compartilhados automaticamente com todos os usuários da mesma organização no modo não editável.
Casos de uso
-
Resuma chamadas de suporte ao cliente ou identifique comunicações potencialmente inseguras ou de baixa qualidade. O Phrase Studio retorna um resumo e sinaliza seções para revisão.
Detecta e rotula diferentes locutores em um arquivo de áudio para transcrições e legendas mais claras.
A identificação automática de locutor não está disponível para projetos com arquivos de legenda importados.
Casos de uso
-
Um podcast com vários participantes é processado e cada locutor é marcado automaticamente (por exemplo, "Locutor 1", "Locutor 2").
Clique em Gerenciar locutores no menu para Editar o nome do locutor ou adicionar outros locutores.
usar a alternância Combinado/Locutores na parte inferior do editor para alternar entre uma única forma de onda e formas de onda individuais para cada locutor. Quando vários locutores são detectados, os segmentos podem ser arrastados dentro de uma linha para refletir a fala sobreposta, ou movidos para outra linha para alterar o locutor atribuído.