La transcription audio prend l'audio comme sortie et utilise la reconnaissance vocale automatisée et l'identification automatisée des locuteurs pour générer une sortie textuelle. Plus précisément, le système utilise une instance propriétaire du système de reconnaissance vocale automatisée OpenAI Whisper.
Des bases de termes monolingues peuvent être créées dans la page pour améliorer la précision de la transcription par IA pour des termes spécialisés ou difficiles. Pour réduire les fausses correspondances, limitez les listes de termes aux termes spécialisés ou difficiles qui ne risquent pas d'être confondus avec des mots ou des nombres courants, évitez d'ajouter des termes courts ou génériques, et vérifiez la sortie de transcription pour détecter les termes mal appliqués avant de finaliser.
Les bases de termes sont automatiquement partagées avec tous les utilisateurs de la même organisation en mode lecture seule.
Phrase Studio consomme des Heures de localisation vidéo.
Cas d'utilisation
-
Un entretien client de 45 minutes enregistré sous forme de fichier MP4.
Une transcription textuelle est générée avec l'identification des locuteurs, qui peut être utilisée pour créer une étude de cas et extraire des citations pour un site web.
Pour créer un projet de transcription audio, suivez ces étapes :
-
Depuis Phrase Studio, cliquez sur Nouveau projet.
La page s'ouvre.
-
Faites glisser un fichier dans la zone de chargement ou cliquez sur Charger le fichier pour localiser un fichier sur votre système.
Le fichier chargé s'affiche.
-
Optionnellement, spécifiez le nombre de dans le fichier chargé.
-
Pour définir manuellement le nombre de locuteurs, ouvrez la liste déroulante et sélectionnez une valeur de 1 à 5. Si le fichier comprend plus de cinq locuteurs, utilisez l'option par défaut .
-
-
Donnez un nom au projet et définissez la visibilité du projet selon vos besoins :
-
Les nouveaux projets sont publics par défaut. Les projets publics sont visibles par tous les utilisateurs de l'organisation qui ont accès à Studio.
-
Désélectionner pour créer un projet privé qui n'est visible que par le responsable du projet. Un projet privé peut toujours être partagé avec des utilisateurs sélectionnés si nécessaire.
-
-
Sélectionner manuellement la ou activer pour une détection automatique.
-
Si nécessaire, sous , activer et sélectionner la ou les langues vers lesquelles le fichier doit être traduit.
-
Le moteur de traduction est configurable.
-
Si est sélectionné, le fichier sera transcrit, traduit et doublé immédiatement sans possibilité de vérifier la traduction au préalable.
-
-
Sélectionner un pour déterminer les règles d'affichage des sous-titres.
Activer pour sélectionner un profil pour chaque langue.
-
Optionnellement, activer pour sélectionner des prononciations existantes et des paires associées pour les flux de travail de doublage.
-
Si nécessaire, configurer des options supplémentaires :
-
Ouvrir la section pour importer des fichiers de sous-titres existants au format SRT ou VTT pour les langues source et cible.
Le système ignorera la transcription audio automatique avec identification des locuteurs et alignera les sous-titres existants avec la vidéo. Les utilisateurs doivent créer et assigner des locuteurs manuellement car les fichiers SRT/VTT n'incluent pas d'informations sur les locuteurs.
-
Ouvrir la section pour remplacer les paramètres du compte et sélectionner le de traduction préféré au niveau du projet.
-
Ouvrir la section pour sélectionner une base terminologique existante ou ajouter des termes qui seront utilisés pour détecter et trouver une correspondance pour des mots aux sonorités similaires pendant la transcription.
-
Ouvrez la section pour sélectionner les résumés et insights souhaités qui seront générés pour l'enregistrement téléchargé, ainsi que les modèles d'IA pertinents.
-
-
Cliquez sur créer projet.
Le fichier est téléchargé et s'affiche sur la page .
Cliquez sur le nom de l'enregistrement pour l'ouvrir dans l'éditeur et le visualiser dans les onglets et . Les deux textes peuvent être modifiés si nécessaire.
Cliquez sur téléchargement pour sélectionner la transcription et les traductions pour le téléchargement vers votre système. Il est également possible de procéder au téléchargement de pistes audio uniquement au format MP3.
Extrait des insights structurés et significatifs tels que des résumés, des sentiments, des indicateurs de qualité ou des problèmes de sécurité à partir de sous-titres en utilisant des modèles d'IA.
Les insights créés dans la page sont automatiquement partagés avec tous les utilisateurs de la même organisation en mode lecture seule.
Cas d'utilisation
-
Résumez les appels du service client ou identifiez les communications potentiellement dangereuses ou de faible qualité. Phrase Studio renvoie un résumé et signale des sections pour examen.
Détecte et étiquette différents locuteurs dans un fichier audio pour des transcriptions et des sous-titres plus clairs.
L'identification automatique des locuteurs n'est pas disponible pour les projets avec des fichiers de sous-titres importés.
Cas d'utilisation
-
Un podcast avec plusieurs participants est traité et chaque locuteur est automatiquement étiqueté (par ex., « Locuteur 1 », « Locuteur 2 »).
Cliquez sur Gérer les locuteurs sous le menu pour modifier le nom du locuteur ou ajouter d'autres locuteurs.
Utilisez le bouton Combiné/Locuteurs en bas de l'éditeur pour basculer entre une forme d'onde unique et des formes d'onde individuelles pour chaque locuteur. Lorsque plusieurs locuteurs sont détectés, les segments peuvent être glissés dans une ligne pour refléter un chevauchement de parole, ou déplacés vers une autre ligne pour modifier le locuteur assigné.