Comment enregistrer et transcrire des meetings avec AssemblyAI
Connectez vos meetings Zoom, Google Meet et Microsoft Teams à AssemblyAI : un bot capture l'appel, AssemblyAI transcrit avec les labels de locuteurs et la détection de langue, et vous recevez un JSON natif AssemblyAI par webhook.

AssemblyAI est la solution privilégiée par les équipes qui souhaitent aller au-delà du texte brut — labels de locuteurs, détection de langue et intelligence audio en complément de la transcription. Ce qu'AssemblyAI ne fait pas, c'est participer aux meetings. Son API part d'un audio_url ; quelqu'un doit encore produire cet audio.
C'est là qu'un bot de meeting intervient. Ce guide connecte les deux : un bot enregistre le meeting, AssemblyAI le traite sous votre compte, et votre webhook reçoit une sortie native AssemblyAI.
Votre pipeline AssemblyAI reste exactement tel quel — le bot devient simplement sa source audio pour Zoom, Google Meet et Microsoft Teams.
Étape 1 : Obtenez vos clés
- AssemblyAI : récupérez votre clé API depuis le dashboard AssemblyAI (le
ASSEMBLYAI_API_KEYque vous utilisez déjà). - Meeting BaaS : inscription en libre-service sur auth.meetingbaas.com — les 8 premières heures d'enregistrement sont gratuites.
Étape 2 : Envoyez un bot configuré avec AssemblyAI
curl -X POST "https://api.meetingbaas.com/v2/bots" \
-H "Content-Type: application/json" \
-H "x-meeting-baas-api-key: $API_KEY" \
-d '{
"meeting_url": "https://us02web.zoom.us/j/1234567890",
"bot_name": "AssemblyAI Bot",
"transcription_config": {
"provider": "assemblyai",
"api_key": "'"$ASSEMBLYAI_API_KEY"'",
"custom_params": {
"speaker_labels": true,
"language_detection": true
}
}
}'custom_params transfère les options à AssemblyAI sans modification : speaker_labels segmente la transcription par locuteur, language_detection détecte automatiquement la langue dominante, et le reste de la surface de request d'AssemblyAI est transmis de la même manière.
Étape 3 : Recevez la sortie native AssemblyAI
Votre webhook reçoit l'artefact de transcription reflétant la structure de response d'AssemblyAI — utterances avec labels de locuteurs, horodatages au niveau du mot, langue détectée — accompagné de l'enregistrement, de la liste des participants et de la timeline des locuteurs au format standard Meeting BaaS. Deux systèmes de séparation des interlocuteurs, un avantage combiné : le speaker_labels d'AssemblyAI segmente l'audio, tandis que les métadonnées des participants du bot vous donnent les noms réels derrière les voix, ce qui vous permet de les relier.
Pourquoi cette combinaison
- Contexte adapté aux meetings : AssemblyAI reçoit un audio de meeting propre, capturé à la source, et non un ré-enregistrement via le microphone d'un ordinateur portable.
- Vos modèles et votre facturation : l'utilisation est imputée sur votre compte AssemblyAI ; Meeting BaaS ajoute 0,05 tokens par heure enregistrée pour la transcription en mode bring-your-own-key (plans Pro et supérieurs), plus le tarif standard de 1 token par heure d'enregistrement.
- Choix par bot : changez de fournisseur par request — utilisez AssemblyAI pour les appels commerciaux en anglais et le moteur Gladia intégré par défaut (plus de 100 langues) pour tout le reste.