Connectez vos meetings Zoom, Google Meet et Microsoft Teams à AssemblyAI : un bot capture l'appel, AssemblyAI transcrit avec les labels de locuteurs et la détection de langue, et vous recevez un JSON natif AssemblyAI par webhook.

AssemblyAI est la solution privilégiée par les équipes qui souhaitent aller au-delà du texte brut — labels de locuteurs, détection de langue et intelligence audio en complément de la transcription. Ce qu'AssemblyAI ne fait pas, c'est participer aux meetings. Son API part d'un audio_url ; quelqu'un doit encore produire cet audio.
C'est là qu'un bot de meeting intervient. Ce guide connecte les deux : un bot enregistre le meeting, AssemblyAI le traite sous votre compte, et votre webhook reçoit une sortie native AssemblyAI.
Votre pipeline AssemblyAI reste exactement tel quel — le bot devient simplement sa source audio pour Zoom, Google Meet et Microsoft Teams.
Étape 1 : Obtenez vos clés
- AssemblyAI : récupérez votre clé API depuis le dashboard AssemblyAI (le
ASSEMBLYAI_API_KEYque vous utilisez déjà). - Meeting BaaS : inscription en libre-service sur auth.meetingbaas.com — les 8 premières heures d'enregistrement sont gratuites.
Étape 2 : Envoyez un bot configuré avec AssemblyAI
curl -X POST "https://api.meetingbaas.com/v2/bots" \
-H "Content-Type: application/json" \
-H "x-meeting-baas-api-key: $API_KEY" \
-d '{
"meeting_url": "https://us02web.zoom.us/j/1234567890",
"bot_name": "AssemblyAI Bot",
"transcription_config": {
"provider": "assemblyai",
"api_key": "'"$ASSEMBLYAI_API_KEY"'",
"custom_params": {
"speaker_labels": true,
"language_detection": true
}
}
}'custom_params transfère les options à AssemblyAI sans modification : speaker_labels segmente la transcription par locuteur, language_detection détecte automatiquement la langue dominante, et le reste de la surface de request d'AssemblyAI est transmis de la même manière.

Étape 3 : Recevoir la sortie native AssemblyAI
Votre webhook reçoit l'artefact de transcription qui reflète la structure de réponse d'AssemblyAI — des énoncés avec étiquettes de locuteurs, des horodatages au niveau des mots, la langue détectée — ainsi que l'enregistrement, la liste des participants et la chronologie des interlocuteurs au format standard Meeting BaaS. Deux systèmes de séparation des interlocuteurs, un seul avantage : les segments speaker_labels d'AssemblyAI segmentent l'audio, tandis que les métadonnées des participants du bot vous donnent les vrais noms derrière les voix, afin que vous puissiez les associer.
Pourquoi cette combinaison
- Contexte adapté aux meetings : AssemblyAI capte un audio de meeting de qualité, enregistré à la source, et non un ré-enregistrement via le microphone d'un ordinateur portable.
- Vos modèles et votre facturation : l'utilisation est imputée sur votre compte AssemblyAI ; Meeting BaaS ajoute 0,05 tokens par heure enregistrée pour la transcription avec votre propre clé (plans Pro et supérieurs), plus le tarif standard de 1 token par heure d'enregistrement.
- Choix par bot : changez de fournisseur à chaque requête — utilisez AssemblyAI pour les appels commerciaux en anglais et le Gladia par défaut intégré (plus de 100 langues) pour tout le reste.