Diffusez des transcriptions en direct depuis Zoom, Google Meet et Microsoft Teams avec ElevenLabs Scribe v2 Realtime (~150ms de latence) : un bot rejoint l'appel, votre WebSocket reçoit le texte au fur et à mesure que les gens parlent.

LLazare Rossillon
··2 min read
Transcription de Meeting en Direct avec ElevenLabs Scribe v2 Realtime

Les transcriptions post-appel sont désormais incontournables. Les produits vraiment intéressants — sous-titres en direct, copilotes en meeting, agents qui répondent pendant l'appel — ont besoin du texte pendant que les gens parlent. Scribe v2 Realtime d'ElevenLabs effectue de la transcription vocale en streaming à environ 150ms de latence, avec séparation des interlocuteurs pour jusqu'à 32 participants dans plus de 90 langues.

La partie manquante est l'audio de meeting en direct. Un bot de meeting avec streaming_config le fournit : le bot s'installe dans l'appel Zoom, Google Meet ou Microsoft Teams et diffuse vers votre endpoint en temps réel, avec ElevenLabs comme moteur de transcription en streaming.

Les transcriptions post-call arrivent par webhook après la fin du meeting ; ElevenLabs diffuse le texte vers votre endpoint à ~150ms de latence pendant que les personnes parlent encore

ElevenLabs est le seul fournisseur en streaming dans la gamme Meeting BaaS : il est sélectionné pour la transcription en temps réel, tandis que les transcriptions post-call utilisent Gladia ou votre propre fournisseur batch.

Étape 1 : Obtenez vos clés

  • Meeting BaaS : inscription en libre-service sur auth.meetingbaas.com — les 8 premières heures d'enregistrement sont gratuites.
  • ElevenLabs : une clé API depuis votre compte ElevenLabs si vous utilisez la vôtre.

Étape 2 : Envoyez un bot avec la transcription en direct

curl -X POST "https://api.meetingbaas.com/v2/bots" \
     -H "Content-Type: application/json" \
     -H "x-meeting-baas-api-key: $API_KEY" \
     -d '{
           "meeting_url": "https://us02web.zoom.us/j/1234567890",
           "bot_name": "Live Captions Bot",
           "streaming_config": {
             "mode": "transcription",
             "output_url": "wss://your-app.example.com/live-transcript",
             "audio_frequency": 24000
           },
           "transcription_config": {
             "provider": "elevenlabs",
             "api_key": "'"$ELEVENLABS_API_KEY"'"
           }
         }'

Votre WebSocket à output_url reçoit le flux de transcription en direct pendant le meeting. Vous préférez l'audio brut pour exécuter votre propre modèle de streaming ? Définissez mode sur "audio" et vous obtenez l'audio du meeting à 16, 24, 32 ou 48 kHz.

Étape 3 : Construisez l'expérience en direct

Avec le texte qui arrive en cours de meeting, vous pouvez :

  • Sous-titres en direct affichés dans votre produit pendant l'appel
  • Copilotes en meeting qui font remonter des réponses, des documents ou le contexte CRM au fil des sujets abordés
  • Conformité en temps réel signalant les phrases réglementées, quelques minutes avant la fin de l'appel
  • Agents conversationnels : diffusez l'audio en retour via input_url et le bot parle — la boucle complète pour des agents de meeting interactifs

Le pipeline standard continue de fonctionner en parallèle : enregistrement complet, transcription post-call et métadonnées par webhook après le meeting.

Ce que cela coûte

Le streaming ajoute 0,10 tokens par heure par direction, en plus du tarif d'enregistrement de 1 token par heure — une heure de meeting enregistrée avec transcription en direct reste en dessous de 1,5 tokens (0,53–0,75 $ selon le pack de tokens). L'utilisation d'ElevenLabs avec votre propre clé est facturée directement par ElevenLabs.

Prochaines étapes

Articles similairestutorial