Transmita transcripciones en vivo desde Zoom, Google Meet y Microsoft Teams con ElevenLabs Scribe v2 Realtime (~150ms de latencia): un bot se une a la llamada y su WebSocket recibe texto mientras las personas hablan.

LLazare Rossillon
··2 min read
Transcripción de reuniones en vivo con ElevenLabs Scribe v2 Realtime

Las transcripciones después de la llamada son el mínimo esperado. Los productos realmente interesantes — subtítulos en vivo, copilotos en la reunión, agentes que responden durante la llamada — necesitan texto mientras las personas hablan. ElevenLabs Scribe v2 Realtime hace speech-to-text en streaming con aproximadamente 150ms de latencia y separación de interlocutores para hasta 32 hablantes en más de 90 idiomas.

La pieza que faltaba es el audio de la reunión en vivo. Un bot de reunión con streaming_config lo proporciona: el bot se sienta en la llamada de Zoom, Google Meet o Microsoft Teams y transmite a su endpoint en tiempo real, con ElevenLabs como motor de transcripción en streaming.

Las transcripciones posteriores a la llamada llegan por webhook después de que finaliza la reunión; ElevenLabs transmite texto a su endpoint con una latencia de ~150ms mientras las personas aún están hablando

ElevenLabs es el proveedor exclusivo de streaming en la línea de Meeting BaaS: se selecciona para la transcripción en tiempo real, mientras que las transcripciones posteriores a la llamada utilizan Gladia o su propio proveedor por lotes.

Paso 1: Obtenga sus claves

  • Meeting BaaS: registro de autoservicio en auth.meetingbaas.com — las primeras 8 horas de grabación son gratuitas.
  • ElevenLabs: una API key de su cuenta de ElevenLabs si utiliza la suya propia.

Paso 2: Envíe un bot con transcripción en vivo

curl -X POST "https://api.meetingbaas.com/v2/bots" \
     -H "Content-Type: application/json" \
     -H "x-meeting-baas-api-key: $API_KEY" \
     -d '{
           "meeting_url": "https://us02web.zoom.us/j/1234567890",
           "bot_name": "Live Captions Bot",
           "streaming_config": {
             "mode": "transcription",
             "output_url": "wss://your-app.example.com/live-transcript",
             "audio_frequency": 24000
           },
           "transcription_config": {
             "provider": "elevenlabs",
             "api_key": "'"$ELEVENLABS_API_KEY"'"
           }
         }'

Su WebSocket en output_url recibe el stream de transcripción en vivo mientras se realiza la reunión. ¿Prefiere audio sin procesar para ejecutar su propio modelo de streaming? Configure mode en "audio" y obtendrá el audio de la reunión a 16, 24, 32 o 48 kHz.

Paso 3: Construya la experiencia en vivo

Con el texto llegando en medio de la reunión, puede:

  • Subtítulos en vivo renderizados en su producto mientras ocurre la llamada
  • Copilotos en la reunión que presentan respuestas, documentos o contexto de CRM a medida que surgen los temas
  • Cumplimiento en tiempo real de alertas sobre frases reguladas, minutos antes de que finalice la llamada
  • Agentes de voz: transmita audio de vuelta a través de input_url y el bot habla — el ciclo completo para agentes de reunión interactivos

El pipeline estándar sigue ejecutándose en paralelo: grabación completa, transcripción posterior a la llamada y metadatos por webhook después de la reunión.

Cuánto cuesta

El streaming agrega 0.10 tokens por hora por dirección además de la tarifa de grabación de 1 token por hora — una hora de reunión grabada con transcripción en vivo se mantiene por debajo de 1.5 tokens ($0.53–0.75 dependiendo del paquete de tokens). El uso de ElevenLabs con su propia API key se factura directamente por ElevenLabs.

Próximos pasos

Blogs similarestutorial