ElevenLabs Scribe v2 Realtime(約150msの遅延)を使用して、Zoom、Google Meet、Microsoft TeamsからライブのTranscriptをストリーミングします。botが通話に参加し、話者が発言する際にWebSocketがテキストを受信します。

通話後の文字起こしは当たり前の機能になっています。リアルタイムキャプション、ミーティング中のコパイロット、通話中に回答するエージェントなど、より高度なプロダクトには、人が話している最中にテキストが必要です。ElevenLabsのScribe v2 Realtimeは、90以上の言語、最大32名の話者に対応した話者分離機能付きで、約150msの遅延でストリーミング音声テキスト変換を実現します。
もう一つの重要な要素はライブミーティングの音声です。streaming_configを使用したミーティングbotがそれを提供します。botはZoom、Google Meet、またはMicrosoft Teamsの通話に参加し、ElevenLabsをストリーミング文字起こしエンジンとして使用しながら、リアルタイムでエンドポイントにストリーミングします。

ElevenLabsはMeeting BaaSラインナップにおいてストリーミング専用のプロバイダーです。リアルタイム文字起こしに使用され、通話後の文字起こしにはGladiaまたはご自身のバッチプロバイダーが使用されます。
ステップ1: キーを取得する
- Meeting BaaS: auth.meetingbaas.com でセルフサービス登録 — 最初の8時間の録画は無料です。
- ElevenLabs: ご自身のElevenLabsアカウントからAPI keyを取得してください。
ステップ2: ライブ文字起こし付きでbotを送信する
curl -X POST "https://api.meetingbaas.com/v2/bots" \
-H "Content-Type: application/json" \
-H "x-meeting-baas-api-key: $API_KEY" \
-d '{
"meeting_url": "https://us02web.zoom.us/j/1234567890",
"bot_name": "Live Captions Bot",
"streaming_config": {
"mode": "transcription",
"output_url": "wss://your-app.example.com/live-transcript",
"audio_frequency": 24000
},
"transcription_config": {
"provider": "elevenlabs",
"api_key": "'"$ELEVENLABS_API_KEY"'"
}
}'ミーティング実行中、output_url のWebSocketがライブ文字起こしストリームを受信します。独自のストリーミングモデルを実行するために生の音声が必要ですか?mode を"audio" に設定すると、16、24、32、または48kHzでミーティングの音声を取得できます。
ステップ3: ライブ体験を構築する
ミーティング中にテキストが届くことで、以下が可能になります:
- ライブキャプション: 通話中にプロダクト内でレンダリング
- ミーティング内コパイロット: トピックが出るたびに回答、ドキュメント、CRMのコンテキストを提示
- リアルタイムコンプライアンス: 通話終了の数分前に規制フレーズをフラグ
- スピーキングエージェント:
input_urlを通じて音声をストリームバックし、botが発話 — インタラクティブなミーティングエージェントのフルループ
標準的なパイプラインは並行して実行されます:ミーティング後にwebhookで完全な録画、通話後の文字起こし、メタデータが届きます。
コストについて
ストリーミングは、1時間あたり1 tokenの録画レートに加えて、1方向あたり1時間につき0.10 tokenが追加されます。ライブ文字起こしと録画を行うミーティングの1時間あたりのコストは1.5 token未満(token packに応じて$0.53〜0.75)です。ご自身のkeyを使用した場合のElevenLabsの利用料金は、ElevenLabsから直接請求されます。
次のステップ
- リアルタイムミーティング文字起こし&ストリーミング — ストリーミングAPIページ
- ElevenLabsミーティング文字起こし
- すべての文字起こしプロバイダー
- APIドキュメント