新機能・対応追加
Gemini API、音声文字起こしモデルを一般提供
2026/08/26 リリース
Googleは、音声理解機能を基盤とする音声文字起こしモデル「Gemini 3.5 Transcribe」と「Gemini 3.5 Transcribe Live」をGemini APIで一般提供しました。前者は85以上の言語、話者分離、単語単位のタイムスタンプ、最大1,000語のカスタム語彙に対応し、後者はLive APIとWebSocketによる双方向ストリーミング文字起こしに対応します。
正確な内容・最新情報は公式情報をご確認ください。
元記事を確認する