Gemini Flash系にエージェント型動画理解を追加
Googleは、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteを対象に、Interactions APIとGenerateContent APIでエージェント型動画理解を提供開始しました。動画のタイムラインを動的に移動し、必要に応じて文字起こし・フレーム・音声トラックを取得する仕組みで、長時間コンテンツでは静的処理と比べて使用トークンを最大88%削減できます。
SaaSや各種サービスの新機能・仕様変更・料金改定・サービス終了・障害・セキュリティ情報など、Web・ITの仕事に関わるアップデート情報を分かりやすくお届けします。
Googleは、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteを対象に、Interactions APIとGenerateContent APIでエージェント型動画理解を提供開始しました。動画のタイムラインを動的に移動し、必要に応じて文字起こし・フレーム・音声トラックを取得する仕組みで、長時間コンテンツでは静的処理と比べて使用トークンを最大88%削減できます。
Googleは、動画の延長生成や2枚の画像間をつなぐ補間生成、360p・720p・1080p・4Kの解像度指定に対応した「gemini-omni-1.1-flash」を一般提供しました。既存の「gemini-omni-flash-preview」エンドポイントは、2026年9月30日に非推奨化されます。
Googleは、音声理解機能を基盤とする音声文字起こしモデル「Gemini 3.5 Transcribe」と「Gemini 3.5 Transcribe Live」をGemini APIで一般提供しました。前者は85以上の言語、話者分離、単語単位のタイムスタンプ、最大1,000語のカスタム語彙に対応し、後者はLive APIとWebSocketによる双方向ストリーミング文字起こしに対応します。
Googleは、コーディングやエージェント向けのGemini 3.7 Flash(gemini-3.7-flash)を一般提供しました。ソフトウェアエンジニアリング、Web開発、エージェントワークフローを改善しており、2026年12月31日まで導入価格で利用できます。
Googleは、ロボット向けの「Gemini Robotics ER 2」モデルエンドポイント2種を公開プレビューで提供開始しました。空間推論やコード実行、ツール連携、動画解析、マルチロボット連携などに対応し、ストリーミング版はLive APIによる低遅延の双方向音声・映像入力に対応します。なお、「gemini-robotics-er-1.6-preview」は2026年8月31日に終了します。
Googleは、Gemini 3.6 Flash(gemini-3.6-flash)とGemini 3.5 Flash-Lite(gemini-3.5-flash-lite)の安定版・本番利用向けバージョンを一般提供しました。あわせて、Gemini APIのサンプリングパラメータ「temperature」「top_p」「top_k」を非推奨としました。
Googleは、Interactions APIの対応する呼び出しについて、ログをAI Studioのダッシュボードで確認できるようにしました。
Googleは、動画生成・編集向けの「Gemini Omni Flash」をパブリックプレビューで公開しました。Interactions APIを使って、テキストから3〜10秒・720pの動画を生成したり、静止画をアニメーション化したりでき、生成結果を会話形式で編集・調整できます。また、画像生成・編集向けの「gemini-3.1-flash-lite-image(Nano Banana 2 Lite)」を一般提供(GA)に移行しました。
GoogleはGemini 3.5 Flashで、Computer Useツールのパブリックプレビュー提供を開始しました。意図(intent)による操作の簡素化、ブラウザー・モバイル・デスクトップ環境への組み込み対応、安全ポリシーの設定、強化されたプロンプトインジェクション検出を含みます。
Google Gemini APIは、音声生成モデル「gemini-3.1-flash-tts-preview」でストリーミングに対応しました。`streamGenerateContent`に加え、Interactions APIでは`stream: true`を利用できます。