Googleは2026年5月20日、マルチモーダル生成モデル「Gemini Omni」を発表しました。第1弾のGemini Omni Flashで可能になる動画生成・編集と、利用前に確認したい提供条件を整理します。
発表概要:何が発表されたのか
Googleは、画像・音声・動画・テキストを組み合わせた入力から動画を生成できるモデルファミリー「Gemini Omni」を発表しました。第1弾のGemini Omni Flashは、Geminiアプリ、Google Flow、YouTube Shortsで順次提供されます。
従来の映像素材を自然な言葉で編集でき、前の指示の文脈を引き継ぎながら、登場人物の見た目やシーンの流れを保つ設計です。画像や音声など、動画以外の出力形式は今後対応予定とされています。
要約:重要ポイント
- 画像、音声、動画、テキストを組み合わせて動画を生成できます。
- 自然言語で背景、カメラアングル、スタイル、細部を段階的に編集できます。
- Geminiの世界知識や物理への理解を映像生成に活用するとGoogleは説明しています。
- Gemini Omni FlashはGeminiアプリ、Google Flow、YouTube Shortsで順次提供されます。
- 動画以外の出力や一部の音声編集機能は、現時点では提供予定またはテスト段階です。
新機能:何ができるようになるのか
Gemini Omniは、一から動画を作るだけでなく、手元の動画を基に登場人物の動きやオブジェクトを変更できます。前の指示を踏まえて編集を重ねられるため、背景や視点、表現スタイルを会話形式で調整できます。
入力では、画像、テキスト、動画、音声などを組み合わせられます。Googleの発表では、動画の動きを別のキャラクターへ適用したり、音声のリズムに合わせて映像の要素を変化させたりする例が示されています。
また、重力、運動エネルギー、流体力学などへの理解を高め、自然な動きを生成するとしています。ただし、精度や従来モデルとの定量比較は発表資料に示されていません。
利用場面:誰がどのように使えるのか
動画制作者は、撮影済み素材の背景や視点を言葉で調整したり、画像や音声を参考に新しい映像を作ったりできます。YouTube ShortsやYouTube Createでは、短い動画を制作する利用場面が想定されています。
企業での利用を検討する場合は、編集工程のどこを任せるかを先に決めることが重要です。Focus4編集部では、素材作成、たたき台の生成、既存動画の修正など、用途を区切って確認することで、出力の確認項目を整理しやすくなると考えます。
影響:企業・働き手・業務への意味
会話形式で動画を修正できれば、映像制作の初期案を作り、関係者の意見を反映する流れが変わる可能性があります。一方、発表資料だけでは、制作時間や費用がどの程度変わるかは判断できません。
業務利用では、生成結果の確認担当、使用素材の権利、公開前のチェック方法を決める必要があります。Gemini Omniで作られた動画にはSynthIDが埋め込まれるとされていますが、これは内容の正確性を保証するものとして発表されてはいません。
確認事項:提供時期・対象・制約
Gemini Omni Flashは、Google AI Plus、Pro、Ultraの利用者を対象に、GeminiアプリとGoogle Flowで順次提供されます。YouTube ShortsとYouTube Createでは無料で順次提供される予定です。
開発者や企業向けのAPIは、発表時点で数週間以内の提供予定です。画像や音声への出力対応も今後の予定であり、動画内の音声や会話を編集・変更する機能はテストと評価が続いています。料金、利用上限、対応地域の詳細は発表資料だけでは明らかにされていません。
出典
Google「Gemini Omni を発表」(2026年5月20日)
一次ソースを確認する
Focus4編集部