6月30日、Google DeepMindは動画生成AIモデル「Gemini Omni Flash」の提供を開始しました。開発者向けにGoogle AI StudioとGemini APIで公開されており、現在はパブリックプレビューの段階です。
Omni Flashはテキストや画像、動画を組み合わせた入力に対応します。自然言語による会話型の動画編集ができる点が特徴です。複数の入力を組み合わせることで、シーンの一貫性を保ったまま調整できます。歴史や生物学など、Geminiが持つ知識を動画の内容に反映できる点も強みです。プロンプトに沿ってテキストやグラフィックを動画内の動きと連動させることもできます。
価格は動画1秒あたり0.10ドルで、Veo 3.1 Fastと同水準です。現時点では10秒までの動画生成に対応しており、より長い尺への対応は今後予定されています。注意点として、音声参照のアップロードやシーンの延長には対応していません。また、3秒までの動画参照はAPIの仕様上は受け付けられますが、現時点では正しく処理されません。シーンの切り替えやパン動作を伴う場面では、キャラクターの一貫性が保たれにくいという制限も残っています。
同日には、画像生成モデル「Nano Banana 2 Lite」も公開されました。テキストから画像への生成を4秒で行えるモデルです。開発者はInteractions APIを通じて両モデルを組み合わせられます。Nano Banana 2 Liteで生成した画像をOmni Flashに渡して動画化する連携が可能で、セッション履歴を保持しながら最大3回まで編集を重ねられます。
Omni Flashで生成した動画にはSynthIDの電子透かしが付与されます。Gemini appやGemini in Chrome、Search経由で、AI生成コンテンツかどうかを確認できます。
Gemini Omni Flash shines in:
🔵 Conversational video editing
🔵 Multimodal referencing and combining inputs
🔵 Real-world knowledge
🔵 Connecting text and graphics directly to video actions
It’s available in @GoogleAIStudio, the Gemini API and Gemini Enterprise Agent Platform… pic.twitter.com/WF6mbMHv40— Google DeepMind (@GoogleDeepMind) June 30, 2026
参考
Google blog
Google DeepMind 公式X



