Gemini Omni Flash:Googleの会話型AI動画モデル
Gemini Omni Flashは、高速な会話型動画生成と編集のためのGoogleのモデルファミリーであり、API出力として動画が文書化されています。
Gemini Omni Flashとは?
Gemini Omni Flashは、高速な会話型動画生成と編集のために構築されたGoogle AIモデルファミリーです。GoogleのGemini APIドキュメントでは、Gemini Omni 1.1 Flashが現在の安定版APIモデルとして特定され、API出力モダリティとして動画が挙げられています。 Gemini Omni Flash APIは、テキスト、画像、またはサポートされている動画入力から動作します。Googleは、プロンプトから動画を作成する、画像をアニメーション化する、アップロードしたクリップを編集または拡張する、ステートフルなインタラクションを通じて結果を洗練する、といったワークフローを文書化しています。 これは独立したモデルガイドです。Story321は、Gemini Omni Flashが自社の動画ツールを動作させていると主張するものではありません。
文書化された機能
テキストから動画
Googleが文書化したGemini APIワークフローを通じて、テキストプロンプトから動画を作成します。
画像から動画
画像を出発点として、アニメーション動画を生成します。
会話型編集
Interactions APIと前回のインタラクションIDを使用して、以前の結果を継続的に洗練します。
動画編集と拡張
Googleは、アップロードされた動画の編集と、条件を満たすクリップへの拡張の追加を文書化しています。
フレーム補間
提供された最初と最後のフレームからトランジション動画を生成します。
複数の出力オプション
公式ドキュメントには、選択したワークフローと利用可能性に応じて、360p、720p、1080p、4Kの出力オプションが記載されています。
現在のAPI情報
| Features | Gemini Omni Flash |
|---|---|
安定版APIモデル | gemini-omni-1.1-flash |
プレビューAPIモデル | gemini-omni-flash-preview |
文書化された入力 | テキスト、画像、動画。編集・拡張用にアップロードされた動画は、最長10秒の条件を満たすクリップに限定されます。 |
文書化された出力 | 動画 |
文書化された動画の長さ | 3~10秒 |
文書化されたフレームレート | 24 FPS |
文書化されたコンテキストウィンドウ | 1,048,576トークン |
活用の可能性
プロンプトベースの短いクリップ
書かれたシーン、アクション、またはビジュアルの方向性から短い動画コンセプトをプロトタイプします。
静止画像のアニメーション化
画像から動画へのワークフローが適切な場合、提供された画像を短い動画に変換します。
反復的な動画ディレクション
毎回ゼロから編集を始めるのではなく、生成された結果についての会話を継続します。
短いクリップの修正
公式ワークフローがサポートする場合、条件を満たすアップロードされたクリップを編集するか、続きを追加します。
アクセスと利用可能性
GoogleはGemini APIでGemini Omni Flashを文書化し、Gemini Omni 1.1 Flash用のAI Studioエントリポイントを提供しています。モデル識別子、地域ごとの利用可能性、サポートされる機能は変更される可能性があるため、ワークフローを構築する前にGoogleの最新ドキュメントを確認してください。 モデル名はGoogleの資料では広義のGemini Omniファミリーを指す場合がありますが、Gemini Omni 1.1 Flashは現在のモデルドキュメントで名前が挙げられている安定版APIモデルです。
重要な制限事項
Documented limitation
Googleは、一部の編集および拡張ワークフローについて、EEA、スイス、英国を含む地域ごとの制限を記載しています。
Documented limitation
アップロードされた動画の編集と拡張は、最長10秒のサポートされているクリップに限定されます。拡張は動画の末尾に追加されます。
Documented limitation
Googleの現在のAPIガイドでは、音声編集、音声参照、複数動画ワークフローは、記載されているワークフローではサポートされていないか利用できないとされています。
Documented limitation
Gemini Omni Flashのモデルカードには、編集の一貫性、複雑な動き、正確なテキストレンダリングに関する制限が記載されています。
公式情報源
Gemini Omni Flash モデルドキュメント
Googleのモデルページには、安定版およびプレビュー版のAPIモデル識別子、文書化されたモダリティ、長さ、解像度、フレームレート、コンテキストウィンドウが記載されています。
Google AI for DevelopersGemini Omni APIガイド
Googleのワークフローガイドでは、テキストから動画、画像から動画、ステートフル編集、フレーム補間、動画編集、拡張、現在の制限について説明しています。
Google AI for DevelopersGemini Omni Flash モデルカード
Google DeepMindのモデルカードでは、意図された用途と公開された制限(一貫性、動き、テキストレンダリングの課題など)について説明しています。
Google DeepMindGemini Omni 概要
Google DeepMindの概要では、Gemini Omniを会話による指示で動画を作成・編集するモデルとして説明しています。
Google DeepMindGemini Omni Flash よくある質問
Gemini Omni Flashはテキストから動画を生成するモデルですか?
GoogleはGemini Omni Flashのテキストから動画へのワークフローを文書化しています。現在のモデルページでは、APIにおいてテキスト、画像、動画の入力と動画出力が記載されています。
Gemini Omni Flashの安定版APIモデルはどれですか?
Googleの現在のモデルドキュメントでは、gemini-omni-1.1-flashが安定版APIモデル、gemini-omni-flash-previewがプレビューモデルとして記載されています。
Gemini Omni Flashは動画を編集できますか?
Googleは、サポートされているアップロードされたクリップの編集と拡張、およびステートフルな会話による改善を文書化しています。利用可能性とワークフローの制限が適用されます。
Story321はGemini Omni Flashを使用していますか?
このページは情報提供のためのモデルガイドです。Gemini Omni FlashがStory321の動画ツールを動作させているとは明記していません。
最適な動画ワークフローを選ぶ
プロジェクトにはStory321の動画ツールを使用するか、Gemini Omni Flash自体を評価する場合はGoogleの公式ドキュメントを参照してください。
モデルの詳細はリンク先の公式情報源に基づいており、GoogleによるAPIの更新に応じて変更される可能性があります。