Gemini Omni Flash:谷歌的对话式AI视频模型
Gemini Omni Flash是谷歌推出的模型系列,用于快速生成和编辑对话式视频,其官方API输出模式为视频。
什么是 Gemini Omni Flash?
Gemini Omni Flash 是谷歌推出的AI模型系列,专为快速的对话式视频生成与编辑而设计。谷歌的Gemini API文档将Gemini Omni 1.1 Flash指定为当前稳定的API模型,并将视频列为API输出模态。 Gemini Omni Flash API 可以处理文本、图片或支持的视频输入。谷歌记录了多种工作流程,包括根据提示创建视频、让图片动起来、编辑或扩展上传的视频片段,以及通过有状态交互优化结果。 这是一份独立模型指南。Story321 并未声称其视频工具由 Gemini Omni Flash 提供支持。
已记录的功能
文本生成视频
通过谷歌记录的Gemini API工作流程,根据文本提示创建视频。
图片生成视频
以图片为起点,生成动画视频结果。
对话式编辑
使用交互API和先前的交互ID,继续优化之前生成的结果。
视频编辑与扩展
谷歌记录了上传视频的编辑功能,以及为符合条件的片段添加扩展内容的功能。
帧插值
根据提供的首帧和末帧,生成过渡视频。
多种输出选项
官方文档列出了360p、720p、1080p和4K输出选项,具体取决于所选的工作流程和可用性。
当前API事实
| Features | Gemini Omni Flash |
|---|---|
稳定版API模型 | gemini-omni-1.1-flash |
预览版API模型 | gemini-omni-flash-preview |
支持文档记录的输入 | 文本、图片和视频;用于编辑或扩展的上传视频仅限于不超过10秒的合格片段。 |
支持文档记录的输出 | 视频 |
支持文档记录的视频时长 | 3 至 10 秒 |
支持文档记录的帧率 | 24 FPS |
支持文档记录的上下文窗口 | 1,048,576 个标记 |
适用场景
基于提示的短视频片段
根据文字描述的场景、动作或视觉方向,快速制作简短的视频概念原型。
静态图片动画化
在图片生成视频工作流程适用时,将提供的图片转化为一段简短的运动镜头。
迭代式视频指导
针对生成的结果进行持续对话,而不是每次编辑都从头开始。
短视频片段修改
在官方工作流程支持的情况下,编辑合格的上传片段或为其添加续集内容。
访问与可用性
谷歌在Gemini API中记录了Gemini Omni Flash,并为Gemini Omni 1.1 Flash提供了AI Studio入口。在构建工作流程前,请查看谷歌的最新文档,因为模型标识符、区域可用性和支持的功能可能会发生变化。 在谷歌的资料中,模型名称可能指代更广泛的Gemini Omni系列,而Gemini Omni 1.1 Flash是当前模型文档中命名的稳定API模型。
重要限制
Documented limitation
谷歌列出了一些编辑和扩展工作流程在部分地区(包括欧洲经济区、瑞士和英国)存在限制。
Documented limitation
上传视频的编辑和扩展功能仅限于时长不超过10秒的支持片段;扩展内容会附加到视频末尾。
Documented limitation
谷歌当前的API指南将语音编辑、音频参考和多视频工作流程列为所描述工作流程中不受支持或不可用的功能。
Documented limitation
Gemini Omni Flash 模型卡片指出了在编辑一致性、复杂运动和精确文本渲染方面的限制。
官方来源
Gemini Omni Flash 模型文档
谷歌的模型页面列出了稳定版和预览版API模型标识符、记录在案的模态、时长、分辨率、帧率和上下文窗口。
Google AI for DevelopersGemini Omni API 指南
谷歌的工作流程指南涵盖了文本生成视频、图片生成视频、有状态编辑、帧插值、视频编辑、扩展以及当前限制。
Google AI for DevelopersGemini Omni Flash 模型卡片
Google DeepMind 的模型卡片描述了预期用途和已公布的限制,包括一致性、运动和文本渲染方面的挑战。
Google DeepMindGemini Omni 概述
Google DeepMind 的概述将Gemini Omni描述为一个通过对话式指导来创建和编辑视频的模型。
Google DeepMindGemini Omni Flash 常见问题
Gemini Omni Flash 是一个文本生成视频模型吗?
谷歌记录了Gemini Omni Flash的文本生成视频工作流程。其当前模型页面列出了API中的文本、图片和视频输入,以及视频输出。
稳定的 Gemini Omni Flash API 模型是什么?
谷歌当前的模型文档将 gemini-omni-1.1-flash 列为稳定版API模型,将 gemini-omni-flash-preview 列为预览版模型。
Gemini Omni Flash 能编辑视频吗?
谷歌记录了编辑和扩展支持的上传视频片段的功能,以及有状态的对话式优化功能。但存在可用性和工作流程上的限制。
Story321 使用 Gemini Omni Flash 吗?
本页面是一份信息性模型指南,并未说明 Story321 视频工具由 Gemini Omni Flash 提供支持。
选择正确的视频工作流程
为您的项目使用 Story321 的视频工具,或在评估 Gemini Omni Flash 本身时查阅谷歌的官方文档。
模型详情基于链接的官方来源,并可能随谷歌更新API而变化。