Gemini Omni Flash: konwersacyjny model wideo AI od Google
Gemini Omni Flash to rodzina modeli Google do szybkiego konwersacyjnego generowania i edycji wideo, z wideo jako udokumentowanym wyjściem API.
Czym jest Gemini Omni Flash?
Gemini Omni Flash to rodzina modeli AI Google zaprojektowana do szybkiego konwersacyjnego generowania i edycji wideo. Dokumentacja API Gemini od Google identyfikuje Gemini Omni 1.1 Flash jako obecny stabilny model API i wymienia wideo jako modalność wyjściową API. API Gemini Omni Flash może pracować z tekstu, obrazów lub obsługiwanych wejściowych plików wideo. Google dokumentuje przepływy pracy do tworzenia wideo z promptu, animowania obrazu, edycji lub rozszerzania przesłanego klipu oraz udoskonalania wyniku poprzez interakcję stanową. To niezależny przewodnik po modelu. Story321 nie twierdzi, że Gemini Omni Flash napędza jego narzędzia wideo.
Udokumentowane możliwości
Tekst na wideo
Tworzenie wideo z promptu tekstowego poprzez przepływ pracy API Gemini udokumentowany przez Google.
Obraz na wideo
Użycie obrazu jako punktu wyjścia do animowanego wyniku wideo.
Edycja konwersacyjna
Użycie API Interactions i poprzedniego ID interakcji, aby kontynuować udoskonalanie wcześniejszego wyniku.
Edycja i rozszerzanie wideo
Google dokumentuje edycję przesłanych plików wideo oraz dodawanie rozszerzenia do kwalifikującego się klipu.
Interpolacja klatek
Generowanie wideo przejściowego z podanych pierwszej i ostatniej klatki.
Wiele opcji wyjściowych
Oficjalna dokumentacja wymienia opcje wyjściowe 360p, 720p, 1080p i 4K, w zależności od wybranego przepływu pracy i dostępności.
Aktualne fakty dotyczące API
| Features | Gemini Omni Flash |
|---|---|
Stabilny model API | gemini-omni-1.1-flash |
Podgląd modelu API | gemini-omni-flash-preview |
Udokumentowane wejście | Tekst, obraz i wideo; przesłane wideo do edycji lub rozszerzenia jest ograniczone do kwalifikujących się klipów o maksymalnej długości 10 sekund. |
Udokumentowane wyjście | Wideo |
Udokumentowany czas trwania wideo | 3 do 10 sekund |
Udokumentowana liczba klatek na sekundę | 24 FPS |
Udokumentowane okno kontekstowe | 1 048 576 tokenów |
Gdzie może znaleźć zastosowanie
Krótkie klipy z promptu
Prototypowanie krótkich koncepcji wideo na podstawie zapisanej sceny, akcji lub kierunku wizualnego.
Animacja nieruchomego obrazu
Przekształcenie dostarczonego obrazu w krótki ruchomy ujęcie, gdy odpowiedni jest przepływ pracy obraz-na-wideo.
Iteracyjne kierowanie wideo
Kontynuowanie rozmowy o wygenerowanym wyniku zamiast zaczynania każdej edycji od zera.
Poprawki krótkich klipów
Edycja kwalifikującego się przesłanego klipu lub dodanie kontynuacji, gdy oficjalny przepływ pracy to obsługuje.
Dostęp i dostępność
Google dokumentuje Gemini Omni Flash w API Gemini i udostępnia punkt wejścia AI Studio dla Gemini Omni 1.1 Flash. Sprawdź aktualną dokumentację Google przed zbudowaniem przepływu pracy, ponieważ identyfikatory modeli, dostępność regionalna i obsługiwane funkcje mogą się zmieniać. Nazwa modelu może odnosić się do szerszej rodziny Gemini Omni w materiałach Google, podczas gdy Gemini Omni 1.1 Flash jest stabilnym modelem API wymienionym w aktualnej dokumentacji modelu.
Ważne ograniczenia
Documented limitation
Google wymienia ograniczenia dla niektórych przepływów pracy edycji i rozszerzania w zależności od regionu, w tym EOG, Szwajcarii i Wielkiej Brytanii.
Documented limitation
Edycja i rozszerzanie przesłanego wideo są ograniczone do obsługiwanych klipów o długości do 10 sekund; rozszerzenie jest dodawane na końcu wideo.
Documented limitation
Aktualny przewodnik API Google wymienia edycję głosu, odniesienia audio i przepływy pracy z wieloma wideo jako nieobsługiwane lub niedostępne w opisanym przepływie pracy.
Documented limitation
Karta modelu Gemini Omni Flash odnotowuje ograniczenia dotyczące spójności edycji, złożonego ruchu i dokładnego renderowania tekstu.
Oficjalne źródła
Dokumentacja modelu Gemini Omni Flash
Strona modelu Google wymienia identyfikatory stabilnego i podglądowego modelu API, udokumentowane modalności, czas trwania, rozdzielczości, liczbę klatek na sekundę i okno kontekstowe.
Google AI dla programistówPrzewodnik po API Gemini Omni
Przewodnik po przepływach pracy Google obejmuje tekst-na-wideo, obraz-na-wideo, edycję stanową, interpolację klatek, edycję wideo, rozszerzanie i aktualne ograniczenia.
Google AI dla programistówKarta modelu Gemini Omni Flash
Karta modelu Google DeepMind opisuje przeznaczenie i opublikowane ograniczenia, w tym wyzwania związane ze spójnością, ruchem i renderowaniem tekstu.
Google DeepMindPrzegląd Gemini Omni
Przegląd Google DeepMind opisuje Gemini Omni jako model do tworzenia i edycji wideo za pomocą konwersacyjnego kierowania.
Google DeepMindFAQ Gemini Omni Flash
Czy Gemini Omni Flash to model tekst-na-wideo?
Google dokumentuje przepływ pracy tekst-na-wideo dla Gemini Omni Flash. Jego aktualna strona modelu wymienia tekst, obraz i wideo jako wejście oraz wideo jako wyjście w API.
Jaki jest stabilny model API Gemini Omni Flash?
Aktualna dokumentacja modelu Google wymienia gemini-omni-1.1-flash jako stabilny model API oraz gemini-omni-flash-preview jako model podglądowy.
Czy Gemini Omni Flash może edytować wideo?
Google dokumentuje edycję i rozszerzanie obsługiwanych przesłanych klipów, a także stanowe udoskonalanie konwersacyjne. Obowiązują ograniczenia dostępności i przepływu pracy.
Czy Story321 używa Gemini Omni Flash?
Ta strona jest informacyjnym przewodnikiem po modelu. Nie stwierdza, że Gemini Omni Flash napędza narzędzia wideo Story321.
Poznaj przepływy pracy wideo na Story321
Tekst na wideo
Twórz krótkie filmy z promptu tekstowego.
Otwórz Tekst na wideoObraz na wideo
Rozpocznij przepływ pracy wideo z obrazu.
Otwórz Obraz na wideoEdytor wideo AI
Poznaj przestrzeń roboczą edycji wideo Story321.
Otwórz Edytor wideo AIRozszerz wideo
Kontynuuj wideo za pomocą przepływu pracy rozszerzania Story321.
Otwórz Rozszerz wideoWybierz odpowiedni przepływ pracy wideo
Skorzystaj z narzędzi wideo Story321 dla swojego projektu lub zapoznaj się z oficjalną dokumentacją Google, jeśli oceniasz samo Gemini Omni Flash.
Szczegóły modelu oparte są na powiązanych oficjalnych źródłach i mogą się zmieniać wraz z aktualizacjami API Google.