LTX 2.5 音声から動画生成ツール
1枚のポートレート画像と2~20秒の音声トラックから、タイミングの合ったアバター動画を作成します。必要に応じて動きの方向を追加し、フレーミングを選択して、同期した動画を生成できます。
Save Your Creations
Login to save, manage and share all your generated videos
Community Showcase
LTX 2.5 音声から動画とは?
LTX 2.5 音声から動画は、アップロードされた音声クリップに合わせてタイミングを調整した短い動画を生成します。Story321では、その音声とポートレート画像やキャラクター画像を組み合わせ、必要に応じてポーズ、表情、設定、動きを記述できます。これは、人物、イラストのホスト、製品マスコット、パフォーマーが、特定の開始時の外観を維持しながら、会話、ナレーション、リズム、音楽に反応する必要がある場合に役立ちます。
LTX 2.5 音声から動画の機能
ポートレートと音声を出発点に
各LTX 2.5 音声から動画のリクエストでは、1枚の画像と1つの音声ファイルを使用します。画像は表示される被写体と開始フレームを決定し、音声はクリップのタイミングを提供します。鮮明なポートレート、キャラクターレンダリング、または承認された広告塔の画像を使用してください。
音声主導の視覚的タイミング
会話主導の動画、ナレーション、歌、音楽の合図などでは、LTX 2.5 音声から動画はアップロードされたトラックをドライバーとして扱います。音声を明瞭に保ち、一貫性のあるパフォーマンスのために1つの焦点を絞った視覚的アイデアを選択してください。
オプションのプロンプトガイダンス
画像をアップロードする場合、プロンプトはオプションです。1つの動作、表情、または設定を記述するために使用します。ガイダンス値を高くすると、LTX 2.5 音声から動画はその指示をより厳密に追従します。
より良いLTX 2.5 音声から動画クリップを計画する
動きに適した画像を選ぶ
読みやすい被写体が1つあり、照明が安定したシャープな画像から始めてください。正面を向いたポートレートはAIリップシンク動画に適しており、より広いキャラクター画像はジェスチャーの余地を残します。
アップロード前に音声を編集する
無駄なリードイン、長い無音、無関係な音楽、突然の終わりを削除してください。音声駆動アバターの場合、1人の話者または1つの音楽的アイデアの方が指示しやすいです。すべての入力の使用権限があることを確認してください。
1つの目に見えるパフォーマンスを記述する
「穏やかなプレゼンターが控えめな手の動きでカメラに向かって話す」のようなプロンプトを使用します。LTX 2.5 音声から動画は、画像、音声、プロンプトがすべて同じ人物と瞬間を記述している場合に最も効果的に機能します。
LTX 2.5 音声から動画の生成方法
- 1
ポートレートまたはキャラクター画像をアップロード
被写体を定義する画像を選択します。顔をはっきりと見えるようにし、LTX 2.5 音声から動画が動きを追加する際に正確に維持する必要がある小さなテキスト、ロゴ、背景の詳細は避けてください。
- 2
2~20秒の音声をアップロード
明瞭な声、歌、ナレーション、ビート、または音主導のパフォーマンスを追加します。LTX 2.5 音声から動画クリップはアップロードされた長さに従うため、ソースを必要な正確な瞬間にトリミングしてください。
- 3
フレーミングとオプションのガイダンスを設定
画像に合わせて「自動」を選択するか、16:9または9:16を選択します。表情や動きのためにオプションのプロンプトを追加します。ガイダンスは1~50の範囲で、デフォルトは9です。
- 4
生成、確認、調整
タイミング、顔の一貫性、ジェスチャーのスケール、画像と音声の関係をチェックします。一度に1つのソースまたは指示を変更して、次のLTX 2.5 音声から動画バージョンを作成します。
LTX 2.5 音声から動画のユースケース
トーキングポートレートのコンセプト
ライセンスされたヘッドショット、イラストキャラクター、仮想ホストを短い発話シーンに変えます。LTX 2.5 音声から動画は、簡潔な紹介、チュートリアルの一行、アナウンス、またはスクリプト化されたソーシャル投稿に適しています。
音楽駆動のキャラクターシーン
オリジナルのボーカルライン、インストゥルメンタルキュー、または効果音を使用して、キャラクターパフォーマンスを指示します。画像の雰囲気をトラックに合わせ、1つの明確なアクションをリクエストしてください。
LTX 2.5 音声から動画の制限とヒント
- 1つのソース被写体を使用してください。このフォームは、複数の人物、画面上の正確なテキスト、または場所の変更を保持するようには設計されていません。
- 音声は2~20秒に保ってください。長い素材はセクションに分割し、各LTX 2.5 音声から動画クリップを確認してから結合してください。
- 使用許可がある画像と音声のみをアップロードしてください。認識可能な人物の顔や声を使用する前に同意を得てください。
LTX 2.5 動画ワークフローを続ける
よくある質問
LTX 2.5 音声から動画とは?
LTX 2.5 音声から動画は、アップロードされた音声にタイミングを合わせた短い動画を作成します。このStory321のアバターワークフローでは、1枚の画像も必要で、それが表示される被写体と開始フレームを提供します。オプションのプロンプトで動きを記述することもできます。
LTX 2.5 音声から動画にはどのような入力が必要ですか?
1枚の画像と1つの音声ファイルをアップロードします。音声は2~20秒である必要があります。画像がすでに被写体を確立しているため、プロンプトはオプションです。表情、動作、設定を追加するために使用します。
LTX 2.5 音声から動画に最適な音声は?
1つの明確なアイデア(1人の話者、ボーカルライン、ナレーション部分、ビート、効果音)を持つクリーンなトラックを使用してください。長い無音や無関係な背景ノイズは除去してください。ソースの長さが生成されるクリップの長さになります。
利用可能なフレーミングオプションは?
「自動」を選択してソース画像に合わせるか、16:9(横長)または9:16(縦長)を選択します。ポートレートに希望のクロップがすでにある場合は「自動」から始めてください。
プロンプトガイダンスとは何ですか?
プロンプトガイダンスは、視覚的な結果があなたの書いた指示にどの程度従うかを制御します。1~50の範囲で、画像がある場合のデフォルトは9です。アクションにより強調が必要な場合は徐々に上げてください。
LTX 2.5 音声から動画の料金は?
クレジットはアップロードされた音声の長さから計算され、生成前に表示されます。追加バージョンを作成する前に、必要な正確な瞬間に音声をトリミングしてください。
LTX 2.5 音声から動画の料金
クレジットはアップロードされた音声の長さから計算されます。2~20秒の音声ファイルを選択すると合計が更新されます。
- 入力音声
- 29 クレジット/秒
LTX 2.5 音声から動画の仕様
| モデル | Lightricks LTX 2.5 Fast Audio to Video |
|---|---|
| Story321 ワークフロー | 1枚のポートレートまたはキャラクター画像 + 1つの駆動音声ファイル |
| 音声の長さ | 2~20秒 |
| プロンプト | オプション、最大5000文字 |
| アスペクト比 | 自動、16:9、または9:16。デフォルトは自動 |
| ガイダンススケール | 1~50。画像がある場合のデフォルトは9 |
| 出力 | 入力音声にタイミングを合わせた同期動画クリップ |
| このフォームでは利用不可 | 複数の画像、終了フレーム入力、クリップ数制御、加速制御 |
公式LTXリソース
公式LTX-2リポジトリを読む“入力音声ファイルに条件付けられた音声から動画への生成。”
公式パイプラインガイドを読む“入力音声によって駆動される動画生成。”
音声から動画パイプラインのリファレンスを読む“元の音声波形は忠実度を維持するために通過され、出力に返されます。”
LTX 2.5 音声から動画クリップを作成
1枚の鮮明なポートレートと短い音声クリップをアップロードし、LTX 2.5 音声から動画で同期したパフォーマンスを作成します。フレーミングを設定し、ガイダンスを追加して、公開前に確認してください。
動画を作成