FlyAIgh
Home/Blog/Guide

AI 動画プロンプトの解剖 — 実運用 381 本に共通する構造

Published August 22, 202611 min read

プロンプト指南の多くは誰かが考案したテンプレートを渡してきます。この 381 本は実際に走り、映像を出しました。すべてに繰り返し現れる構造を、カット間の繋ぎを扱う部分まで含めて示します。

進軍する軍勢の上空、嵐雲を突き破る戦龍。この記事で分析したプロンプトの 1 本から生成されたものです
この記事で分解する 7 カット構成の第 2 カットです。これを出したプロンプトは下に全文を引用しています。

プロンプト指南が渡してくるのは、たいていその記事のために誰かが書いたテンプレートです。 この記事が分解するのは実際に走り、映像を出した 381 本で、 完成した 52 作品から取り出しました。手で打ったのではなく編集されたものですが、 そこが有用な点でもあります。同じ構造がすべてに繰り返し現れ、 そのまま真似できるくらいはっきり見えています。

5 つの部分、順番どおりに

  1. スタイルブロック —— カメラ、フィルム、色調、粒状感。同じ作品のすべてのカットで同一です。
  2. フレーム束縛 —— 与えた画像で始まり終わるのか、始まりだけが固定されるのか。
  3. 主体の一貫性条項 —— 誰が最後まで同じ姿でいなければならないか。
  4. キャラクターバイブル —— 各主体の具体的な外形描写。
  5. タイムコード付きの動き —— 尺を区間に切り、各区間に固有の動作を割り当てます。

完全な 1 本は平均でおよそ 850 文字です。 その長さの大半は 4 番目と 5 番目から来ており、 この 2 つが存在する理由は同じです。モデルが代わりに下してしまう判断を、こちらに取り戻すためです。

このプロンプトの出どころ

完成した 52 作品にまたがる 381 本のカットプロンプトで、いずれも FlyAIgh 上で生成されました。 以下の構造分析と件数はすべて全集を対象にしています。原文を引用するのは自分たちのボードからだけです。 他の人の脚本はその人のものなので、統計にだけ寄与し、引用には出しません。

381 本のうち 311 本は中国語で書かれています。元の脚本がその言語だったためで、 70 本が英語です。構造はどちらの言語でも同一で、 ブロックの順序もタイムコードの書式も言語によって変わりません。 ここで引用するプロンプトはすべて英語のほうから取っています。

部分ごとに

1. スタイルブロック。角括弧で囲み、先頭に置き、 同じ作品のすべてのカットで一字一句そのまま繰り返します。

[STYLE: Epic dark-fantasy spectacle on large-format anamorphic: crushed slate-blue shadows, void-black depths, ember-orange and molten-gold magic light cutting volumetric god-rays through drifting ash. Hammered steel, rune-etched stone, blowing banners. 35mm halation bloom, deep-focus scale, storm-dusk grandeur.]

何が入っているかに注目してください。画面フォーマット(large-format anamorphic)、 具体的な色の言語(slate-blue、ember-orange、molten-gold)、光の振る舞い(volumetric god-rays)、 素材(hammered steel、rune-etched stone)、そしてフィルムの特性(35mm halation bloom)です。 動作については一言も書かれていません。

繰り返すこと自体が要点です。各生成は前回の記憶を持たない独立した呼び出しなので、 述べ直さなかったものは作り直されます。7 カットが 1 本の映画に見えるのは、 この同一のスタイルブロックを 7 回繰り返した結果です。

2. フレーム束縛。一文で書き、 そのカットに目標となる終わりの画があるかどうかで 2 通りになります。

  • "Video starts from the first reference image (frame 1: opening pose) and ends at the second reference image (frame N: closing pose)." —— 始まりと終わりの両方を固定します。
  • "Video starts from the first reference image (opening frame: composition and pose). From there the action plays out naturally per the motion description — the ending is not pinned to a target still." —— 始まりだけを固定します。

2 つめの書き方には注目する価値があります。両端を固定すると精度が手に入り、 自然さを失います。モデルが決められた場所へ到達しなければならないからです。 そのカットに必要なのが説得力のある動きだけなら、 終わりを開けておいたほうが良い運動が出ます。

3. 主体の一貫性条項。明示的に書き、しかも名指しします。

The subject(s) — Lyra, The Void — are defined by the remaining reference images: maintain identical face, hair, build, costume and signature props throughout the entire shot.

4. キャラクターバイブル。名指しした各主体に、 属性をセミコロンで区切った圧縮された外形描写を与えます。

Character bible: Lyra (late twenties, lean, athletic, road-hardened; medium height, wind-tangled dark brown, shoulder-length, loose strands across face, worn brown travel-leathers under battered half-royal steel pauldron, tattered deep-crimson cloak); The War Dragon (ancient war-beast, scarred veteran, colossal quadruped dragon, ~40m wingspan filling the frame, dwarfing its rider, none; spined dorsal ridge instead of mane, tattered war-harness of scorched leather and hammered steel straps).

これは参照画像と並行するもので、置き換えるものではありません。 画像が似姿を担い、テキストは画像では固定できないものを担います。 規模("~40m wingspan filling the frame")、佇まい("road-hardened")、 そして意図的に存在しないもの(たてがみがあるはずの場所に書かれた "none")です。

5. タイムコード付きの動き。これらを普通のプロンプトから最も強く隔てている部分です。

Movement: Total 6s, one continuous take, no cut. 0-3s: slow push-in from the ELS silhouette across the cliff toward Lyra. 3-6s: camera arcs around to her hand as her fist closes on the shard and it flares cold light. Wind and low void-rumble throughout; sound thins to near-silence at the flare. Camera: slow push-in then arc to hand. 16:9 aspect ratio.

まず総尺、次にラベル付きの区間、続いてカメラワークの一行要約、最後に画面比です。 音をまったく生成しないモデルでも音は描写します。費用はかからず、テンポを引き締めてくれるからです。 "One continuous take, no cut" が入っているのは、 複数のビートを渡されたモデルが 1 本の中で勝手にカットを作ることがあるためです。

完全な 1 本

5 つの部分をすべて組み上げたもので、走ったときそのままです。 これがこのページ冒頭の龍、第 2 カットです。

[STYLE: Epic dark-fantasy spectacle on large-format anamorphic: crushed slate-blue shadows, void-black depths, ember-orange and molten-gold magic light cutting volumetric god-rays through drifting ash. Hammered steel, rune-etched stone, blowing banners. 35mm halation bloom, deep-focus scale, storm-dusk grandeur.] Video starts from the first reference image (opening frame: composition and pose). From there the action plays out naturally per the motion description — the ending is not pinned to a target still. The subject(s) — The Free Armies, The War Dragon — are defined by the remaining reference images: maintain identical face, hair, build, costume and signature props throughout the entire shot. Character bible: The Free Armies (mixed, mostly young to middle-aged warriors, host of thousands; tight ranks stacked into deep formation, varied, mostly helmet-covered or battle-bound, mismatched armor and chainmail in deep blue, green, gold heraldry, unified crimson sigil); The War Dragon (ancient war-beast, scarred veteran, colossal quadruped dragon, ~40m wingspan filling the frame, dwarfing its rider, none; spined dorsal ridge instead of mane, tattered war-harness of scorched leather and hammered steel straps). Movement: Total 5s, one continuous sweeping take, no cut. 0-2s: crane up over marching ranks as banners unfurl. 2-4s: the War Dragon bursts through clouds top-frame, roar shaking the frame. 4-5s: camera sweeps to reveal columns converging. Driving crescendo, hooves and wingbeats build. Camera: crane up, sweeping pan. 16:9 aspect ratio.

誰も書かない部分、カットの繋ぎ

ここまではすべて単一のカットの話です。 プロンプト指南がほとんど扱わない層は、2 つのカットのあいだで起きることで、 1 本ずつ生成するのをやめて構成を組み始めて初めて姿を現します。

このセットでは 225 カットが明示的な転換の判断を持っています。 それぞれが 4 つを指定します。カットの種類、その切れ目をまたいで保たれるべき視覚的連続性、 音が先行するか遅れるか、そして次のカットの開始フレームがどこから来るかです。

表の前に述べておくべき数字があります。転換の記録を持つカットは 300 ありますが、 そのうち75 はシステムの既定値で、 カットが指定されなかったときに書き込まれたもの、すべて「クリーンカット」です。 これらを演出上の判断として数えると、硬いカットが全転換の 43% に見えてしまいます。 以下では除外しました。残る記録にはすべて理由が書かれています。
カットの種類件数音が先行または遅延何のために使うか
clean-cut5535硬い並置。断絶そのものが狙いです
match-action5120一方で始まった動きがもう一方で完結します
smash-cut2813語調の急転。多くは衝撃の瞬間に置きます
eyeline-reaction2713誰かが見て、次にその人が見たものを見せます
axial-cut237同一軸線上での寄りまたは引きです
seamless1572 本を途切れない 1 つの動きに縫い合わせます
dissolve1414時間または場所の転換です
match-cut126形や動きが切れ目をまたいで韻を踏みます

目を引く点が 2 つあります。硬いカットとマッチアクションがほぼ並んでいること(55 対 51)です。実際に人が判断するとき、連続性を保つカットは、 きれいに断ち切るのとほぼ同じ頻度で選ばれています。 そしてディゾルブは 1 つ残らず音声の先行を伴っており、14 分の 14 です。 一方でクリーンカットで音声の先行を伴うのは 4 分の 1 にとどまります。 音が何もしていないディゾルブは、スライドショーに見えてしまいます。

同じ 7 カット構成から、書かれたままの判断を 3 つ挙げます。

  • clean-cut、J カットの音声 —— "Hard juxtaposition cut from heroic climb to tyrant's reversal — the discontinuity is the power flip."連続性の注記は、嵐空の光を保ち、画面上の方向を維持して、 波が城塞に当たっていると読めるようにすること。
  • match-action、L カットの音声 —— "The reforged Crown's light flows into the lifting gesture — continuous radiance carries the cut."
  • seamless、別の作品から —— "Continuous action exceeds generation limit; seamless stitch preserves unbroken temporal compression."これは技術的な制約が創作上の選択を生んだ例です。 その動きが 1 回の生成で許される長さを超えていたため、分割して縫い合わせました。

次のカットの最初のフレームはどこから来るか

どの転換も、次のカットがどこから始まるかを同時に決めています。同じ 225 件の判断で見ると次のとおりです。

フレーム戦略件数何をするか
fresh102新しい開始フレーム。前のカットとの繋がりはありません
reference-prev-last94新しいフレームを生成しますが、前の最終フレームに導かせます
blend14両方から混ぜて影響を受けます
video-extend8前の映像の末尾からそのまま続けます
reuse-prev-last7前の最終フレームをそのまま使い、新規生成はしません

上位 2 行がほぼ半々である点が興味深いところです。およそ 4 割のカットが、使い回さずに前のフレームを参照しています。 新しいフレームは生成されますが、前のカットがどう終わったかを条件にしています。 完全な自由と硬い連続性のあいだの中間設定で、 実際にはまっさらから始めるのとほぼ同じ頻度で選ばれています。 そのままの使い回しはまれで(225 件中 7 件)、構図を完全に固定してしまうからです。

このプロンプトが出したもの

本文で引用してきた 7 カット構成を、順番どおりに組み上げたものです。 35 秒、280 クレジット、720p。6 カットが Seedance 2.0、 冒頭の 1 カットが Kling V3 Omni で、これはカットごとの選択であってプラットフォームの既定ではありません。

7 カット、35 秒、280 クレジット。第 5 と第 6 カットが、上で述べた J カットと L カットの音声先行を伴うクリーンカットです。第 7 カットは、王冠の光を持ち上げる仕草へ運ぶマッチアクションです。

カット間で修整は一切していません。カット同士の一貫性は、 繰り返したスタイルブロック、キャラクターバイブル、そして転換の判断から来ています。 この記事が扱ってきた 3 つです。

このデータが語らないこと

  • このプロンプトは編集されたもので、打たれたものではありません。脚本、確定したスタイル、参照素材のキャストを入れると、この構造が出てきます。 これほど一貫している理由もそこにあり、 だからこそ人がプロンプトをどう書くかの証拠として扱うのは誤りです。
  • 構造は品質ではありません。ここにあるプロンプトはすべて走りましたが、どれが良い映像を出したかについて、 この記事は何も主張しません。データにその判断は記録されていません。
  • このセットの大半は英語ではありません。381 本のうち 311 本が中国語です。構造はどちらでも成り立ちますが、 ここで引用した言い回しの慣習は英語の 70 本から来ています。
  • 転換のデータは 1 つのシステムの語彙を反映しています。8 種類のカットは、私たちのディレクター機能が出せるものです。 別のツールなら別の分布になりますし、転換の層をまったく持たないツールなら 1 つも出ません。

FAQ

AI 動画のプロンプトには実際何を書けばよいですか。

実運用の 381 本では、同じ 5 つのブロックが同じ順序で繰り返し現れます。(1) カメラ、フィルム、色調、粒状感を収めたスタイルブロック。同じ作品のすべてのカットで完全に同一に保たれます。(2) フレーム束縛の一文。与えた参照画像で始まり終わるのか、始まりだけが固定されるのかを述べます。(3) 主体の一貫性を求める条項。誰が変わってはいけないかを名指しします。(4) キャラクターバイブル。各主体の具体的な外形描写です。(5) タイムコード付きの動きのブロック。尺を区間に切り、各区間で何が起きるかを述べます。381 本を平均すると、完全な 1 本はおよそ 850 文字です。

AI 動画のプロンプトはどのくらいの長さにすべきですか。

このセットの平均はおよそ 850 文字で、多くの指南が示す一行プロンプトよりかなり長いです。この長さは水増しではありません。大半はキャラクターバイブルとタイムコード付きの動きの分解で、どちらも同じ理由、つまりモデルが自分で決めてしまう余地を消すために存在します。短いプロンプトが失敗するわけではなく、より多くの判断をモデルに渡すだけです。

スタイルの記述はカットごとに繰り返すべきですか。

繰り返すべきで、このセットでは一字一句そのまま繰り返されています。同じ作品のすべてのカットが同一のスタイルブロックを持ち、カメラもフィルムも色調も同じです。各生成は前回の記憶を持たない独立した呼び出しなので、述べ直さなかったものはすべて作り直されます。別々に生成された 7 カットが 1 本の映画に見えるのは、同一のスタイルブロックを 7 回繰り返した結果です。

タイムコード付きの動きのブロックとは何ですか。

動作を全体として描写するのではなく、尺をラベル付きの区間に切ります。"Total 6s, one continuous take, no cut. 0-3s: slow push-in from the establishing silhouette toward the subject. 3-6s: camera arcs around to her hand as her fist closes on the shard." という書き方です。テンポを固定するもので、動作を尺の中にどう配分するかをモデルに委ねません。

別々に生成した AI のカットを繋げるにはどうすればよいですか。

繋ぎが自然に生まれるのを期待するのではなく、繋ぎをプロンプトの一部として書きます。このセットでは 225 カットが明示的な転換の判断を持ち、それぞれが 4 つを指定しています。カットの種類(マッチアクション、スマッシュカット、視線と反応、ディゾルブなど)、その切れ目をまたいで保たれるべき視覚的連続性、音が先行するか遅れるか(J カット、L カット)、そして次のカットの開始フレームがどこから来るかです。公開されているプロンプト指南でこの層を扱うものはほとんどありません。1 本ずつ生成するのではなく、カットを並べて構成し始めて初めて現れる層だからです。

次のカットは前のカットの最終フレームを使い回すべきですか。

場合によります。実際はほぼ半々です。明示的な 225 件の判断のうち、102 件が新しい開始フレームを生成し、94 件が前のカットの最終フレームを参照しました。参照とは、新しいフレームを生成しつつ古いフレームに導かせるという意味です。前のフレームをそのまま使い回したのは 7 件、前の映像から延長したのは 8 件でした。使い回しは硬い連続性を買う代わりに構図の自由度を失うため、動きを切ってはいけないシームレスな縫合に限って使われる傾向があります。

このプロンプトは手書きですか。

違います。FlyAIgh のディレクター機能が、脚本、確定した視覚スタイル、参照素材のキャストから編集して組み立てたものです。381 本にわたって構造がここまで一貫している理由も、同じ作品の中でスタイルブロックがバイト単位で一致している理由もそこにあります。読む価値があるのは構造そのものです。機械が組み立てても人が組み立てても、この 5 つのブロックは同じように成り立ちます。

Build a consistent character on FlyAIgh

Identity refs + AI-derived persona + outfit variants, bound to a character ID that auto-injects into every model. 25 free credits, no card required.