LarpGPT · ガイド
フォトリアリスティックな画像プロンプトの構造
画像ジェネレーター内でプロンプトの各部分が何を行うのか、1 つの決定につき 1 つの文が形容詞の壁より効果的である理由、プロンプトを機能させるための機能を壊さずにプロンプトを適応させる方法について説明します。

このガイドの内容15
プロンプトは短いものであり、呪文ではありません
画像プロンプトに関する最も根強い誤解は、特定の単語は魔法であり、それを収集するのが仕事であるというものです。実際にうまくいくのは、質問できない写真家に説明することに近い。あなたは、誰かがセットアップし、照明を当て、撮影しなければならないシーンを説明しているのですが、あなたが述べずに残しておくすべての決定は、通常、あなたが尋ねたものの最も平均的なバージョンに向けて、モデルがあなたのために行う決定です。
決定ごとに 1 つの文
長いプロンプトが失敗するのは、長さが原因ではなく、区別されていないためです。 1 つの文に含まれる 20 個の形容詞が互いに競合し、モデルはそれらを平均します。同じコンテンツを短い文に分割し、それぞれに 1 つの決定を伝えると、はるかに予測可能な結果が得られます。また、何か問題がある場合にどの文を変更すればよいかがわかるため、プロンプトが編集可能になります。
主題が最初にあり、最も重要な意味を持ちます
ポジションは重要です。一般に、プロンプトの最初に表示されるものはより重み付けされるため、主題は具体的に説明された先頭に属します。具体的な被写体とは、物理的特性を持つ物体、場所、状況など、撮影できるものです。抽象的な主題はモデルに構築の材料を与えず、モデルは空間を埋めるために一般的な何かを発明します。
感じられるものではなく、目に見えるものを説明する
これは最も有用な規律です。メランコリックのような言葉は解釈であり、モデルはどの視覚的配置がそれを生み出すかを推測する必要があります。窓に降る雨、たった一つの灯り、空の椅子、それらがカメラに記録されます。結果ではなく原因を書くと、結果がより一貫性をもって自動的に得られます。
シーンが制約を設定する
セッティングは飾りではありません。どのような光が利用できるか、それを反射するためにどのような表面が存在するか、背景に何が表示されるか、すべてがどのスケールで読み取られるかが決まります。設定が明示されていない詳細に説明された主題は、一般的な場所に配置され、その一般的な設定は、その主題に関して行った選択の半分と矛盾します。
瞬間が場面を写真に絞り込む
時間帯、天気、季節は、それぞれに照明設定全体が含まれるため、ほとんどの人が予想するよりも多くの役割を果たします。秋の午後遅くは、低く暖かい太陽、長い影、そして特定の色かぶりを暗示し、これらはすべて 4 つの単語から来ています。ほとんどのプロンプトでは、瞬間に名前を付けることが最も効果的な文です。
光は決断であり、後から考えるものではありません
写真は主に光で構成されており、明言されていない照明の選択が、合成のように見える平らで均一に光が当たった画像を作成するための一番の近道です。光がどこから来ているか、そしてそれがどのような種類であるかを言います。左からの窓の光。単一のオーバーヘッド ソース。曇り空。葉越しの直射日光。それぞれが同じ被写体やシーンから異なる画像を生成します。
硬い光と柔らかい光は異なる役割を果たします
小さな光源または遠くの光源からの光は、シャープな影のエッジ、高いコントラスト、目に見えるテクスチャなど、難しいものです。大きな光源または拡散した光源からの光は柔らかく、影が緩やかで、コントラストが低く、表面が穏やかです。どれに名前を付けるかによって、気分に関する形容詞よりも画像の雰囲気がモデルに伝わります。
モデルが従うことができる合成命令
フレーミング用語は明確であるため便利です。クローズアップ、ワイドショット、アイレベル、ローアングル、オーバーヘッド。被写体が中央に座っているか、片側にずれているか。その前にあるものとその後ろにあるもの。これらは写真家がセットで使用する言葉であり、味ではなく幾何学を説明しているため、きれいに翻訳されています。
レンズ言語とその実際の動作
焦点距離が広いと奥行きが誇張され、近くのものは大きく見えます。焦点距離が長いと距離が圧縮され、層が平坦になります。絞りが広いと、背景の焦点がぼけ、被写体が孤立してしまいます。これらの用語は実際の光学的動作に対応しているため、プロンプトで機能します。また、浅い被写界深度を要求することは、ぼやけた背景を要求するよりも正確です。
色、抑制
2 つまたは 3 つの色に名前を付けると、一貫したイメージが生成されます。 8 つ名前を付けると、モデルはそれらすべてを含めようとし、どれも優勢ではないため、泥が生じます。色が重要な場合は、画像全体ではなくオブジェクトに色を付けます。赤いドアは、赤みがかったシーンよりも読みやすく、パレットの残りの部分は自由に光を追うことができます。
一度に 1 つずつ変更する
結果が近いものの間違っている場合、本能的にプロンプトを書き換えたくなります。抵抗してください。一文を変更して再生成し、何が動いたかを確認します。これは、各文が何を行っているかを学習するため、試行ごとに遅くなり、全体的にははるかに速くなります。書き直されて機能するプロンプトは、明日再利用できるものを何も教えてくれません。
破棄したバージョンを保持する
興味深いものを生成したが、望んでいたものではなかったプロンプトは、保存する価値があります。次のブリーフィングがわずかに異なる場合にニアミスを適応させるため、プロンプト ライブラリは成功ではなく成功から構築されます。実際の結果がどのようになったかについてのメモは、プロンプトだけよりも価値があります。
構造を壊さずに適応する
プロンプトを再利用する場合は、最初は主題と設定を交換し、光、構図、レンズの文はそのままにしておきます。これらは、画像を写真のように見せる部分であり、プロンプトが長すぎると感じた場合に削除される部分でもあります。新しい主題が機能し始めたら、一度に 1 つずつ意図的に変更します。
どういうイメージなのか言ってみろ
このようにして作られた画像は写真ではありませんし、そう言うための基準はすでに存在します。 IPTC デジタル ソース タイプの語彙は、現実世界からサンプリングされたデジタル キャプチャと、生成 AI を使用して作成されたメディアを区別する値を提供し、C2PA 仕様は、出所情報がファイルとともにどのように伝達されるかを定義します。本物の何かを記録するために画像が撮影された可能性がある場合は、ラベルを付けます。 LarpGPT はプロンプトと参考資料を提供しており、生成したものはあなたが使用し、開示するものです。
よくある質問
長い画像プロンプトが頻繁に失敗するのはなぜですか?
長いからではなく、未分化だからです。 1 つの文に含まれる 20 個の形容詞が競合し、モデルはそれらを平均します。同じコンテンツを 1 つの決定を含む短い文に分割すると、結果がはるかに予測しやすくなります。
雰囲気を説明すべきでしょうか、それとも目に見えるものを説明すべきでしょうか?
何が見えるのか。メランコリックのような言葉は、モデルが推測する必要がある解釈です。窓に降る雨、たった一つの灯り、空の椅子などがカメラに記録されます。原因を書けば気分も後からついてきます。
プロンプト内の単語の順序は重要ですか?
はい。一般に、最初に表示されるものはより重み付けされるため、被写体は前面近くに属し、写真に撮ることができるほど具体的に説明されます。
焦点距離などのカメラ用語は実際に機能するのでしょうか?
それは、実際の光学的挙動に対応しているためです。焦点距離が広いと奥行きが誇張され、焦点距離が長いと奥行きが圧縮され、絞りが広いと被写体が分離されます。浅い被写界深度を要求することは、ぼやけた背景を要求するよりも正確です。
AI で生成された画像にどのようにラベルを付ければよいですか?
基準は存在します。 IPTC デジタル ソース タイプの語彙は、実生活からサンプリングされたデジタル キャプチャと、生成 AI を使用して作成されたメディアを区別し、C2PA 仕様は、ファイルの出所がどのように伝わるかを定義します。本物の記録として撮影された可能性のあるものにはすべてラベルを付けます。
