LarpGPT · Ratgeber
Die Anatomie einer fotorealistischen Bildaufforderung
Was jeder Teil einer Eingabeaufforderung in einem Bildgenerator bewirkt, warum ein Satz pro Entscheidung besser funktioniert als eine Wand aus Adjektiven und wie man eine Eingabeaufforderung anpasst, ohne das zu zerstören, was sie zum Funktionieren gebracht hat.

In diesem Leitfaden15
Eine Aufforderung ist eine kurze Aussage, kein Zauberspruch
Das hartnäckigste Missverständnis über Bildaufforderungen ist, dass bestimmte Wörter magisch sind und die Aufgabe darin besteht, sie zu sammeln. Was tatsächlich funktioniert, ist eher das Briefing eines Fotografen, der keine Fragen stellen kann. Sie beschreiben eine Szene, die jemand aufbauen, beleuchten und fotografieren muss, und jede Entscheidung, die Sie unausgesprochen lassen, ist eine Entscheidung, die das Model für Sie trifft, normalerweise in Richtung der durchschnittlichsten Version dessen, was Sie gefragt haben.
Ein Satz pro Entscheidung
Lange Eingabeaufforderungen scheitern nicht, weil sie lang sind, sondern weil sie undifferenziert sind. Zwanzig Adjektive in einem Satz konkurrieren miteinander und das Modell mittelt sie. Der gleiche Inhalt, aufgeteilt in kurze Sätze, von denen jeder eine Entscheidung enthält, führt zu einem weitaus vorhersehbareren Ergebnis. Dadurch ist die Eingabeaufforderung auch bearbeitbar, da Sie sehen können, welcher Satz geändert werden muss, wenn etwas nicht stimmt.
Das Thema steht an erster Stelle und hat das größte Gewicht
Die Position ist wichtig. Was am Anfang einer Eingabeaufforderung erscheint, wird in der Regel stärker gewichtet, sodass das Thema konkret beschrieben in den Vordergrund gehört. Ein konkretes Motiv ist etwas, das man fotografieren kann: ein Objekt, ein Ort, eine Situation mit physikalischen Eigenschaften. Abstrakte Themen geben dem Modell nichts, worauf es aufbauen kann, und es wird etwas Generisches erfinden, um den Raum zu füllen.
Beschreiben Sie, was sichtbar wäre, nicht was gefühlt wird
Dies ist die nützlichste Disziplin überhaupt. Ein Wort wie „melancholisch“ ist eine Interpretation, und das Modell muss erraten, welche visuelle Anordnung sie hervorbringt. Regen auf einem Fenster, eine einzelne brennende Lampe, ein leerer Stuhl: Das sind Dinge, die eine Kamera aufzeichnet. Schreiben Sie die Ursachen und nicht die Wirkung auf, und die Wirkung stellt sich von selbst mit weitaus größerer Konsistenz ein.
Die Szene setzt die Zwänge
Die Kulisse ist keine Dekoration. Es bestimmt, welches Licht verfügbar ist, welche Oberflächen vorhanden sind, um es zu reflektieren, was im Hintergrund erscheinen kann und in welchem Maßstab alles angezeigt wird. Ein ausführlich beschriebenes Thema ohne festgelegte Einstellung wird an einer generischen Stelle platziert, und die generische Einstellung widerspricht dann der Hälfte Ihrer Entscheidungen zu dem Thema.
Der Moment verengt eine Szene auf ein Foto
Tageszeit, Wetter und Jahreszeit leisten mehr Arbeit, als die meisten Menschen erwarten, da jede einzelne davon ein ganzes Beleuchtungssetup mit sich bringt. Der späte Nachmittag im Herbst bedeutet eine tiefstehende, warme Sonne, lange Schatten und einen besonderen Farbstich, alles aus vier Wörtern. In den meisten Aufforderungen ist die Benennung des Augenblicks der effizienteste Satz.
Licht ist eine Entscheidung, kein nachträglicher Gedanke
Fotos bestehen größtenteils aus Licht, und eine unbestimmte Wahl der Beleuchtung ist der schnellste Weg zu einem flachen, gleichmäßig ausgeleuchteten Bild, das synthetisch aussieht. Sagen Sie, woher das Licht kommt und welche Art es ist. Fensterlicht von links. Eine einzige Overhead-Quelle. Bedeckter Himmel. Direkte Sonne durch die Blätter. Jedes erzeugt ein anderes Bild vom gleichen Motiv und der gleichen Szene.
Hartes und weiches Licht erfüllen unterschiedliche Aufgaben
Licht von einer kleinen oder weit entfernten Quelle ist hart: scharfe Schattenkanten, hoher Kontrast, sichtbare Textur. Das Licht einer großen oder diffusen Quelle ist weich: allmähliche Schatten, geringer Kontrast, sanftere Oberflächen. Die Benennung des gewünschten Bildes verrät dem Modell mehr über die Stimmung eines Bildes als jedes Adjektiv über die Stimmung.
Kompositionsanweisungen, denen das Modell folgen kann
Rahmenbegriffe sind nützlich, weil sie eindeutig sind. Nahaufnahme, Weitwinkelaufnahme, Augenhöhe, niedriger Winkel, von oben. Ob das Motiv mittig oder seitlich sitzt. Was ist davor und was ist dahinter. Dies sind die Worte, die ein Fotograf am Set verwenden würde, und sie lassen sich sauber übersetzen, weil sie eher die Geometrie als den Geschmack beschreiben.
Linsensprache und was sie tatsächlich tut
Eine große Brennweite verstärkt die Tiefe und macht nahe Dinge groß. Eine lange Brennweite komprimiert die Entfernung und glättet Schichten. Eine große Blende wirft den Hintergrund unscharf und isoliert das Motiv. Diese Begriffe funktionieren in Eingabeaufforderungen, da sie dem realen optischen Verhalten entsprechen und die Abfrage einer geringen Schärfentiefe präziser ist als die Abfrage eines verschwommenen Hintergrunds.
Farbe, zurückhaltend
Durch die Benennung von zwei oder drei Farben entsteht ein stimmiges Bild. Die Benennung von acht erzeugt Schlamm, da das Modell versucht, alle einzubeziehen, und keiner dominiert. Wenn eine Farbe wichtig ist, binden Sie sie an ein Objekt und nicht an das gesamte Bild: Eine rote Tür lässt sich besser lesen als eine rot getönte Szene und lässt dem Rest der Palette die Freiheit, dem Licht zu folgen.
Ändern Sie jeweils eine Sache
Wenn ein Ergebnis knapp, aber falsch ist, besteht der Instinkt darin, die Eingabeaufforderung neu zu schreiben. Widerstehen Sie ihm. Ändern Sie einen Satz, regenerieren Sie ihn und sehen Sie, was sich bewegt hat. Dies ist pro Versuch langsamer und insgesamt viel schneller, da Sie lernen, was jeder Satz bewirkt. Eine neu geschriebene Eingabeaufforderung, die funktioniert, lehrt Sie nichts, was Sie morgen wiederverwenden können.
Behalten Sie die Versionen, die Sie verwerfen
Eine Eingabeaufforderung, die etwas Interessantes hervorgebracht hat, aber nicht das, was Sie wollten, ist es wert, behalten zu werden. Prompt-Bibliotheken werden aus diesen erstellt, nicht aus den Erfolgen, denn die Beinahe-Unfälle sind das, was Sie anpassen, wenn der nächste Auftrag etwas anders ausfällt. Ein Hinweis darauf, wie das Ergebnis tatsächlich aussah, ist mehr wert als die Aufforderung allein.
Passen Sie sich an, ohne die Struktur zu zerstören
Wenn Sie eine Eingabeaufforderung wiederverwenden, tauschen Sie das Motiv und die Einstellung aus und lassen Sie die Licht-, Kompositions- und Objektivsätze zunächst in Ruhe. Das sind die Teile, die ein Bild fotografisch aussehen lassen, und es sind die Teile, die gelöscht werden, wenn eine Eingabeaufforderung zu lang erscheint. Ändern Sie sie bewusst nacheinander, sobald das neue Thema funktioniert.
Sagen Sie, was das Bild ist
Auf diese Weise erstellte Bilder sind keine Fotos, und es gibt bereits Standards dafür. Das IPTC Digital Source Type-Vokabular stellt Werte bereit, die eine digitale Aufnahme aus dem echten Leben von Medien unterscheiden, die mit generativer KI erstellt wurden, und die C2PA-Spezifikation definiert, wie Herkunftsinformationen mit einer Datei übertragen werden. Wo das Bild als Aufzeichnung von etwas Realem dienen könnte, beschriften Sie es. LarpGPT stellt Eingabeaufforderungen und Referenzmaterial bereit, und was Sie generieren, steht Ihnen zur Nutzung und zur Offenlegung offen.
Fragen
Warum scheitern lange Bildaufforderungen oft?
Weil sie undifferenziert sind, nicht weil sie lang sind. Zwanzig Adjektive in einem Satz konkurrieren und das Modell mittelt sie. Teilen Sie den gleichen Inhalt in kurze Sätze auf, die jeweils eine Entscheidung enthalten, und das Ergebnis wird viel vorhersehbarer.
Soll ich die Stimmung beschreiben oder was sichtbar ist?
Was ist sichtbar. Ein Wort wie „melancholisch“ ist eine Interpretation, die das Model erraten muss. Regen auf einem Fenster, eine einzelne brennende Lampe, ein leerer Stuhl sind Dinge, die eine Kamera aufzeichnet. Schreiben Sie die Ursachen auf und die Stimmung folgt.
Spielt die Reihenfolge der Wörter in einer Aufforderung eine Rolle?
Ja. Was früh erscheint, ist in der Regel stärker gewichtet, sodass das Motiv eher in den Vordergrund gehört und so konkret beschrieben ist, dass man es fotografieren kann.
Funktionieren Kamerabegriffe wie Brennweite tatsächlich?
Das tun sie, weil sie dem realen optischen Verhalten entsprechen. Eine große Brennweite vergrößert die Tiefe, eine lange Brennweite komprimiert sie und eine große Blende isoliert das Motiv. Die Angabe einer geringen Schärfentiefe ist präziser als die Angabe eines verschwommenen Hintergrunds.
Wie soll ich ein KI-generiertes Bild kennzeichnen?
Es gibt Standards. Das IPTC Digital Source Type-Vokabular unterscheidet eine digitale Aufnahme, die aus dem echten Leben stammt, von Medien, die mit generativer KI erstellt wurden, und die C2PA-Spezifikation definiert, wie die Herkunft mit einer Datei übertragen wird. Beschriften Sie alles, was als Aufzeichnung von etwas Realem angesehen werden könnte.
