LarpGPT · Guider
Anatomien i en fotorealistisk billedprompt
Hvad hver del af en prompt gør inde i en billedgenerator, hvorfor én sætning pr. beslutning fungerer bedre end en mur af adjektiver, og hvordan man tilpasser en prompt uden at bryde den ting, der fik den til at virke.

I denne guide15
En prompt er et kort, ikke en besværgelse
Den mest vedvarende misforståelse om billedprompter er, at visse ord er magiske, og jobbet er at samle dem. Det, der faktisk virker, er tættere på at briefe en fotograf, der ikke kan stille spørgsmål. Du beskriver en scene, som nogen skal sætte op, tænde og skyde, og hver beslutning, du lader være uudtalt, er en beslutning, som modellen træffer for dig, normalt mod den mest gennemsnitlige version af det, du spurgte om.
En sætning pr. afgørelse
Lange prompter mislykkes, ikke fordi de er lange, men fordi de er udifferentierede. Tyve adjektiver i én sætning konkurrerer med hinanden, og modellen beregner gennemsnittet af dem. Det samme indhold opdelt i korte sætninger, der hver bærer en beslutning, giver et langt mere forudsigeligt resultat. Det gør også prompten redigerbar, fordi du kan se, hvilken sætning der skal ændres, når noget er galt.
Emnet kommer først og vejer mest
Position betyder noget. Det, der optræder tidligt i en prompt, vægtes generelt tungere, så emnet hører til forrest, beskrevet konkret. Et konkret motiv er et, du kan fotografere: et objekt, et sted, en situation med fysiske egenskaber. Abstrakte emner giver modellen intet at bygge ud fra, og den vil opfinde noget generisk til at fylde rummet.
Beskriv, hvad der ville være synligt, ikke hvad der mærkes
Dette er den mest brugbare disciplin. Et ord som melankolsk er en fortolkning, og modellen skal gætte, hvilket visuelt arrangement der frembringer det. Regn på et vindue, en enkelt tændt lampe, en tom stol: det er ting, et kamera optager. Skriv årsagerne frem for virkningen, og virkningen kommer af sig selv med langt mere konsistens.
Scenen sætter begrænsningerne
Indstillingen er ikke dekoration. Det bestemmer, hvilket lys der er tilgængeligt, hvilke overflader der findes til at reflektere det, hvad der kan vises i baggrunden, og hvilken skala alting læses i. Et emne beskrevet detaljeret uden angivet indstilling vil blive placeret et generisk sted, og den generiske indstilling vil så modsige halvdelen af de valg, du har truffet om emnet.
Øjeblikket indsnævrer en scene til et fotografi
Tid på dagen, vejr og årstid gør mere arbejde, end de fleste forventer, fordi hver enkelt har en hel belysningsopsætning med sig. Sen eftermiddag om efteråret indebærer en lav varm sol, lange skygger og et bestemt farvespil, alt sammen fra fire ord. At navngive øjeblikket er den mest effektive sætning i de fleste prompter.
Lys er en beslutning, ikke en eftertanke
Fotografier er stort set lavet af lys, og et uangivet lysvalg er den hurtigste vej til et fladt, jævnt oplyst billede, der ser syntetisk ud. Sig, hvor lyset kommer fra, og hvilken slags det er. Vindueslys fra venstre. En enkelt overliggende kilde. Overskyet himmel. Direkte sol gennem blade. Hver producerer et andet billede fra det samme motiv og scene.
Hårdt og blødt lys udfører forskellige opgaver
Lys fra en lille eller fjern kilde er hårdt: skarpe skyggekanter, høj kontrast, synlig tekstur. Lys fra en stor eller diffus kilde er blødt: gradvise skygger, lav kontrast, blidere overflader. At navngive hvilken du ønsker, fortæller modellen mere om stemningen i et billede, end noget adjektiv om stemning gør.
Sammensætningsinstruktioner, som modellen kan følge
Indramningsudtryk er nyttige, fordi de er utvetydige. Nærbillede, vidbillede, øjenhøjde, lav vinkel, over hovedet. Om motivet sidder centreret eller væk fra den ene side. Hvad er foran og hvad er bagved. Det er de ord, en fotograf ville bruge på settet, og de oversættes rent, fordi de beskriver geometri snarere end smag.
Linsesprog, og hvad det rent faktisk gør
En bred brændvidde overdriver dybden og gør nærting store. En lang brændvidde komprimerer afstand og udjævner lag. En bred blændeåbning kaster baggrunden ud af fokus og isolerer motivet. Disse termer fungerer i prompter, fordi de svarer til ægte optisk adfærd, og at bede om en lav dybdeskarphed er mere præcist end at bede om en sløret baggrund.
Farve, behersket
Navngivning af to eller tre farver giver et sammenhængende billede. At navngive otte producerer mudder, fordi modellen forsøger at inkludere dem alle, og ingen dominerer. Hvis en farve betyder noget, så fastgør den til et objekt i stedet for til hele billedet: en rød dør læser bedre end en rødtonet scene, og den lader resten af paletten fri til at følge lyset.
Skift én ting ad gangen
Når et resultat er tæt på, men forkert, er instinktet at omskrive prompten. Modstå det. Skift én sætning, genskab og se, hvad der bevægede sig. Dette er langsommere pr. forsøg og meget hurtigere generelt, fordi du lærer, hvad hver sætning gør. En omskrevet prompt, der virker, lærer dig intet, du kan genbruge i morgen.
Behold de versioner, du kasserer
En prompt, der gav noget interessant, men ikke det, du ønskede, er værd at beholde. Prompte biblioteker er bygget ud fra dem, ikke fra succeserne, fordi næsten-ulykkerne er det, du tilpasser, når den næste brief er lidt anderledes. En note om, hvordan resultatet faktisk så ud, er mere værd end prompten alene.
Tilpas uden at bryde strukturen
Når du genbruger en prompt, skal du skifte motiv og indstilling og lade lyset, kompositionen og linsens sætninger være i fred i starten. Det er de dele, der får et billede til at se fotografisk ud, og det er de dele, folk sletter, når en prompt føles for lang. Skift dem bevidst, én ad gangen, når det nye emne virker.
Sig hvad billedet er
Billeder lavet på denne måde er ikke fotografier, og standarderne for at sige det eksisterer allerede. IPTC Digital Source Type-ordforrådet giver værdier, der adskiller en digital optagelse, der er samplet fra det virkelige liv, fra medier, der er oprettet ved hjælp af generativ AI, og C2PA-specifikationen definerer, hvordan herkomstinformation rejser med en fil. Hvor billedet kan være taget for at registrere noget virkeligt, skal du mærke det. LarpGPT leverer prompter og referencemateriale, og det, du genererer, er dit at bruge og dit at afsløre.
Spørgsmål
Hvorfor mislykkes lange billedprompter ofte?
Fordi de er udifferentierede, ikke fordi de er lange. Tyve adjektiver i én sætning konkurrerer, og modellen beregner gennemsnittet af dem. Opdel det samme indhold i korte sætninger med én beslutning hver, og resultatet bliver langt mere forudsigeligt.
Skal jeg beskrive stemningen eller hvad der er synligt?
Hvad er synligt. Et ord som melankolsk er en fortolkning, modellen skal gætte sig til. Regn på et vindue, en enkelt tændt lampe, en tom stol er ting, et kamera optager. Skriv årsagerne og stemningen følger.
Betyder rækkefølgen af ordene i en prompt noget?
Ja. Det, der dukker op tidligt, vægtes generelt tungere, så motivet hører hjemme tæt på, beskrevet så konkret, at man kunne fotografere det.
Virker kameraudtryk som brændvidde rent faktisk?
Det gør de, fordi de svarer til ægte optisk adfærd. En bred brændvidde overdriver dybden, en lang brændvidde komprimerer den, og en bred blænde isolerer motivet. At bede om lav dybdeskarphed er mere præcist end at bede om en sløret baggrund.
Hvordan skal jeg mærke et AI-genereret billede?
Der findes standarder. IPTC Digital Source Type-ordforrådet adskiller en digital optagelse fra det virkelige liv fra medier, der er oprettet ved hjælp af generativ AI, og C2PA-specifikationen definerer, hvordan herkomsten rejser med en fil. Mærk alt, der kan tages som en registrering af noget virkeligt.
