LarpGPT
Svenska
← Tillbaka till appen

LarpGPT · Guider

Anatomin hos en fotorealistisk bildprompt

Vad varje del av en prompt gör i en bildgenerator, varför en mening per beslut fungerar bättre än en vägg av adjektiv, och hur man anpassar en prompt utan att bryta det som fick det att fungera.

LarpGPT — Din nästa bild
LarpGPT · Din nästa bild
I den här guiden15

En uppmaning är en kortfattad, inte en besvärjelse

Den mest ihärdiga missuppfattningen om bilduppmaningar är att vissa ord är magiska och jobbet är att samla in dem. Det som faktiskt fungerar är närmare att briefa en fotograf som inte kan ställa frågor. Du beskriver en scen som någon måste sätta upp, tända och skjuta, och varje beslut du lämnar outtalat är ett beslut som modellen tar åt dig, vanligtvis mot den mest genomsnittliga versionen av det du frågade.

En mening per beslut

Långa uppmaningar misslyckas inte för att de är långa utan för att de är odifferentierade. Tjugo adjektiv i en mening tävlar med varandra och modellen gör genomsnittet av dem. Samma innehåll uppdelat i korta meningar, var och en med ett beslut, ger ett mycket mer förutsägbart resultat. Det gör också prompten redigerbar, eftersom du kan se vilken mening som ska ändras när något är fel.

Ämnet kommer först och väger tyngst

Position spelar roll. Det som dyker upp tidigt i en prompt vägs i allmänhet tyngre, så ämnet hör hemma längst fram, beskrivet konkret. Ett konkret motiv är ett du kan fotografera: ett föremål, en plats, en situation med fysiska egenskaper. Abstrakta ämnen ger modellen inget att bygga på och den kommer att uppfinna något generiskt för att fylla utrymmet.

Beskriv vad som skulle vara synligt, inte vad som känns

Detta är den enskilt mest användbara disciplinen. Ett ord som melankolisk är en tolkning, och modellen måste gissa vilket visuellt arrangemang som producerar det. Regn på ett fönster, en enda tänd lampa, en tom stol: det är saker som en kamera registrerar. Skriv orsakerna snarare än effekten, och effekten kommer av sig själv med mycket mer konsekvens.

Scenen sätter begränsningarna

Inställningen är inte dekoration. Det bestämmer vilket ljus som är tillgängligt, vilka ytor som finns för att reflektera det, vad som kan dyka upp i bakgrunden och i vilken skala allt läses. Ett ämne som beskrivs i detalj utan någon angiven inställning kommer att placeras någonstans generellt, och den generiska inställningen kommer då att motsäga hälften av de val du gjort om ämnet.

Ögonblicket begränsar en scen till ett fotografi

Tid på dygnet, väder och årstid gör mer arbete än de flesta förväntar sig, eftersom var och en har en hel belysningsuppsättning med sig. Sen eftermiddag på hösten innebär en låg varm sol, långa skuggor och en speciell färgsättning, allt från fyra ord. Att namnge ögonblicket är den mest effektiva meningen i de flesta uppmaningar.

Ljus är ett beslut, inte en eftertanke

Fotografier är till stor del gjorda av ljus, och ett okänt belysningsval är den snabbaste vägen till en platt, jämnt upplyst bild som ser syntetisk ut. Säg var ljuset kommer ifrån och vilken sort det är. Fönsterljus från vänster. En enda overheadkälla. Mulen himmel. Direkt sol genom löv. Var och en producerar olika bilder från samma motiv och scen.

Hårt och mjukt ljus gör olika jobb

Ljus från en liten eller avlägsen källa är hårt: skarpa skuggkanter, hög kontrast, synlig struktur. Ljus från en stor eller diffus källa är mjukt: gradvisa skuggor, låg kontrast, mildare ytor. Att namnge vilken du vill berättar för modellen mer om stämningen i en bild än något adjektiv om stämning gör.

Sammansättningsinstruktioner som modellen kan följa

Ramtermer är användbara eftersom de är entydiga. Närbild, vidbild, ögonhöjd, låg vinkel, overhead. Oavsett om motivet sitter centrerat eller åt sidan. Vad finns framför och vad är bakom. Det här är orden en fotograf skulle använda på inspelningen, och de översätts rent eftersom de beskriver geometri snarare än smak.

Linsspråk och vad det faktiskt gör

En bred brännvidd överdriver djupet och gör nära saker stora. En lång brännvidd komprimerar avstånd och plattar ut lager. En stor bländare gör att bakgrunden blir ur fokus och isolerar motivet. Dessa termer fungerar i prompter eftersom de motsvarar verkligt optiskt beteende, och att be om ett grunt skärpedjup är mer exakt än att be om en suddig bakgrund.

Färg, återhållen

Att namnge två eller tre färger ger en sammanhängande bild. Att namnge åtta ger lera, eftersom modellen försöker inkludera alla och ingen dominerar. Om en färg spelar roll, fäst den på ett föremål snarare än på hela bilden: en röd dörr läser bättre än en rödtonad scen, och den lämnar resten av paletten fri att följa ljuset.

Ändra en sak i taget

När ett resultat är nära men fel, är instinkten att skriva om prompten. Motstå det. Ändra en mening, återskapa och se vad som rörde sig. Detta är långsammare per försök och mycket snabbare totalt sett, eftersom du lär dig vad varje mening gör. En omskriven uppmaning som fungerar lär dig ingenting som du kan återanvända imorgon.

Behåll de versioner du kasserar

En uppmaning som gav något intressant men inte det du ville ha är värt att behålla. Snabba bibliotek är byggda från dessa, inte från framgångarna, eftersom nästan-missen är vad du anpassar när nästa brief är något annorlunda. En notering om hur resultatet faktiskt såg ut är värt mer än enbart uppmaningen.

Anpassa utan att bryta strukturen

När du återanvänder en uppmaning, byt motiv och inställning och lämna ljuset, kompositionen och linsens meningar ifred först. Det är de delar som får en bild att se fotografisk ut, och det är de delar som folk tar bort när en uppmaning känns för lång. Ändra dem medvetet, en i taget, när det nya ämnet fungerar.

Säg vad bilden är

Bilder gjorda på detta sätt är inte fotografier, och standarderna för att säga det finns redan. Ordförrådet IPTC Digital Source Type tillhandahåller värden som särskiljer en digital infångning från verkligheten från media skapad med generativ AI, och C2PA-specifikationen definierar hur härkomstinformation färdas med en fil. Där bilden kan vara tagen för att registrera något verkligt, märk den. LarpGPT tillhandahåller uppmaningar och referensmaterial, och det du genererar är ditt att använda och ditt att avslöja.

Frågor

Varför misslyckas ofta långa bilduppmaningar?

För att de är odifferentierade, inte för att de är långa. Tjugo adjektiv i en mening tävlar och modellen gör ett genomsnitt av dem. Dela upp samma innehåll i korta meningar med ett beslut vardera och resultatet blir mycket mer förutsägbart.

Ska jag beskriva stämningen eller vad som syns?

Vad som syns. Ett ord som melankolisk är en tolkning modellen måste gissa sig till. Regn på ett fönster, en enda tänd lampa, en tom stol är saker som en kamera spelar in. Skriv orsakerna och stämningen följer.

Spelar ordningen på orden i en prompt någon roll?

Ja. Det som dyker upp tidigt vägs i allmänhet tyngre, så motivet hör hemma nära framsidan, beskrivet tillräckligt konkret för att man skulle kunna fotografera det.

Fungerar kameratermer som brännvidd verkligen?

Det gör de eftersom de motsvarar verkligt optiskt beteende. En bred brännvidd överdriver djupet, en lång brännvidd komprimerar det och en stor bländare isolerar motivet. Att be om kort skärpedjup är mer exakt än att be om en suddig bakgrund.

Hur ska jag märka en AI-genererad bild?

Standarder finns. Ordförrådet IPTC Digital Source Type särskiljer en digital infångning samplade från det verkliga livet från media skapade med generativ AI, och C2PA-specifikationen definierar hur härkomst färdas med en fil. Märk allt som kan tas för en uppteckning av något verkligt.

Läs vidare

Alla appar