LarpGPT · Guider
Bildförhållanden för AI-bilder: hur man väljer och ställer in dem
Fyrkantig, 3:2, 16:9 eller vertikal 9:16: hur man väljer ett bildförhållande för en AI-bild, hur kompositionen ändras med den och hur Midjourney och OpenAI ställer in den.

I den här guiden14
Varför förhållandet kommer först
Bildförhållandet är förhållandet mellan en bilds bredd och höjd, skrivna som två tal som 3:2 eller 16:9. Det är det första beslutet en fotograf tar, eftersom det bestämmer vad ramen kan hålla. I bildgenerering är det ännu viktigare: modellen komponerar hela scenen för den bild du ger den, så att ändra förhållandet efteråt innebär att beskärning eller regenerering. Välj det innan du förfinar resten av prompten.
Förhållande är inte upplösning
Ett förhållande säger ingenting om antalet pixlar. Midjourney:s dokumentation gör detta direkt: bildförhållande är inte detsamma som bilddimensioner, och den slutliga storleken beror på version och uppskalning. En 3:2-bild kan vara liten eller stor. Bestäm formen varifrån bilden ska ses och hur motivet ska sitta i den, hantera sedan upplösningen som en separat fråga.
Square, 1:1
Torget är balanserat och statiskt, utan dominerande riktning. Den passar enstaka objekt, symmetriska kompositioner och centrerade motiv, och det är den ram som många sociala plattformar länge har använt för inlägg och profilbilder. Det är också standard i Midjourney, vars dokumentation noterar att bilder börjar som rutor. En fyrkant passar dåligt för landskap och gruppscener, där motivet naturligt sprider sig i sidled.
Klassiskt foto, 3:2 och 2:3
3:2 är det traditionella förhållandet för stillbildsfotografering, ärvt från 35 mm film, och många kameror använder det fortfarande. Det känns naturligt för en fotografisk prompt eftersom det är den form som människor förknippar med fotografier. Horisontell 3:2 passar gator, interiörer och landskap; vertikal 2:3 passar porträtt, dörröppningar och höga byggnader, och Midjourney:s dokumentation nämner det som vanligt i tryckta fotografier och tavelramar.
4:3 och 5:4
4:3 var det ursprungliga tv-förhållandet och används fortfarande av många surfplattor och av de flesta kompakta digitalkameror. Den är något fyrkantigare än 3:2, vilket ger mer utrymme över och under motivet. 5:4 är återigen fyrkantigare och är vanligt i stor- och mellanformatsfotografering och för 8 x 10 tums utskrifter. Både passar interiörer och porträtt där du vill ha ett litet andrum utan den starka horisontella dragningen av ett brett format.
Widescreen, 16:9
16:9 är standardförhållandet för tv och onlinevideo; YouTubes hjälpcenter beskriver det som standardbildförhållandet på en dator. Dess breda ram passar landskap, stadslandskap, bilar i rörelse och filmiska scener med ett motiv placerat åt sidan. Det är ett starkt val för banners, presentationsbilder och videominiatyrer. Den är svagare för enstaka stående figurer, som hamnar små i en bred ram.
Vertikal, 9:16
9:16 är samma form vänd på sidan: helskärmen på en telefon som hålls upprätt. Midjourneys dokumentation beskriver det som vanligt för mobilt innehåll på sociala medier, och YouTube noterar att vertikala 9:16-videor kan visas med utfyllnad på datorskärmar. Den passar stående figurer, hög arkitektur, vattenfall och allt med en stark vertikal linje. Komponera för det medvetet; en horisontell scen klämd till 9:16 förlorar vanligtvis sitt motiv till tomma himmel och golv.
Hur kompositionen förändras med ramen
En bredare ram ger mer utrymme för inställning och för tredjedelsregeln, med motivet utanför mitten och utrymme för ögat att resa. En högre ram framhäver höjden och inbjuder till skiktning från förgrund till bakgrund. Nämn placeringen i prompten: "bilen i högra tredjedelen av ramen, den tomma vägen som leder in från vänster" lyder väldigt olika i 16:9 och i 1:1. När du ändrar förhållandet, läs om kompositionsmeningarna och justera dem.
Ställa in förhållandet i Midjourney
Midjourneys dokumentation listar --ar-parametern, eller dess långa form --aspect, tillagd i slutet av prompten med ett mellanslag före strecken, till exempel "tyst hamn vid gryningen --ar 16:9". Siffrorna måste vara hela: dokumentationen säger att decimaler inte accepteras och föreslår 139:100 istället för 1,39:1, och en pixelstorlek som 1920:1080 är förenklad till 16:9. Den noterar också att vissa förhållanden ändras något vid uppskalning och att extremt breda eller höga förhållanden är experimentella.
Ställa in storleken med OpenAI:s bildmodeller
OpenAIs bildgenereringsdokumentation beskriver storleken i pixlar snarare än som ett förhållande. I skrivande stund listar den 1024x1024 som kvadrat, 1536x1024 som liggande och 1024x1536 som stående bland de rekommenderade storlekarna, med ett automatiskt alternativ. För sina nyare modeller beskrivs också anpassade storlekar skrivna som bredd och höjd, där båda kanterna måste vara multiplar av 16 och förhållandet mellan lång- och kortkanten måste hålla sig inom 3:1. Observera att 1536x1024 i sig är en 3:2-form.
Stable Diffusion och andra verktyg
I Hugging Face diffusers-biblioteket accepterar Stable Diffusion text-till-bild-pipeline höjd- och breddargument i pixlar. Principen är densamma överallt: bestäm formen först, ställ sedan in vad verktyget ber om, pixlar eller förhållande. När ett verktyg bara erbjuder ett fåtal storlekar, välj den närmaste och beskära efteråt, lämna marginal i kompositionen så att beskärningen inte skär in i motivet.
Planera för mer än ett format
Om en bild kommer att användas på flera ställen, säg en bred webbbanner och en vertikal berättelse, fungerar det sällan att generera en bild och beskära den åt båda hållen. Antingen komponerar du med ett generöst tomt utrymme runt ett centralt ämne så att båda skördarna överlever, eller genererar varje format separat från samma prompt med kompositionssatserna anpassade. Det andra alternativet ger vanligtvis bättre resultat och kostar bara lite mer tid.
Ett snabbt sätt att välja
Fråga var bilden kommer att synas och vilken form motivet har. Ett enstaka föremål eller en centrerad symmetrisk scen passar en fyrkant. Ett fotografi tänkt att kännas som ett fotografi passar 3:2 eller 2:3. Ett brett landskap eller en videoram passar 16:9. En telefonbild i helskärm eller ett högt motiv passar 9:16. När ingenting pekar tydligt åt ena hållet är 3:2 en säker fotografisk utgångspunkt som beskärs väl till andra former.
Där LarpGPT passar
LarpGPT är ett bibliotek med fotouppmaningar för resor, arkitektur, bilar och livsstilsscener, med komposition inskriven i varje prompt tillsammans med motiv, belysning och lins. Du kopierar en prompt, anpassar dess inramning till det förhållande du behöver och ställer in det förhållandet i den bildgenerator du redan använder. LarpGPT genererar inga bilder och resultaten varierar mellan försöken.
Frågor
Vilket är det bästa bildförhållandet för AI-bilder?
Det beror på var bilden kommer att ses och formen på motivet. 3:2 är en naturlig fotografisk standard, 16:9 passar breda scener och video, 9:16 passar helskärmsbilder på telefonen och 1:1 passar enstaka centrerade motiv.
Hur ändrar jag bildförhållandet i Midjourney?
Lägg till --ar följt av två heltal i slutet av prompten, till exempel --ar 3:2, enligt Midjourneys dokumentation. Decimaler accepteras inte, och standard är en kvadrat.
Vilka storlekar stöder OpenAI:s bildmodeller?
I skrivande stund listar OpenAIs dokumentation 1024x1024, 1536x1024 och 1024x1536 bland de rekommenderade storlekarna, plus ett automatiskt alternativ, och beskriver anpassade storlekar för nyare modeller inom fastställda gränser.
Kan jag beskära en AI-bild till ett annat förhållande senare?
Du kan, men en komposition gjord för en form förlorar ofta sitt motiv i en annan. Lämna utrymme runt ett centralt ämne, eller generera varje format separat med kompositionssatserna anpassade.
