LarpGPT
Dansk
← Tilbage til appen

LarpGPT · Guider

Størrelsesforhold for AI-billeder: hvordan man vælger og indstiller dem

Firkantet, 3:2, 16:9 eller lodret 9:16: hvordan man vælger et billedformat for et AI-billede, hvordan kompositionen ændres med det, og hvordan Midjourney og OpenAI indstiller det.

LarpGPT — Dit næste billede
LarpGPT · Dit næste billede
I denne guide14

Hvorfor forholdet kommer først

Størrelsesforholdet er forholdet mellem et billedes bredde og højde, skrevet som to tal såsom 3:2 eller 16:9. Det er den første beslutning en fotograf tager, fordi den bestemmer, hvad rammen kan rumme. I billedgenerering betyder det endnu mere: Modellen komponerer hele scenen til den ramme, du giver den, så at ændre forholdet bagefter betyder beskæring eller regenerering. Vælg det, før du finjusterer resten af prompten.

Forhold er ikke opløsning

Et forhold siger intet om antallet af pixels. Midjourney's dokumentation understreger dette direkte: billedformat er ikke det samme som billeddimensioner, og den endelige størrelse afhænger af version og opskalering. Et 3:2-billede kan være lille eller stort. Bestem formen, hvorfra billedet skal ses, og hvordan motivet skal sidde i det, og betag derefter opløsningen som et separat spørgsmål.

Firkantet, 1:1

Pladsen er afbalanceret og statisk uden dominerende retning. Det passer til enkelte objekter, symmetriske kompositioner og centrerede motiver, og det er den ramme, mange sociale platforme længe har brugt til opslag og profilbilleder. Det er også standard i Midjourney, hvis dokumentation bemærker, at billeder starter som firkanter. En firkant passer dårligt til landskaber og gruppescener, hvor motivet naturligt breder sig sidelæns.

Klassisk billede, 3:2 og 2:3

3:2 er det traditionelle forhold for stillfotografering, arvet fra 35 mm film, og mange kameraer bruger det stadig. Det føles naturligt for en fotografisk prompt, fordi det er den form, folk forbinder med fotografier. Horisontal 3:2 passer til gader, interiør og landskaber; lodret 2:3 passer til portrætter, døråbninger og høje bygninger, og Midjourney's dokumentation nævner det som almindeligt i trykte fotografier og billedrammer.

4:3 og 5:4

4:3 var det oprindelige tv-forhold og bruges stadig af mange tablets og af de fleste kompakte digitalkameraer. Den er lidt mere kvadratisk end 3:2, hvilket giver mere plads over og under motivet. 5:4 er igen firkantet og er almindeligt i stor- og mellemformatfotografering og til 8 x 10 tommer print. Både klæder interiør og portrætter, hvor du gerne vil have et lille pusterum uden det stærke vandrette træk i et bredt format.

Widescreen, 16:9

16:9 er standardforholdet for tv og onlinevideo; YouTube's hjælpecenter beskriver det som standardformatforholdet på en computer. Dens brede ramme passer til landskaber, bybilleder, biler i bevægelse og filmiske scener med et motiv placeret til den ene side. Det er et stærkt valg til bannere, præsentationsdias og videominiaturebilleder. Den er svagere for enkeltstående figurer, som ender små i en bred ramme.

Lodret, 9:16

9:16 er den samme form vendt på siden: hele skærmen på en telefon holdt oprejst. Midjourney's dokumentation beskriver det som almindeligt for mobilindhold på sociale medier, og YouTube bemærker, at vertikale 9:16-videoer kan vises med polstring på computerskærme. Den passer til stående figurer, høj arkitektur, vandfald og alt med en stærk lodret linje. Komponer til det bevidst; en horisontal scene klemt ind i 9:16 mister normalt sit motiv til tom himmel og gulv.

Hvordan kompositionen ændres med rammen

En bredere ramme giver mere plads til indstilling og tredjedelsreglen, med motivet off-centreret og plads til øjet at rejse. En højere ramme understreger højden og inviterer til lagdeling fra forgrund til baggrund. Nævn placeringen i prompten: "bilen i højre tredjedel af rammen, den tomme vej, der fører ind fra venstre" lyder meget forskelligt i 16:9 og i 1:1. Når du ændrer forholdet, skal du genlæse kompositionssætningerne og justere dem.

Indstilling af forholdet i Midjourney

Midjourney's dokumentation viser parameteren --ar, eller dens lange form --aspect, tilføjet i slutningen af prompten med et mellemrum før stregerne, for eksempel "stille havn ved daggry --ar 16:9". Tallene skal være hele: Dokumentationen siger, at decimaler ikke accepteres og foreslår 139:100 i stedet for 1,39:1, og en pixelstørrelse såsom 1920:1080 er forenklet til 16:9. Den bemærker også, at nogle forhold ændres lidt ved opskalering, og at ekstremt brede eller høje forhold er eksperimentelle.

Indstilling af størrelsen med OpenAI's billedmodeller

OpenAI's billedgenereringsdokumentation beskriver størrelsen i pixels i stedet for som et forhold. I skrivende stund viser den 1024x1024 som kvadratisk, 1536x1024 som liggende og 1024x1536 som portræt blandt de anbefalede størrelser, med en automatisk mulighed. For sine nyere modeller beskriver den også brugerdefinerede størrelser skrevet som bredde efter højde, hvor begge kanter skal være multipla af 16 og forholdet mellem de lange og korte kanter skal holde sig inden for 3:1. Bemærk, at 1536x1024 i sig selv er en 3:2-form.

Stable Diffusion og andre værktøjer

I Hugging Face diffusers-biblioteket accepterer Stable Diffusion tekst-til-billede-pipelinen højde- og breddeargumenter i pixels. Princippet er det samme overalt: Bestem først formen, og indstil derefter, hvad end værktøjet beder om, pixels eller forhold. Når et værktøj kun tilbyder nogle få størrelser, skal du vælge den tætteste og beskære bagefter, og efterlade margen i sammensætningen, så beskæringen ikke skærer ind i motivet.

Planlæg for mere end ét format

Hvis et billede vil blive brugt flere steder, f.eks. et bredt web-banner og en lodret historie, virker det sjældent at generere ét billede og beskære det begge veje. Enten komponer med generøs tom plads omkring et centralt emne, så begge afgrøder overlever, eller generer hvert format separat fra den samme prompt med kompositionssætningerne tilpasset. Den anden mulighed giver normalt bedre resultater og koster kun lidt mere tid.

En hurtig måde at vælge på

Spørg, hvor billedet vil blive set, og hvilken form motivet har. Et enkelt objekt eller en centreret symmetrisk scene passer til en firkant. Et fotografi, der skal føles som et fotografi, passer til 3:2 eller 2:3. Et bredt landskab eller en videoramme passer til 16:9. Et telefonbillede i fuld skærm eller et højt motiv passer til 9:16. Når intet peger klart den ene vej, er 3:2 et sikkert fotografisk udgangspunkt, der beskærer godt til andre former.

Hvor LarpGPT passer

LarpGPT er et bibliotek med fotoprompts til rejser, arkitektur, biler og livsstilsscener, med komposition skrevet i hver prompt sammen med emne, belysning og linse. Du kopierer en prompt, tilpasser dens indramning til det forhold, du har brug for, og indstiller dette forhold i den billedgenerator, du allerede bruger. LarpGPT genererer ikke billeder, og resultaterne varierer mellem forsøgene.

Spørgsmål

Hvad er det bedste billedformat for AI-billeder?

Det afhænger af, hvor billedet vil blive set, og motivets form. 3:2 er en naturlig fotografisk standard, 16:9 passer til brede scener og video, 9:16 passer til fuldskærms-telefonbilleder og 1:1 passer til enkeltcentrerede motiver.

Hvordan ændrer jeg billedformatet i Midjourney?

Tilføj --ar efterfulgt af to hele tal i slutningen af prompten, for eksempel --ar 3:2, ifølge Midjourney's dokumentation. Decimaler accepteres ikke, og standarden er en firkant.

Hvilke størrelser understøtter OpenAI's billedmodeller?

I skrivende stund oplister OpenAIs dokumentation 1024x1024, 1536x1024 og 1024x1536 blandt de anbefalede størrelser, plus en automatisk mulighed, og beskriver tilpassede størrelser til nyere modeller inden for fastsatte grænser.

Kan jeg beskære et AI-billede til et andet forhold senere?

Det kan du, men en komposition lavet til én form mister ofte sit motiv i en anden. Efterlad plads omkring et centralt emne, eller generer hvert format separat med kompositionssætningerne tilpasset.

Yderligere læsning

Alle apps