LarpGPT
Català
← Torna a l'aplicació

LarpGPT · Guies

Relacions d'aspecte de les imatges d'IA: com triar-les i configurar-les

Quadrat, 3:2, 16:9 o vertical 9:16: com escolliu una relació d'aspecte per a una imatge d'IA, com canvia la composició amb ella i com la defineixen Midjourney i OpenAI.

LarpGPT — La teva següent imatge comença aquí
LarpGPT · La teva següent imatge comença aquí
En aquesta guia14

Per què la proporció és primer

La relació d'aspecte és la relació entre l'amplada i l'alçada d'una imatge, escrita com a dos números, com ara 3:2 o 16:9. És la primera decisió que pren un fotògraf, perquè decideix què pot contenir el marc. En la generació d'imatges és encara més important: el model compon tota l'escena per al fotograma que li doneu, de manera que canviar la proporció després significa retallar o regenerar. Trieu-lo abans de refinar la resta de la sol·licitud.

La proporció no és resolució

Una relació no diu res sobre el nombre de píxels. La documentació de Midjourney fa aquest punt directament: la relació d'aspecte no és la mateixa que les dimensions de la imatge i la mida final depèn de la versió i de l'escalador. Una imatge 3:2 pot ser petita o gran. Decidiu la forma des d'on es veurà la imatge i com s'hi hauria d'assentar el subjecte, i després tracta la resolució com una pregunta separada.

Quadrat, 1:1

La plaça és equilibrada i estàtica, sense direcció dominant. S'adapta a objectes individuals, composicions simètriques i temes centrats, i és el marc que moltes plataformes socials han utilitzat durant molt de temps per a publicacions i imatges de perfil. També és el valor predeterminat a Midjourney, la documentació del qual assenyala que les imatges comencen com a quadrats. Un quadrat no és adequat per a paisatges i escenes de grup, on el tema s'estén de manera natural de costat.

Foto clàssica, 3:2 i 2:3

3:2 és la proporció tradicional de la fotografia fixa, heretada de la pel·lícula de 35 mm, i moltes càmeres encara l'utilitzen. Se sent natural per a una indicació fotogràfica perquè és la forma que la gent associa a les fotografies. L'horitzontal 3:2 s'adapta a carrers, interiors i paisatges; La vertical 2:3 s'adapta a retrats, portes i edificis alts, i la documentació de Midjourney l'esmenta com a habitual a la fotografia imprès i als marcs d'imatges.

4:3 i 5:4

4:3 era la proporció de televisió original i encara l'utilitzen moltes tauletes i la majoria de càmeres digitals compactes. És una mica més quadrat que 3:2, la qual cosa deixa més espai per sobre i per sota del tema. El 5:4 torna a ser més quadrat i és habitual en la fotografia de format gran i mitjà i per a impressions de 8 per 10 polzades. Tant s'adapten a interiors com a retrats on voleu una mica de respiració sense la forta empenta horitzontal d'un gran format.

Pantalla panoràmica, 16:9

16:9 és la proporció estàndard per a televisió i vídeo en línia; El centre d'ajuda de YouTube el descriu com la relació d'aspecte estàndard en un ordinador. El seu ampli marc s'adapta a paisatges, paisatges urbans, cotxes en moviment i escenes cinematogràfiques amb un tema col·locat a un costat. És una bona opció per a bàners, diapositives de presentacions i miniatures de vídeo. És més feble per a les figures dempeus, que acaben sent petites en un marc ample.

Vertical, 9:16

9:16 és la mateixa forma girada de costat: la pantalla completa d'un telèfon en posició vertical. La documentació de Midjourney ho descriu com a comú per al contingut mòbil a les xarxes socials, i YouTube assenyala que els vídeos verticals de 9:16 es poden mostrar amb farciment a les pantalles d'ordinador. S'adapta a figures dempeus, arquitectura alta, cascades i qualsevol cosa amb una línia vertical forta. Composa-hi deliberadament; una escena horitzontal comprimida en 9:16 acostuma a perdre el seu tema davant el cel i el terra buits.

Com canvia la composició amb el marc

Un marc més ampli ofereix més espai per a l'ambientació i per a la regla dels terços, amb el subjecte descentrat i l'espai perquè l'ull pugui viatjar. Un marc més alt emfatitza l'alçada i convida a posar capes de primer pla a fons. Esmenta la ubicació a la indicació: "el cotxe al terç dret del quadre, la carretera buida que entra des de l'esquerra" es llegeix de manera molt diferent a 16:9 i a 1:1. Quan canvieu la proporció, rellegiu les frases de composició i ajusteu-les.

Establiment de la proporció a Midjourney

La documentació de Midjourney enumera el paràmetre --ar, o la seva forma llarga --aspect, afegit al final de l'indicador amb un espai abans dels guions, per exemple "port tranquil a l'alba --ar 16:9". Els números han de ser sencers: la documentació diu que no s'accepten decimals i suggereix 139:100 en lloc d'1,39:1, i una mida de píxel com ara 1920:1080 es simplifica a 16:9. També assenyala que algunes proporcions canvien lleugerament en augmentar l'escala i que les proporcions extremadament amples o altes són experimentals.

Configuració de la mida amb els models d'imatge de OpenAI

La documentació de generació d'imatges de OpenAI descriu la mida en píxels més que com a proporció. En el moment d'escriure, enumera 1024x1024 com a quadrat, 1536x1024 com a horitzontal i 1024x1536 com a vertical entre les mides recomanades, amb una opció automàtica. Per als seus models més nous, també descriu mides personalitzades escrites com a amplada per alçada, on les dues vores han de ser múltiples de 16 i la proporció entre les vores llarga i curta ha de romandre dins de 3:1. Tingueu en compte que 1536x1024 és en si mateix una forma de 3:2.

Stable Diffusion i altres eines

A la biblioteca Hugging Face diffusers, la canalització de text a imatge Stable Diffusion accepta arguments d'alçada i amplada en píxels. El principi és el mateix a tot arreu: primer decidiu la forma i, a continuació, configureu el que l'eina demani, píxels o proporció. Quan una eina ofereix només unes quantes mides, trieu la més propera i retalleu-la després, deixant un marge a la composició perquè el retall no talli el tema.

Planifiqueu més d'un format

Si una imatge s'utilitzarà en diversos llocs, per exemple, un bàner web i una història vertical, la generació d'una imatge i el retall de les dues maneres rarament funciona. Composeu amb un espai buit generós al voltant d'un tema central perquè els dos cultius sobrevisquin, o bé genereu cada format per separat a partir del mateix indicador amb les frases de composició adaptades. La segona opció sol donar millors resultats i costa només una mica més de temps.

Una manera ràpida de triar

Pregunta on es veurà la imatge i quina forma té el subjecte. Un únic objecte o una escena simètrica centrada s'adapta a un quadrat. Una fotografia pensada per sentir-se com una fotografia s'adapta a 3:2 o 2:3. Un paisatge ampli o un fotograma de vídeo s'adapta a 16:9. Una imatge de telèfon a pantalla completa o un tema alt s'adapta a les 9:16. Quan res no apunta clarament a una direcció, 3:2 és un punt de partida fotogràfic segur que s'adapta bé a altres formes.

On encaixa LarpGPT

LarpGPT és una biblioteca d'indicacions de fotos per a viatges, arquitectura, cotxes i escenes d'estil de vida, amb una composició escrita a cada indicació juntament amb el tema, la il·luminació i la lent. Copieu una indicació, adapteu el seu marc a la proporció que necessiteu i configureu aquesta proporció al generador d'imatges que ja feu servir. LarpGPT no genera imatges i els resultats varien entre els intents.

Preguntes

Quina és la millor relació d'aspecte per a les imatges d'IA?

Depèn d'on es veurà la imatge i de la forma del subjecte. 3:2 és un valor fotogràfic predeterminat natural, 16:9 s'adapta a escenes i vídeos amples, 9:16 s'adapta a imatges de telèfon a pantalla completa i 1:1 s'adapta a subjectes centrats individualment.

Com puc canviar la relació d'aspecte a Midjourney?

Afegiu --ar seguit de dos nombres sencers al final de la sol·licitud, per exemple --ar 3:2, segons la documentació de Midjourney. No s'accepten decimals i el valor predeterminat és un quadrat.

Quines mides admeten els models d'imatge de OpenAI?

En el moment d'escriure aquest escrit, la documentació de OpenAI enumera 1024x1024, 1536x1024 i 1024x1536 entre les mides recomanades, a més d'una opció automàtica, i descriu mides personalitzades per als models més nous dins dels límits establerts.

Puc retallar una imatge d'IA a una altra proporció més endavant?

Pots, però una composició feta per a una forma sovint perd el seu tema en una altra. Deixa espai al voltant d'un tema central, o genera cada format per separat amb les frases de composició adaptades.

Més lectura

Totes les aplicacions