LarpGPT · Ghiduri
Raport de aspect pentru imaginile AI: cum să le alegeți și să le setați
Pătrat, 3:2, 16:9 sau vertical 9:16: cum să alegeți un raport de aspect pentru o imagine AI, cum se modifică compoziția odată cu aceasta și cum îl setează Midjourney și OpenAI.

În acest ghid14
De ce raportul este pe primul loc
Raportul de aspect este relația dintre lățimea și înălțimea unei imagini, scrisă ca două numere, cum ar fi 3:2 sau 16:9. Este prima decizie pe care o ia un fotograf, pentru că ea decide ce poate ține cadrul. În generarea imaginii contează și mai mult: modelul compune întreaga scenă pentru cadrul pe care i-o dai, așa că schimbarea raportului ulterior înseamnă decuparea sau regenerarea. Alegeți-l înainte de a rafina restul promptului.
Raportul nu este rezoluție
Un raport nu spune nimic despre numărul de pixeli. Documentația lui Midjourney subliniază direct acest punct: raportul de aspect nu este același cu dimensiunile imaginii, iar dimensiunea finală depinde de versiune și de upscaler. O imagine 3:2 poate fi mică sau mare. Decideți forma de unde va fi văzută imaginea și cum ar trebui să stea subiectul în ea, apoi tratați rezoluția ca o întrebare separată.
Pătrat, 1:1
Pătratul este echilibrat și static, fără direcție dominantă. Se potrivește cu obiecte unice, compoziții simetrice și subiecte centrate și este cadrul pe care multe platforme sociale l-au folosit mult timp pentru postări și imagini de profil. Este, de asemenea, implicit în Midjourney, a cărui documentație notează că imaginile încep ca pătrate. Un pătrat este potrivit pentru peisaje și scene de grup, unde subiectul se răspândește în mod natural lateral.
Fotografie clasică, 3:2 și 2:3
3:2 este raportul tradițional al fotografiei statice, moștenit de la filmul de 35 mm și multe camere încă îl folosesc. Se simte natural pentru un prompt fotografic, deoarece este forma pe care oamenii o asociază cu fotografiile. Orizontal 3:2 se potrivește străzilor, interioarelor și peisajelor; verticala 2:3 se potrivește portretelor, ușilor și clădirilor înalte, iar documentația Midjourney îl menționează ca fiind obișnuit în fotografiile tipărite și ramele de fotografii.
4:3 și 5:4
4:3 a fost raportul original de televiziune și este încă folosit de multe tablete și de majoritatea camerelor digitale compacte. Este puțin mai pătrat decât 3:2, ceea ce lasă mai mult spațiu deasupra și sub subiect. 5:4 este din nou mai pătrat și este obișnuit în fotografia de format mare și mediu și pentru printuri de 8 pe 10 inchi. Se potrivesc atât interioarelor, cât și portretelor în care îți dorești puțin spațiu de respirație, fără tracțiunea orizontală puternică a unui format mare.
Ecran lat, 16:9
16:9 este raportul standard pentru televiziune și video online; Centrul de ajutor al lui YouTube îl descrie ca fiind raportul de aspect standard pe un computer. Cadrul său larg se potrivește peisajelor, peisajelor urbane, mașinilor în mișcare și scenelor cinematografice cu un subiect plasat într-o parte. Este o alegere puternică pentru bannere, diapozitive de prezentare și miniaturi video. Este mai slab pentru figurile singure în picioare, care ajung să fie mici într-un cadru larg.
Verticală, 9:16
9:16 este aceeași formă întoarsă pe o parte: ecranul complet al unui telefon ținut vertical. Documentația lui Midjourney îl descrie ca fiind comun pentru conținutul mobil de pe rețelele sociale, iar YouTube observă că videoclipurile verticale 9:16 pot fi afișate cu umplutură pe ecranele computerului. Se potrivește figurilor în picioare, arhitecturii înalte, cascadelor și orice cu o linie verticală puternică. Compune pentru el în mod deliberat; o scenă orizontală strânsă în 9:16 își pierde de obicei subiectul în cerul și podeaua goale.
Cum se schimbă compoziția odată cu cadrul
Un cadru mai larg oferă mai mult spațiu pentru setări și pentru regula treimii, subiectul fiind decentrat și spațiu pentru că ochiul poate călători. Un cadru mai înalt subliniază înălțimea și invită stratificarea din prim-plan în fundal. Menționați plasarea în promptul: „mașina în treimea dreaptă a cadrului, drumul gol care duce din stânga” se citește foarte diferit în 16:9 și în 1:1. Când schimbați raportul, recitiți propozițiile de compunere și ajustați-le.
Setarea raportului în Midjourney
Documentația lui Midjourney listează parametrul --ar sau forma sa lungă --aspect, adăugată la sfârșitul promptului cu un spațiu înaintea liniuțelor, de exemplu „port liniștit în zori --ar 16:9”. Numerele trebuie să fie întregi: documentația spune că zecimale nu sunt acceptate și sugerează 139:100 în loc de 1,39:1, iar o dimensiune a pixelilor precum 1920:1080 este simplificată la 16:9. De asemenea, menționează că unele rapoarte se modifică ușor la creșterea dimensiunii și că rapoartele extrem de largi sau înalte sunt experimentale.
Setarea dimensiunii cu modelele de imagine OpenAI
Documentația de generare a imaginii OpenAI descrie dimensiunea în pixeli, mai degrabă decât ca raport. La momentul scrierii, listează 1024x1024 ca pătrat, 1536x1024 ca peisaj și 1024x1536 ca portret printre dimensiunile recomandate, cu opțiune automată. Pentru modelele sale mai noi, descrie, de asemenea, dimensiuni personalizate scrise ca lățime cu înălțime, unde ambele margini trebuie să fie multipli de 16 și raportul dintre marginile lungi și scurte trebuie să rămână în 3:1. Rețineți că 1536x1024 este în sine o formă de 3:2.
Stable Diffusion și alte instrumente
În biblioteca Hugging Face diffusers, conducta text-to-image Stable Diffusion acceptă argumente de înălțime și lățime în pixeli. Principiul este același peste tot: decideți mai întâi forma, apoi setați orice cere instrumentul, pixeli sau raport. Când un instrument oferă doar câteva dimensiuni, alegeți-o pe cea mai apropiată și decupați-o după aceea, lăsând o marjă în compoziție, astfel încât trunchiul să nu se taie în subiect.
Planificați mai mult de un format
Dacă o imagine va fi folosită în mai multe locuri, să zicem un banner web larg și o poveste verticală, generând o imagine și decupând-o în ambele sensuri rareori funcționează. Fie compuneți cu un spațiu liber generos în jurul unui subiect central, astfel încât ambele culturi să supraviețuiască, fie generați fiecare format separat din același prompt, cu propozițiile de compoziție adaptate. A doua opțiune dă de obicei rezultate mai bune și costă doar puțin mai mult timp.
O modalitate rapidă de a alege
Întrebați unde va fi văzută imaginea și ce formă are subiectul. Un singur obiect sau o scenă simetrică centrată se potrivește unui pătrat. O fotografie menită să se simtă ca o fotografie se potrivește cu 3:2 sau 2:3. Un peisaj larg sau un cadru video se potrivește cu 16:9. O imagine de telefon pe ecran complet sau un subiect înalt se potrivește la 9:16. Când nimic nu indică clar într-o direcție, 3:2 este un punct de pornire fotografic sigur, care se decupează bine în alte forme.
Unde se potrivește LarpGPT
LarpGPT este o bibliotecă de mesaje foto pentru călătorii, arhitectură, mașini și scene de stil de viață, cu compoziție scrisă în fiecare prompt împreună cu subiectul, iluminarea și obiectivul. Copiați un prompt, îi adaptați încadrarea la raportul de care aveți nevoie și setați acel raport în generatorul de imagini pe care îl utilizați deja. LarpGPT nu generează imagini, iar rezultatele variază între încercări.
Întrebări
Care este cel mai bun raport de aspect pentru imaginile AI?
Depinde de unde va fi văzută imaginea și de forma subiectului. 3:2 este o valoare fotografică implicită naturală, 16:9 se potrivește scenelor largi și videoclipurilor, 9:16 se potrivește imaginilor de pe telefon pe ecran complet și 1:1 se potrivește subiectelor centrate unic.
Cum schimb raportul de aspect în Midjourney?
Adăugați --ar urmat de două numere întregi la sfârșitul promptului, de exemplu --ar 3:2, conform documentației Midjourney. Nu sunt acceptate zecimale, iar valoarea implicită este un pătrat.
Ce dimensiuni acceptă modelele de imagine ale lui OpenAI?
La momentul scrierii, documentația OpenAI listează 1024x1024, 1536x1024 și 1024x1536 printre dimensiunile recomandate, plus o opțiune automată și descrie dimensiuni personalizate pentru modele mai noi în limitele stabilite.
Pot decupa o imagine AI la un alt raport mai târziu?
Poți, dar o compoziție făcută pentru o formă își pierde adesea subiectul în alta. Lăsați spațiu în jurul unui subiect central sau generați fiecare format separat, cu propozițiile de compoziție adaptate.
