LarpGPT · Ръководства
Съотношения на страните за AI изображения: как да ги изберете и зададете
Квадрат, 3:2, 16:9 или вертикално 9:16: как да изберете съотношение на страните за AI изображение, как композицията се променя с него и как Midjourney и OpenAI го задават.

В това ръководство14
Защо съотношението е на първо място
Съотношението на страните е връзката между ширината и височината на изображението, записана като две числа като 3:2 или 16:9. Това е първото решение, което взема фотографът, защото решава какво може да побере рамката. При генерирането на изображения има още по-голямо значение: моделът композира цялата сцена за рамката, която му давате, така че промяната на съотношението след това означава изрязване или регенериране. Изберете го, преди да прецизирате останалата част от подканата.
Съотношението не е резолюция
Съотношението не казва нищо за броя на пикселите. Документацията на Midjourney посочва директно това: съотношението на страните не е същото като размерите на изображението и крайният размер зависи от версията и инструмента за увеличаване на мащаба. Изображение 3:2 може да бъде малко или голямо. Решете формата, откъдето ще се вижда изображението и как обектът трябва да седи в него, след което разгледайте разделителната способност като отделен въпрос.
Квадрат, 1:1
Квадратът е балансиран и статичен, без доминираща посока. Подхожда на единични обекти, симетрични композиции и центрирани обекти и е рамката, която много социални платформи отдавна използват за публикации и профилни изображения. Също така е по подразбиране в Midjourney, чиято документация отбелязва, че изображенията започват като квадрати. Квадратът не е подходящ за пейзажи и групови сцени, където обектът естествено се разпространява настрани.
Класическа снимка, 3:2 и 2:3
3:2 е традиционното съотношение за неподвижна фотография, наследено от 35 mm филм, и много фотоапарати все още го използват. Чувства се естествено за фотографска подкана, защото това е формата, която хората свързват със снимките. Хоризонталното 3:2 подхожда на улици, интериори и пейзажи; вертикално 2:3 подхожда на портрети, врати и високи сгради, а документацията на Midjourney го споменава като често срещано при печатни фотографии и рамки за картини.
4:3 и 5:4
4:3 беше оригиналното телевизионно съотношение и все още се използва от много таблети и от повечето компактни цифрови фотоапарати. Той е малко по-квадратен от 3:2, което оставя повече място над и под обекта. 5:4 отново е по-квадратен и е често срещан при широкоформатни и средноформатни снимки и за разпечатки с размери 8 на 10 инча. И двете подхождат на интериори и портрети, където искате малко място за дишане без силното хоризонтално привличане на широк формат.
Широк екран, 16:9
16:9 е стандартното съотношение за телевизия и онлайн видео; Помощният център на YouTube го описва като стандартното съотношение на страните на компютър. Широката му рамка е подходяща за пейзажи, градски пейзажи, автомобили в движение и кинематографични сцени с обект, поставен настрани. Това е силен избор за банери, презентационни слайдове и видео миниатюри. По-слаба е за единични изправени фигури, които завършват малки в широка рамка.
Вертикално, 9:16
9:16 е същата форма, обърната настрани: целият екран на телефон, държан изправен. Документацията на Midjourney го описва като обичайно за мобилно съдържание в социалните медии, а YouTube отбелязва, че вертикални видеоклипове 9:16 могат да се показват с подложка на компютърни екрани. Подхожда на изправени фигури, висока архитектура, водопади и всичко със силна вертикална линия. Композирайте за това умишлено; хоризонтална сцена, притисната в 9:16, обикновено губи обекта си заради празно небе и под.
Как композицията се променя с рамката
По-широката рамка дава повече място за настройка и правилото на третините, като обектът е извън центъра и има пространство за движение на окото. По-високата рамка подчертава височината и приканва към наслояване от преден към заден план. Споменете разположението в подканата: „колата в дясната третина на кадъра, празният път, водещ отляво“ се чете много различно в 16:9 и в 1:1. Когато промените съотношението, прочетете отново композиционните изречения и ги коригирайте.
Задаване на съотношението в Midjourney
Документацията на Midjourney изброява параметър --ar или неговата дълга форма --aspect, добавен в края на подканата с интервал преди тиретата, например "тихо пристанище на разсъмване --ar 16:9". Числата трябва да са цели: документацията казва, че десетичните знаци не се приемат и предлага 139:100 вместо 1,39:1, а размерът на пиксела като 1920:1080 е опростен до 16:9. Той също така отбелязва, че някои съотношения се променят леко при мащабиране и че изключително широките или високите съотношения са експериментални.
Задаване на размера с модели на изображения на OpenAI
Документацията за генериране на изображения на OpenAI описва размера в пиксели, а не като съотношение. Към момента на писане той изброява 1024x1024 като квадрат, 1536x1024 като пейзаж и 1024x1536 като портрет сред препоръчителните размери, с автоматична опция. За по-новите си модели той също така описва потребителски размери, написани като ширина по височина, където и двата ръба трябва да са кратни на 16, а съотношението между дългите и късите ръбове трябва да остане в рамките на 3:1. Имайте предвид, че 1536x1024 сама по себе си е форма 3:2.
Stable Diffusion и други инструменти
В Hugging Face diffusers библиотеката Stable Diffusion конвейерът за текст към изображение приема аргументи за височина и ширина в пиксели. Принципът е един и същ навсякъде: първо решете формата, след това задайте каквото поиска инструментът, пиксели или съотношение. Когато даден инструмент предлага само няколко размера, изберете най-близкия и изрежете след това, оставяйки поле в композицията, така че изрязването да не се врязва в обекта.
Планирайте повече от един формат
Ако едно изображение ще се използва на няколко места, например широк уеб банер и вертикална история, генерирането на едно изображение и изрязването му в двете посоки рядко работи. Или композирайте с голямо празно пространство около централен обект, така че и двете култури да оцелеят, или генерирайте всеки формат поотделно от една и съща подкана с адаптирани изречения за композиция. Вторият вариант обикновено дава по-добри резултати и струва само малко повече време.
Бърз начин за избор
Попитайте къде ще се види изображението и каква форма има обектът. Единичен обект или центрирана симетрична сцена подхожда на квадрат. Снимка, предназначена да се чувства като снимка, подхожда на 3:2 или 2:3. Широк пейзаж или видео рамка подхожда на 16:9. Телефонно изображение на цял екран или висок обект отговаря на 9:16. Когато нищо не сочи ясно в една посока, 3:2 е безопасна фотографска начална точка, която се изрязва добре в други форми.
Където LarpGPT пасва
LarpGPT е библиотека от подсказки за снимки за сцени с пътуване, архитектура, автомобили и начин на живот, с композиция, написана във всяка подкана заедно с обект, осветление и обектив. Копирате подкана, адаптирате нейното рамкиране към съотношението, от което се нуждаете, и задавате това съотношение в генератора на изображения, който вече използвате. LarpGPT не генерира изображения и резултатите варират между опитите.
Въпроси
Какво е най-доброто съотношение на страните за AI изображения?
Зависи от това къде ще се види изображението и формата на обекта. 3:2 е естествена фотографска настройка по подразбиране, 16:9 е подходяща за широки сцени и видео, 9:16 е подходяща за телефонни изображения на цял екран, а 1:1 е подходяща за единично центрирани обекти.
Как да променя пропорцията в Midjourney?
Добавете --ar, последвано от две цели числа в края на подканата, например --ar 3:2, според документацията на Midjourney. Десетичните знаци не се приемат и по подразбиране е квадрат.
Какви размери поддържат моделите на изображения на OpenAI?
Към момента на писане, документацията на OpenAI изброява 1024x1024, 1536x1024 и 1024x1536 сред препоръчаните размери, плюс автоматична опция, и описва персонализирани размери за по-нови модели в рамките на зададени ограничения.
Мога ли по-късно да изрежа AI изображение в друго съотношение?
Можете, но композицията, направена за една форма, често губи обекта си в друга. Оставете място около централна тема или генерирайте всеки формат поотделно с адаптирани съставни изречения.
