LarpGPT
Українська
← До застосунку

LarpGPT · Посібники

Співвідношення сторін для зображень AI: як їх вибрати та встановити

Квадрат, 3:2, 16:9 або вертикальний 9:16: як вибрати співвідношення сторін для зображення зі штучним інтелектом, як композиція змінюється разом із ним і як його встановлюють Midjourney і OpenAI.

LarpGPT — Ваша наступна світлина
LarpGPT · Ваша наступна світлина
У цьому посібнику14

Чому співвідношення стоїть на першому місці

Співвідношення сторін — це співвідношення між шириною та висотою зображення, записане двома числами, наприклад 3:2 або 16:9. Це перше рішення, яке приймає фотограф, оскільки воно вирішує, що зможе вмістити кадр. У створенні зображень це має ще більше значення: модель компонує всю сцену для кадру, який ви їй надаєте, тому зміна співвідношення згодом означає обрізання або регенерацію. Виберіть його, перш ніж уточнювати решту підказки.

Співвідношення не є роздільною здатністю

Співвідношення нічого не говорить про кількість пікселів. У документації Midjourney це прямо зазначено: співвідношення сторін не те саме, що розміри зображення, а кінцевий розмір залежить від версії та програми масштабування. Зображення 3:2 може бути маленьким або великим. Визначте форму, звідки буде видно зображення, і як об’єкт має сидіти на ньому, а потім розберіться з роздільною здатністю як окремим питанням.

Квадрат, 1:1

Квадрат врівноважений і статичний, без домінуючого напрямку. Він підходить для окремих об’єктів, симетричних композицій і центрованих об’єктів, і це рамка, яку багато соціальних платформ давно використовують для публікацій і зображень профілів. Це також стандартно в Midjourney, документація якого зазначає, що зображення починаються як квадрати. Квадрат погано підходить для пейзажів і групових сцен, де об’єкт природно розповсюджується вбік.

Класичне фото, 3:2 і 2:3

3:2 — це традиційне співвідношення фотографій, успадковане від 35-мм плівки, і багато фотоапаратів досі використовують його. Це природно для фотографічної підказки, оскільки це форма, яку люди асоціюють із фотографіями. Горизонтальний 3:2 підходить для вулиць, інтер'єрів і пейзажів; вертикальний формат 2:3 підходить для портретів, дверних прорізів і високих будівель, і в документації Midjourney згадується, що він поширений у друкованих фотографіях і рамах для картин.

4:3 і 5:4

4:3 було оригінальним телевізійним співвідношенням і досі використовується багатьма планшетами та більшістю компактних цифрових камер. Це трохи квадратніше, ніж 3:2, що залишає більше місця над і під об’єктом. 5:4 знову більш квадратний і поширений у фотографіях великого та середнього формату та для відбитків 8 на 10 дюймів. Обидва підходять для інтер’єрів і портретів, де потрібно трохи передихнути без сильного горизонтального натягу широкого формату.

Широкоформатний, 16:9

16:9 — стандартне співвідношення для телебачення та онлайн-відео; Довідковий центр YouTube описує це як стандартне співвідношення сторін на комп’ютері. Його широка рамка підходить для пейзажів, міських пейзажів, автомобілів у русі та кінематографічних сцен із об’єктом, розміщеним осторонь. Це вагомий вибір для банерів, слайдів презентацій і мініатюр відео. Він слабший для одиночних стоячих фігур, які закінчуються маленькими в широкій рамі.

По вертикалі 9:16

9:16 — це та сама фігура, перевернута на бік: повний екран телефону, який стоїть у вертикальному положенні. Документація Midjourney описує це як звичайне для мобільного вмісту в соціальних мережах, а YouTube зазначає, що вертикальні відео 9:16 можна показувати з відступами на екранах комп’ютерів. Він підходить для стоячих фігур, високих архітектурних споруд, водоспадів і всього, що має чітку вертикальну лінію. Створюйте для нього свідомо; горизонтальна сцена, втиснута до 9:16, зазвичай втрачає об’єкт через порожнє небо та підлогу.

Як композиція змінюється разом із кадром

Ширша рамка дає більше простору для облаштування та дотримується правила третин, коли об’єкт зйомки знаходиться поза центром і має простір для огляду. Більш висока рамка підкреслює висоту та заохочує до багатошаровості від переднього плану до фону. Згадайте розташування в підказці: «автомобіль у правій третині кадру, порожня дорога, що веде зліва» читається дуже по-різному в 16:9 і в 1:1. Змінивши співвідношення, перечитайте складені речення та відкоригуйте їх.

Встановлення співвідношення в Midjourney

У документації Midjourney перелічено параметр --ar або його довгу форму --aspect, додану в кінці підказки з пробілом перед тире, наприклад «тиха гавань на світанку --ar 16:9». Числа мають бути цілими: у документації сказано, що десяткові знаки не приймаються, і пропонується 139:100 замість 1,39:1, а розмір пікселів, наприклад 1920:1080, спрощено до 16:9. У ньому також зазначається, що деякі співвідношення дещо змінюються під час масштабування та що надзвичайно широкі чи високі співвідношення є експериментальними.

Встановлення розміру за моделями зображень OpenAI

Документація щодо створення зображень OpenAI описує розмір у пікселях, а не як співвідношення. На момент написання в ньому серед рекомендованих розмірів вказано 1024x1024 як квадрат, 1536x1024 як пейзаж і 1024x1536 як портрет із автоматичною опцією. Для нових моделей він також описує спеціальні розміри, записані як ширина на висоту, де обидва краї мають бути кратними 16, а співвідношення між довгими та короткими краями має залишатися в межах 3:1. Зверніть увагу, що 1536x1024 сама по собі є формою 3:2.

Stable Diffusion та інші інструменти

У бібліотеці Hugging Face diffusers конвеєр перетворення тексту в зображення Stable Diffusion приймає аргументи висоти та ширини в пікселях. Принцип скрізь однаковий: спочатку визначте форму, а потім встановіть будь-які параметри інструмента: пікселі чи співвідношення. Якщо інструмент пропонує лише кілька розмірів, виберіть найближчий і обріжте потім, залишивши поле в композиції, щоб кадрування не врізалося в об’єкт.

Плануйте більше ніж один формат

Якщо зображення використовуватиметься в кількох місцях, скажімо, широкий веб-банер і вертикальна історія, генерація одного зображення та обрізання його в обох напрямках рідко працює. Або створіть щедрий порожній простір навколо центральної теми, щоб обидва кадри вижили, або створіть кожен формат окремо з того самого підказки з адаптованими композиційними реченнями. Другий варіант зазвичай дає кращі результати і вимагає лише трохи більше часу.

Швидкий спосіб вибору

Запитайте, де буде видно зображення і яку форму має предмет. Для квадрата підходить окремий об’єкт або симетрична сцена по центру. Фотографія, створена для того, щоб відчути, що фотографія підходить у форматі 3:2 або 2:3. Широкий пейзаж або відеокадр підходить 16:9. Повноекранне зображення телефону або високого об’єкта підходить для 9:16. Коли ніщо не вказує чітко в один бік, 3:2 є безпечною відправною точкою для фотографії, яка добре обрізає інші форми.

Куди підходить LarpGPT

LarpGPT — це бібліотека фото-підказок для подорожей, архітектури, автомобілів і способу життя, із композицією, вписаною в кожну підказку разом із об’єктом, освітленням і об’єктивом. Ви копіюєте підказку, адаптуєте її рамку до потрібного вам співвідношення та встановлюєте це співвідношення в генераторі зображень, який ви вже використовуєте. LarpGPT не створює зображень, і результати різняться між спробами.

Запитання

Яке найкраще співвідношення сторін для зображень AI?

Це залежить від того, де буде видно зображення, і форми об’єкта. 3:2 є природним фотозйомкою за замовчуванням, 16:9 підходить для широких сцен і відео, 9:16 підходить для повноекранних зображень телефону, а 1:1 підходить для об’єктів з одним центром.

Як змінити співвідношення сторін у Midjourney?

Додайте --ar, а потім два цілих числа в кінці підказки, наприклад --ar 3:2, згідно з документацією Midjourney. Десяткові знаки не приймаються, за умовчанням використовується квадрат.

Які розміри підтримують моделі зображень OpenAI?

На момент написання документа документація OpenAI перелічує 1024x1024, 1536x1024 і 1024x1536 серед рекомендованих розмірів, а також автоматичну опцію, а також описує спеціальні розміри для нових моделей у встановлених обмеженнях.

Чи можу я пізніше обрізати зображення AI в іншому форматі?

Можна, але композиція, зроблена для однієї форми, часто втрачає предмет в іншій. Залиште місце навколо центральної теми або створіть кожен формат окремо з адаптованими складовими реченнями.

Додаткові матеріали

Усі застосунки