LarpGPT
Русский
← Назад к приложению

LarpGPT · Руководства

Соотношения сторон для AI-изображений: как их выбрать и настроить

Квадрат, 3:2, 16:9 или вертикаль 9:16: как выбрать соотношение сторон для AI-изображения, как при этом меняется композиция и как его устанавливают Midjourney и OpenAI.

LarpGPT — Ваше следующее изображение
LarpGPT · Ваше следующее изображение
В этом руководстве14

Почему соотношение на первом месте

Соотношение сторон — это соотношение между шириной и высотой изображения, записанное двумя числами, например 3:2 или 16:9. Это первое решение, которое принимает фотограф, потому что он решает, что может удерживать кадр. При создании изображения это имеет еще большее значение: модель компонует всю сцену для кадра, который вы ей даете, поэтому последующее изменение соотношения означает обрезку или регенерацию. Выберите его, прежде чем уточнять остальную часть подсказки.

Соотношение – это не разрешение

Соотношение ничего не говорит о количестве пикселей. В документации Midjourney это прямо указано: соотношение сторон не совпадает с размерами изображения, а окончательный размер зависит от версии и масштабирования. Изображение формата 3:2 может быть маленьким или большим. Определите форму, откуда будет видно изображение и как в нем должен располагаться объект, а затем отнеситесь к разрешению как к отдельному вопросу.

Квадрат, 1:1

Квадрат сбалансирован и статичен, без доминирующего направления. Он подходит для отдельных объектов, симметричных композиций и центрированных предметов, а также является рамкой, которую многие социальные платформы уже давно используют для публикаций и изображений профилей. Это также значение по умолчанию в Midjourney, в документации которого отмечается, что изображения начинаются с квадратов. Квадрат плохо подходит для пейзажей и групповых сцен, где объект естественно растекается вбок.

Классическое фото, 3:2 и 2:3

3:2 — это традиционное соотношение фотосъемки, унаследованное от 35-мм пленки, и многие камеры до сих пор используют его. Это кажется естественным для фотографической подсказки, потому что именно эта форма ассоциируется у людей с фотографиями. Горизонтальное соотношение 3:2 подходит для улиц, интерьеров и пейзажей; Вертикальный формат 2:3 подходит для портретов, дверных проемов и высоких зданий, а в документации Midjourney он упоминается как распространенный в печатных фотографиях и рамах для фотографий.

4:3 и 5:4

4:3 было первоначальным телевизионным соотношением и до сих пор используется во многих планшетах и большинстве компактных цифровых камер. Он немного квадратнее, чем 3:2, что оставляет больше места над и под объектом. Формат 5:4 снова более квадратный и часто используется в фотографиях большого и среднего формата, а также для отпечатков размером 8 на 10 дюймов. Оба подходят для интерьеров и портретов, где вам нужна небольшая передышка без сильного горизонтального притяжения широкого формата.

Широкоэкранный, 16:9

16:9 — стандартное соотношение для телевидения и онлайн-видео; В справочном центре YouTube это описано как стандартное соотношение сторон на компьютере. Его широкая рамка подходит для пейзажей, городских пейзажей, движущихся автомобилей и кинематографических сцен, в которых объект расположен сбоку. Это отличный выбор для баннеров, слайдов презентаций и миниатюр видео. Он слабее для одиночных стоящих фигур, которые в широкой рамке оказываются маленькими.

Вертикально, 9:16

9:16 — та же фигура, перевернутая набок: полный экран телефона в вертикальном положении. В документации Midjourney описано, что это обычное явление для мобильного контента в социальных сетях, а YouTube отмечает, что вертикальные видеоролики с соотношением сторон 9:16 могут отображаться с отступами на экранах компьютеров. Он подходит для стоящих фигур, высоких архитектурных сооружений, водопадов и всего, что имеет четкую вертикальную линию. Сочиняйте для этого сознательно; горизонтальная сцена, сжатая в 9:16, обычно теряет объект из-за пустого неба и пола.

Как меняется композиция вместе с кадром

Более широкая рамка дает больше места для настройки и соблюдения правила третей, при этом объект смещен от центра и дает пространство для движения глаз. Более высокая рамка подчеркивает высоту и позволяет перемещаться от переднего плана к заднему. Упомяните размещение в подсказке: «машина в правой трети кадра, пустая дорога, ведущая слева» читается совсем по-разному в 16:9 и в 1:1. При изменении соотношения перечитайте составные предложения и скорректируйте их.

Установка соотношения в Midjourney

В документации Midjourney указан параметр --ar или его полная форма --aspect, добавленный в конце приглашения с пробелом перед тире, например «тихая гавань на рассвете --ar 16:9». Числа должны быть целыми: в документации указано, что десятичные дроби не принимаются, и предлагается 139:100 вместо 1,39:1, а размер пикселя, например 1920:1080, упрощается до 16:9. Он также отмечает, что некоторые соотношения незначительно изменяются при масштабировании и что чрезвычайно широкие или высокие соотношения являются экспериментальными.

Установка размера с помощью моделей изображений OpenAI

В документации по созданию изображений OpenAI размер описывается в пикселях, а не в соотношении. На момент написания среди рекомендуемых размеров указано 1024x1024 как квадратное, 1536x1024 как альбомное и 1024x1536 как книжное с автоматической опцией. Для своих новых моделей он также описывает нестандартные размеры, записанные как ширина по высоте, где оба края должны быть кратны 16, а соотношение между длинными и короткими краями должно оставаться в пределах 3:1. Обратите внимание, что 1536x1024 само по себе является формой 3:2.

Stable Diffusion и другие инструменты

В библиотеке Hugging Face diffusers конвейер преобразования текста в изображение Stable Diffusion принимает аргументы высоты и ширины в пикселях. Принцип везде один и тот же: сначала определитесь с формой, затем установите то, что запрашивает инструмент, пиксели или соотношение. Если инструмент предлагает только несколько размеров, выберите ближайший и затем обрежьте его, оставив поле в композиции, чтобы кадрирование не врезалось в объект.

Планируйте более одного формата

Если изображение будет использоваться в нескольких местах, скажем, в широком веб-баннере и вертикальной истории, создание одного изображения и обрезка его в обоих направлениях редко сработают. Либо сочиняйте с большим пустым пространством вокруг центрального предмета, чтобы обе культуры сохранились, либо создавайте каждый формат отдельно из одной и той же подсказки с адаптированными предложениями-сочинениями. Второй вариант обычно дает лучшие результаты и требует лишь немного больше времени.

Быстрый способ выбора

Спросите, где будет видно изображение и какую форму имеет предмет. Одиночный объект или симметричная сцена по центру подходят для квадрата. Фотография, которая должна ощущаться как фотография, подходит для формата 3:2 или 2:3. Широкий пейзаж или видеокадр подходят для формата 16:9. Полноэкранное изображение телефона или высокий объект подойдет для 9:16. Когда ничто не указывает четко в одну сторону, 3:2 является безопасной отправной точкой для фотографии, которая хорошо кадрируется с другими формами.

Где подходит LarpGPT

LarpGPT — это библиотека фотоподсказок для сцен из путешествий, архитектуры, автомобилей и образа жизни, в каждой подсказке написана композиция, а также объект, освещение и объектив. Вы копируете подсказку, адаптируете ее кадр к нужному вам соотношению и устанавливаете это соотношение в уже используемом генераторе изображений. LarpGPT не генерирует изображения, и результаты различаются в зависимости от попытки.

Вопросы

Какое соотношение сторон является лучшим для изображений AI?

Это зависит от того, где будет видно изображение, и от формы объекта. 3:2 — это естественное фотографическое значение по умолчанию, 16:9 подходит для широких сцен и видео, 9:16 — для полноэкранных изображений телефона, а 1:1 — для объектов с одним центром.

Как изменить соотношение сторон в Midjourney?

Добавьте --ar, а затем два целых числа в конце приглашения, например --ar 3:2, согласно документации Midjourney. Десятичные дроби не принимаются, по умолчанию используется квадрат.

Какие размеры поддерживают модели изображений OpenAI?

На момент написания в документации OpenAI среди рекомендуемых размеров указаны 1024x1024, 1536x1024 и 1024x1536, а также автоматический вариант, а также описаны нестандартные размеры для новых моделей в установленных пределах.

Могу ли я позже обрезать изображение AI до другого соотношения?

Можно, но композиция, созданная для одной формы, часто теряет свой сюжет в другой. Оставьте пространство вокруг центрального предмета или создайте каждый формат отдельно с адаптированными составными предложениями.

Дополнительно

Все приложения