LarpGPT · Poradniki
Proporcje obrazów AI: jak je wybrać i ustawić
Kwadrat, 3:2, 16:9 lub pion 9:16: jak wybrać współczynnik proporcji obrazu AI, jak zmienia się wraz z nim kompozycja i jak to ustawiają Midjourney i OpenAI.

W tym poradniku14
Dlaczego stosunek jest na pierwszym miejscu
Proporcje obrazu to relacja między szerokością i wysokością obrazu, zapisana jako dwie liczby, np. 3:2 lub 16:9. To pierwsza decyzja, którą podejmuje fotograf, ponieważ decyduje o tym, co zmieści się w ramce. Przy generowaniu obrazu ma to jeszcze większe znaczenie: model komponuje całą scenę dla ramki, którą mu nadasz, więc późniejsza zmiana proporcji oznacza przycięcie lub regenerację. Wybierz tę opcję, zanim doprecyzujesz resztę monitu.
Współczynnik nie jest rozdzielczością
Współczynnik nie mówi nic o liczbie pikseli. Dokumentacja Midjourney wyraźnie to stwierdza: współczynnik proporcji to nie to samo, co wymiary obrazu, a ostateczny rozmiar zależy od wersji i modułu skalowania. Obraz 3:2 może być mały lub duży. Zdecyduj, jaki kształt będzie widoczny obraz i jak powinna w nim siedzieć obiekt, a następnie zajmij się rozdzielczością jako osobną kwestią.
Kwadrat, 1:1
Kwadrat jest zrównoważony i statyczny, bez dominującego kierunku. Pasuje do pojedynczych obiektów, symetrycznych kompozycji i wyśrodkowanych tematów i stanowi ramę, którą wiele platform społecznościowych od dawna wykorzystuje do publikowania postów i zdjęć profilowych. Jest to również ustawienie domyślne w Midjourney, którego dokumentacja odnotowuje, że obrazy zaczynają się od kwadratów. Kwadrat nie nadaje się do krajobrazów i scen grupowych, gdzie obiekt w naturalny sposób rozprzestrzenia się na boki.
Klasyczne zdjęcie, 3:2 i 2:3
3:2 to tradycyjny współczynnik fotografii, odziedziczony po kliszy 35 mm i nadal z niego korzysta wiele aparatów. Wydaje się to naturalne w przypadku podpowiedzi fotograficznej, ponieważ jest to kształt, który ludzie kojarzą z fotografiami. Poziomy 3:2 pasuje do ulic, wnętrz i krajobrazów; pionowo 2:3 pasuje do portretów, drzwi i wysokich budynków, a dokumentacja Midjourney wspomina o tym jako powszechnym w drukowanych fotografiach i ramkach do zdjęć.
4:3 i 5:4
4:3 był pierwotnym współczynnikiem obrazu telewizyjnego i nadal jest używany w wielu tabletach i większości kompaktowych aparatów cyfrowych. Jest nieco bardziej kwadratowy niż 3:2, co pozostawia więcej miejsca nad i pod obiektem. Proporcja 5:4 jest znowu bardziej kwadratowa i jest powszechna w fotografii wielko- i średnioformatowej oraz w przypadku wydruków o wymiarach 8 na 10 cali. Pasują zarówno do wnętrz, jak i do portretów, w których potrzebujesz trochę wytchnienia bez silnego poziomego ciągnięcia szerokiego formatu.
Panoramiczny, 16:9
16:9 to standardowy współczynnik dla telewizji i wideo w Internecie; Centrum pomocy YouTube opisuje go jako standardowy współczynnik proporcji na komputerze. Jego szeroka ramka pasuje do krajobrazów, pejzaży miejskich, samochodów w ruchu i scen filmowych, w których obiekt jest umieszczony z boku. Jest to dobry wybór w przypadku banerów, slajdów prezentacji i miniatur wideo. Jest słabszy w przypadku pojedynczych postaci stojących, które w szerokim kadrze są małe.
Pionowo, 9:16
9:16 to ten sam kształt odwrócony na bok: pełny ekran telefonu trzymanego pionowo. Dokumentacja Midjourney opisuje to jako powszechne w przypadku treści mobilnych w mediach społecznościowych, a YouTube zauważa, że na ekranach komputerów można wyświetlać filmy w formacie 9:16 w formacie pionowym. Pasuje do stojących postaci, wysokiej architektury, wodospadów i wszystkiego, co ma mocną pionową linię. Komponuj dla tego celowo; scena pozioma wciśnięta w 9:16 zwykle traci temat na rzecz pustego nieba i podłogi.
Jak kompozycja zmienia się wraz z kadrem
Szersza ramka zapewnia więcej miejsca na ustawienie i zasadę trójpodziału, a obiekt znajduje się poza centrum i zapewnia swobodę ruchu oka. Wyższa rama podkreśla wysokość i zachęca do nakładania warstw z pierwszego planu na tło. Wspomnij o umieszczeniu w podpowiedzi: „samochód w prawej jednej trzeciej kadru, pusta droga prowadząca z lewej strony” brzmi zupełnie inaczej w 16:9 i 1:1. Kiedy zmienisz proporcje, przeczytaj ponownie zdania składowe i dostosuj je.
Ustawianie proporcji w Midjourney
Dokumentacja Midjourney wymienia parametr --ar lub jego długą formę --aspect, dodany na końcu znaku zachęty ze spacją przed myślnikami, na przykład „cicha przystań o świcie --ar 16:9”. Liczby muszą być całe: dokumentacja mówi, że ułamki dziesiętne nie są akceptowane i sugeruje 139:100 zamiast 1,39:1, a rozmiar piksela, taki jak 1920:1080, jest uproszczony do 16:9. Zauważa również, że niektóre współczynniki zmieniają się nieznacznie podczas skalowania w górę, a bardzo szerokie lub wysokie współczynniki są eksperymentalne.
Ustawianie rozmiaru modeli obrazów OpenAI
Dokumentacja dotycząca generowania obrazu OpenAI opisuje rozmiar w pikselach, a nie jako stosunek. W chwili pisania tego tekstu wśród zalecanych rozmiarów znajdują się 1024x1024 jako kwadrat, 1536x1024 jako krajobraz i 1024x1536 jako portret, z opcją automatyczną. W przypadku nowszych modeli opisuje również niestandardowe rozmiary zapisywane jako szerokość przez wysokość, gdzie obie krawędzie muszą być wielokrotnościami 16, a stosunek między długą i krótką krawędzią musi mieścić się w granicach 3:1. Należy pamiętać, że rozdzielczość 1536 x 1024 sama w sobie ma kształt 3:2.
Stable Diffusion i inne narzędzia
W bibliotece Hugging Face diffusers potok zamiany tekstu na obraz Stable Diffusion akceptuje argumenty wysokości i szerokości w pikselach. Zasada jest wszędzie taka sama: najpierw zdecyduj o kształcie, a następnie ustaw to, o co prosi narzędzie, piksele lub proporcje. Jeśli narzędzie oferuje tylko kilka rozmiarów, wybierz najbliższy i przytnij później, pozostawiając margines w kompozycji, aby kadrowanie nie wcinało się w obiekt.
Zaplanuj więcej niż jeden format
Jeśli obraz będzie używany w kilku miejscach, powiedzmy szeroki baner internetowy i historia pionowa, wygenerowanie jednego obrazu i przycięcie go w obie strony rzadko się sprawdza. Albo komponuj z dużą, pustą przestrzenią wokół centralnego obiektu, aby oba zbiory przetrwały, albo wygeneruj każdy format oddzielnie z tego samego podpowiedzi, z dostosowanymi zdaniami kompozycji. Druga opcja zazwyczaj daje lepsze rezultaty i kosztuje tylko trochę więcej czasu.
Szybki sposób wyboru
Zapytaj, gdzie będzie widoczny obraz i jaki kształt będzie miał obiekt. Pojedynczy obiekt lub wyśrodkowana, symetryczna scena pasuje do kwadratu. Zdjęcie ma sprawiać wrażenie fotografii, która pasuje do proporcji 3:2 lub 2:3. Szeroki krajobraz lub klatka wideo pasują do formatu 16:9. Pełnoekranowy obraz wykonany telefonem lub wysoka osoba pasują do formatu 9:16. Kiedy nic nie wskazuje wyraźnie w jedną stronę, bezpiecznym fotograficznym punktem wyjścia jest 3:2, który pozwala na dobre kadrowanie do innych kształtów.
Gdzie pasuje LarpGPT
LarpGPT to biblioteka podpowiedzi do zdjęć przedstawiających podróże, architekturę, samochody i sceny związane ze stylem życia, z kompozycją wpisaną w każdą zachętę wraz z tematem, oświetleniem i obiektywem. Kopiujesz zachętę, dostosowujesz jej kadrowanie do potrzebnych proporcji i ustawiasz tę proporcję w generatorze obrazów, którego już używasz. LarpGPT nie generuje obrazów, a wyniki różnią się w zależności od próby.
Pytania
Jaki jest najlepszy współczynnik proporcji obrazów AI?
Zależy to od tego, gdzie będzie widoczny obraz i od kształtu obiektu. 3:2 to naturalne ustawienie domyślne w fotografii, 16:9 pasuje do szerokich scen i filmów, 9:16 pasuje do pełnoekranowych zdjęć z telefonu, a 1:1 pasuje do pojedynczych obiektów wyśrodkowanych.
Jak zmienić współczynnik proporcji w Midjourney?
Dodaj --ar, a następnie dwie liczby całkowite na końcu znaku zachęty, na przykład --ar 3:2, zgodnie z dokumentacją Midjourney. Miejsca dziesiętne nie są akceptowane, a wartością domyślną jest kwadrat.
Jakie rozmiary obsługują modele obrazów OpenAI?
W chwili pisania tego tekstu dokumentacja OpenAI wymienia wśród zalecanych rozmiarów 1024x1024, 1536x1024 i 1024x1536, plus opcję automatyczną, a także opisuje niestandardowe rozmiary dla nowszych modeli w ustalonych granicach.
Czy mogę później przyciąć obraz AI do innego współczynnika?
Można, ale kompozycja stworzona dla jednego kształtu często traci swój temat w innym. Zostaw przestrzeń wokół głównego tematu lub wygeneruj każdy format osobno, dopasowując zdania kompozycyjne.
