LarpGPT
Bahasa Melayu
← Kembali ke apl

LarpGPT · Pemandu

Nisbah aspek untuk imej AI: cara memilih dan menetapkannya

Segi empat sama, 3:2, 16:9 atau menegak 9:16: cara memilih nisbah bidang untuk imej AI, cara komposisi berubah dengannya dan cara Midjourney dan OpenAI menetapkannya.

LarpGPT — Imej anda yang seterusnya bermula di sini
LarpGPT · Imej anda yang seterusnya bermula di sini
Dalam panduan ini14

Mengapa nisbah diutamakan

Nisbah aspek ialah hubungan antara lebar dan tinggi imej, ditulis sebagai dua nombor seperti 3:2 atau 16:9. Ia adalah keputusan pertama yang dibuat oleh jurugambar, kerana ia menentukan apa yang boleh dipegang oleh bingkai itu. Dalam penjanaan imej, ia lebih penting: model menyusun keseluruhan pemandangan untuk bingkai yang anda berikan, jadi menukar nisbah selepas itu bermakna memangkas atau menjana semula. Pilihnya sebelum anda memperhalusi gesaan yang lain.

Nisbah bukan resolusi

Nisbah tidak menyatakan apa-apa tentang bilangan piksel. Dokumentasi Midjourney menyatakan perkara ini secara langsung: nisbah aspek tidak sama dengan dimensi imej dan saiz akhir bergantung pada versi dan peskala tinggi. Imej 3:2 boleh menjadi kecil atau besar. Tentukan bentuk dari mana imej akan dilihat dan bagaimana subjek harus duduk di dalamnya, kemudian berurusan dengan resolusi sebagai soalan berasingan.

Segi empat, 1:1

Petak adalah seimbang dan statik, tanpa arah yang dominan. Ia sesuai dengan objek tunggal, gubahan simetri dan subjek berpusat, dan ia adalah bingkai yang telah lama digunakan oleh banyak platform sosial untuk siaran dan imej profil. Ia juga merupakan lalai dalam Midjourney, yang dokumentasinya mencatatkan bahawa imej bermula sebagai segi empat sama. Segi empat tepat tidak sesuai untuk landskap dan adegan kumpulan, di mana subjek secara semula jadi merebak ke sisi.

Foto klasik, 3:2 dan 2:3

3:2 ialah nisbah tradisional fotografi pegun, diwarisi daripada filem 35 mm, dan banyak kamera masih menggunakannya. Terasa semula jadi untuk gesaan fotografi kerana ia adalah bentuk yang orang kaitkan dengan gambar. Mendatar 3:2 sesuai dengan jalan, dalaman dan landskap; menegak 2:3 sesuai dengan potret, ambang pintu dan bangunan tinggi, dan dokumentasi Midjourney menyebutnya sebagai perkara biasa dalam fotografi bercetak dan bingkai gambar.

4:3 dan 5:4

4:3 ialah nisbah televisyen asal dan masih digunakan oleh kebanyakan tablet dan oleh kebanyakan kamera digital kompak. Ia lebih sedikit daripada 3:2, yang meninggalkan lebih banyak ruang di atas dan di bawah subjek. 5:4 adalah lebih persegi lagi dan biasa dalam fotografi format besar dan sederhana dan untuk cetakan 8 kali 10 inci. Kedua-dua bahagian dalam dan potret sesuai di mana anda mahukan sedikit ruang pernafasan tanpa tarikan mendatar yang kuat dalam format lebar.

Skrin lebar, 16:9

16:9 ialah nisbah standard untuk televisyen dan video dalam talian; Pusat bantuan YouTube menerangkannya sebagai nisbah bidang standard pada komputer. Bingkai lebarnya sesuai dengan landskap, landskap bandar, kereta dalam gerakan dan adegan sinematik dengan subjek diletakkan di sebelah. Ia adalah pilihan yang kukuh untuk sepanduk, slaid pembentangan dan lakaran kecil video. Ia lebih lemah untuk angka berdiri tunggal, yang berakhir dengan kecil dalam bingkai lebar.

Menegak, 9:16

9:16 ialah bentuk yang sama dipusingkan pada sisinya: skrin penuh telefon yang dipegang tegak. Dokumentasi Midjourney menerangkannya sebagai perkara biasa untuk kandungan mudah alih di media sosial dan YouTube menyatakan bahawa video menegak 9:16 boleh ditunjukkan dengan pelapik pada skrin komputer. Ia sesuai dengan patung berdiri, seni bina tinggi, air terjun dan apa sahaja yang mempunyai garis menegak yang kuat. Karang untuknya dengan sengaja; adegan mendatar yang diperah hingga 9:16 biasanya kehilangan subjeknya kepada langit dan lantai yang kosong.

Bagaimana komposisi berubah dengan bingkai

Bingkai yang lebih lebar memberikan lebih banyak ruang untuk menetapkan dan untuk peraturan pertiga, dengan subjek di luar tengah dan ruang untuk mata bergerak. Bingkai yang lebih tinggi menekankan ketinggian dan menjemput lapisan dari latar depan ke latar belakang. Sebutkan peletakan dalam gesaan: "kereta di pertiga kanan bingkai, jalan kosong menghala masuk dari kiri" dibaca dengan sangat berbeza dalam 16:9 dan dalam 1:1. Apabila anda menukar nisbah, baca semula ayat gubahan dan laraskannya.

Menetapkan nisbah dalam Midjourney

Dokumentasi Midjourney menyenaraikan parameter --ar, atau bentuk panjangnya --aspect, ditambah pada penghujung gesaan dengan ruang sebelum tanda sempang, contohnya "pelabuhan tenang pada waktu subuh --ar 16:9". Nombor mestilah keseluruhan: dokumentasi mengatakan perpuluhan tidak diterima dan mencadangkan 139:100 dan bukannya 1.39:1, dan saiz piksel seperti 1920:1080 dipermudahkan kepada 16:9. Ia juga menyatakan bahawa sesetengah nisbah berubah sedikit apabila ditingkatkan dan nisbah yang sangat lebar atau tinggi adalah percubaan.

Menetapkan saiz dengan model imej OpenAI

Dokumentasi penjanaan imej OpenAI menerangkan saiz dalam piksel dan bukannya sebagai nisbah. Pada masa penulisan ia menyenaraikan 1024x1024 sebagai segi empat sama, 1536x1024 sebagai landskap dan 1024x1536 sebagai potret antara saiz yang disyorkan, dengan pilihan automatik. Untuk model yang lebih baharu, ia juga menerangkan saiz tersuai yang ditulis sebagai lebar mengikut ketinggian, di mana kedua-dua tepi mestilah gandaan 16 dan nisbah antara tepi panjang dan pendek mesti kekal dalam 3:1. Ambil perhatian bahawa 1536x1024 itu sendiri adalah bentuk 3:2.

Stable Diffusion dan alatan lain

Dalam pustaka Hugging Face diffusers, saluran paip teks-ke-imej Stable Diffusion menerima argumen ketinggian dan lebar dalam piksel. Prinsipnya adalah sama di mana-mana: tentukan bentuk dahulu, kemudian tetapkan apa sahaja yang diminta oleh alat, piksel atau nisbah. Apabila alat hanya menawarkan beberapa saiz, pilih yang paling hampir dan pangkas selepas itu, biarkan margin dalam komposisi supaya pangkas tidak memotong subjek.

Rancang untuk lebih daripada satu format

Jika imej akan digunakan di beberapa tempat, sebut sepanduk web lebar dan cerita menegak, menjana satu imej dan memangkasnya dalam kedua-dua cara jarang berfungsi. Sama ada mengarang dengan ruang kosong yang luas di sekeliling subjek pusat supaya kedua-dua tanaman bertahan, atau jana setiap format secara berasingan daripada gesaan yang sama dengan ayat gubahan disesuaikan. Pilihan kedua biasanya memberikan hasil yang lebih baik dan kos hanya lebih sedikit masa.

Cara cepat untuk memilih

Tanya di mana imej itu akan dilihat dan apakah bentuk subjek itu. Objek tunggal atau pemandangan simetri berpusat sesuai dengan segi empat sama. Gambar yang dimaksudkan untuk merasa seperti gambar sesuai dengan 3:2 atau 2:3. Landskap lebar atau bingkai video sesuai dengan 16:9. Imej telefon skrin penuh atau subjek tinggi sesuai dengan 9:16. Apabila tiada apa-apa menunjukkan dengan jelas satu arah, 3:2 ialah titik permulaan fotografi yang selamat yang dipangkas dengan baik kepada bentuk lain.

Di mana LarpGPT sesuai

LarpGPT ialah perpustakaan gesaan foto untuk perjalanan, seni bina, kereta dan pemandangan gaya hidup, dengan komposisi ditulis dalam setiap gesaan bersama subjek, pencahayaan dan kanta. Anda menyalin gesaan, menyesuaikan pembingkaiannya kepada nisbah yang anda perlukan, dan tetapkan nisbah tersebut dalam penjana imej yang telah anda gunakan. LarpGPT tidak menjana imej, dan keputusan berbeza antara percubaan.

Soalan

Apakah nisbah aspek terbaik untuk imej AI?

Ia bergantung pada tempat imej akan dilihat dan bentuk subjek. 3:2 ialah lalai fotografi semula jadi, 16:9 sesuai dengan pemandangan dan video yang luas, 9:16 sesuai dengan imej telefon skrin penuh dan 1:1 sesuai dengan subjek berpusat tunggal.

Bagaimanakah cara menukar nisbah bidang dalam Midjourney?

Tambahkan --ar diikuti dengan dua nombor bulat pada penghujung gesaan, contohnya --ar 3:2, mengikut dokumentasi Midjourney. Perpuluhan tidak diterima, dan lalai ialah segi empat sama.

Apakah saiz yang disokong oleh model imej OpenAI?

Pada masa penulisan, dokumentasi OpenAI menyenaraikan 1024x1024, 1536x1024 dan 1024x1536 antara saiz yang disyorkan, ditambah dengan pilihan automatik dan menerangkan saiz tersuai untuk model yang lebih baharu dalam had yang ditetapkan.

Bolehkah saya memangkas imej AI kepada nisbah lain kemudian?

Anda boleh, tetapi komposisi yang dibuat untuk satu bentuk sering kehilangan subjeknya dalam bentuk lain. Tinggalkan ruang di sekeliling subjek pusat, atau jana setiap format secara berasingan dengan ayat gubahan disesuaikan.

Bacaan lanjut

Semua aplikasi