LarpGPT · راهنماها
نسبت ابعاد برای تصاویر هوش مصنوعی: نحوه انتخاب و تنظیم آنها
مربع، 3:2، 16:9 یا عمودی 9:16: نحوه انتخاب نسبت تصویر برای یک تصویر هوش مصنوعی، نحوه تغییر ترکیب با آن، و نحوه تنظیم Midjourney و OpenAI.

در این راهنما۱۴
چرا نسبت اول است
نسبت تصویر رابطه بین عرض و ارتفاع تصویر است که به صورت دو عدد مانند 3:2 یا 16:9 نوشته می شود. این اولین تصمیمی است که یک عکاس می گیرد، زیرا تصمیم می گیرد که قاب چه چیزی را می تواند نگه دارد. در تولید تصویر اهمیت بیشتری دارد: مدل کل صحنه را برای کادری که به آن میدهید میسازد، بنابراین تغییر نسبت بعد از آن به معنای برش یا بازسازی است. قبل از اینکه بقیه اعلان را اصلاح کنید، آن را انتخاب کنید.
نسبت وضوح نیست
یک نسبت چیزی در مورد تعداد پیکسل ها نمی گوید. مستندات Midjourney مستقیماً به این نکته اشاره می کند: نسبت تصویر با ابعاد تصویر یکسان نیست و اندازه نهایی به نسخه و ارتقاء دهنده آن بستگی دارد. یک تصویر 3:2 می تواند کوچک یا بزرگ باشد. شکلی را که تصویر از کجا دیده میشود و سوژه چگونه باید در آن بنشیند، تعیین کنید، سپس به وضوح به عنوان یک سوال جداگانه بپردازید.
مربع، 1:1
مربع متعادل و ایستا است، بدون جهت غالب. این برای اشیاء منفرد، ترکیببندیهای متقارن و سوژههای متمرکز مناسب است، و این قاب است که بسیاری از پلتفرمهای اجتماعی مدتهاست برای پستها و تصاویر نمایه استفاده میکنند. همچنین پیشفرض در Midjourney است که در مستندات آن اشاره شده است که تصاویر به صورت مربع شروع میشوند. مربع برای مناظر و صحنه های گروهی مناسب نیست، جایی که سوژه به طور طبیعی به طرفین پخش می شود.
عکس کلاسیک 3:2 و 2:3
3:2 نسبت سنتی عکاسی ثابت است که از فیلم 35 میلی متری به ارث رسیده است و بسیاری از دوربین ها هنوز از آن استفاده می کنند. برای یک اعلان عکاسی طبیعی به نظر می رسد زیرا شکلی است که مردم با عکس ها مرتبط می کنند. افقی 3:2 مناسب خیابان ها، فضای داخلی و مناظر است. عمودی 2:3 مناسب پرتره ها، درگاه ها و ساختمان های بلند است و مستندات Midjourney آن را به عنوان رایج در عکاسی چاپی و قاب عکس ذکر کرده است.
4:3 و 5:4
4:3 نسبت تلویزیون اولیه بود و هنوز در بسیاری از تبلت ها و اکثر دوربین های دیجیتال جمع و جور استفاده می شود. کمی مربع تر از 3:2 است که فضای بیشتری را در بالا و پایین سوژه باقی می گذارد. 5:4 دوباره مربع تر است و در عکاسی با فرمت بزرگ و متوسط و برای چاپ های 8 در 10 اینچی رایج است. هر دو به فضای داخلی و پرترهها میآیند که در آن شما میخواهید اتاق تنفسی کوچکی را بدون کشش افقی قوی از فرمت گسترده داشته باشید.
صفحه عریض، 16:9
16:9 نسبت استاندارد تلویزیون و ویدیوی آنلاین است. مرکز راهنمای YouTube آن را به عنوان نسبت ابعاد استاندارد در رایانه توصیف می کند. قاب عریض آن با مناظر، مناظر شهری، ماشینهای در حال حرکت و صحنههای سینمایی با سوژه در یک طرف مناسب است. این یک انتخاب قوی برای بنرها، اسلایدهای ارائه و تصاویر کوچک ویدئو است. برای فیگورهای تک ایستاده ضعیف تر است، که در نهایت در یک قاب پهن کوچک می شوند.
عمودی، 9:16
9:16 همان شکلی است که در سمت خود چرخانده شده است: تمام صفحه یک تلفن به صورت عمودی نگه داشته شده است. مستندات Midjourney آن را برای محتوای تلفن همراه در رسانههای اجتماعی رایج توصیف میکند، و YouTube اشاره میکند که ویدیوهای عمودی 9:16 را میتوان با بالشتک روی صفحهنمایش رایانه نشان داد. مناسب فیگورهای ایستاده، معماری بلند، آبشارها و هر چیزی که دارای خط عمودی قوی باشد. عمداً برای آن بنویسید. یک صحنه افقی فشرده شده در 9:16 معمولاً موضوع خود را در آسمان و زمین خالی از دست می دهد.
چگونه ترکیب بندی با قاب تغییر می کند
قاب عریضتر فضای بیشتری برای تنظیم و قانون یک سوم میدهد، سوژه خارج از مرکز و فضایی برای حرکت چشم. یک قاب بلندتر بر ارتفاع تاکید می کند و لایه بندی را از پیش زمینه به پس زمینه دعوت می کند. محل قرارگیری را در اعلان ذکر کنید: "ماشین در یک سوم سمت راست قاب، جاده خالی که از سمت چپ به داخل منتهی می شود" در 16:9 و 1:1 بسیار متفاوت است. وقتی نسبت را تغییر می دهید، جملات ترکیبی را دوباره بخوانید و آنها را تنظیم کنید.
تنظیم نسبت در Midjourney
مستندات Midjourney پارامتر --ar یا شکل طولانی آن --aspect را فهرست میکند که در انتهای فرمان با یک فاصله قبل از خط تیره اضافه شده است، برای مثال "Squiet Harbor at Dawn --ar 16:9". اعداد باید کامل باشند: مستندات میگوید اعشار پذیرفته نمیشوند و 139:100 را به جای 1.39:1 پیشنهاد میکند، و اندازه پیکسلی مانند 1920:1080 به 16:9 ساده شده است. همچنین اشاره میکند که برخی نسبتها در هنگام افزایش مقیاس کمی تغییر میکنند و نسبتهای بسیار پهن یا بلند تجربی هستند.
تنظیم اندازه با مدل های تصویر OpenAI
مستندات تولید تصویر OpenAI اندازه را به جای نسبت به پیکسل توصیف می کند. در زمان نوشتن، 1024x1024 را به عنوان مربع، 1536x1024 را به عنوان افقی و 1024x1536 را به عنوان عمودی در میان اندازه های توصیه شده با یک گزینه خودکار فهرست می کند. برای مدلهای جدیدتر، اندازههای سفارشی را نیز به صورت عرض به ارتفاع توصیف میکند، که در آن هر دو لبه باید مضرب 16 باشند و نسبت بین لبههای بلند و کوتاه باید در 3:1 باقی بماند. توجه داشته باشید که 1536x1024 خودش یک شکل 3:2 است.
Stable Diffusion و ابزارهای دیگر
در کتابخانه Hugging Face diffusers، خط لوله متن به تصویر Stable Diffusion آرگومان های ارتفاع و عرض را در پیکسل می پذیرد. اصل در همه جا یکسان است: ابتدا شکل را تعیین کنید، سپس هر چیزی را که ابزار درخواست می کند، پیکسل یا نسبت تنظیم کنید. وقتی ابزاری فقط چند اندازه را ارائه میدهد، نزدیکترین اندازه را انتخاب کنید و بعد از آن برش دهید و حاشیهای در ترکیب باقی بگذارید تا برش به موضوع بریده نشود.
برای بیش از یک قالب برنامه ریزی کنید
اگر از یک تصویر در چندین مکان استفاده می شود، مثلاً یک بنر وب گسترده و یک داستان عمودی، تولید یک تصویر و برش دادن آن به هر دو صورت به ندرت جواب می دهد. یا با فضای خالی سخاوتمندانه در اطراف یک سوژه مرکزی بنویسید تا هر دو برش زنده بمانند، یا هر قالب را به طور جداگانه از همان دستور با جملات ترکیبی اقتباس شده تولید کنید. گزینه دوم معمولاً نتایج بهتری می دهد و فقط کمی زمان بیشتری دارد.
یک راه سریع برای انتخاب
بپرسید که تصویر کجا دیده می شود و سوژه چه شکلی دارد. یک شی منفرد یا یک صحنه متقارن متمرکز برای یک مربع مناسب است. عکسی که به این معناست که احساس کنید یک عکس با 3:2 یا 2:3 مطابقت دارد. یک منظره عریض یا یک قاب ویدئو با 16:9 مناسب است. یک تصویر تلفن تمام صفحه یا یک سوژه بلند با 9:16 مناسب است. هنگامی که هیچ چیز به وضوح به یک سمت اشاره نمی کند، 3:2 نقطه شروع عکاسی مطمئنی است که به خوبی به اشکال دیگر تبدیل می شود.
جایی که LarpGPT مناسب است
LarpGPT کتابخانه ای از پیام های عکس برای سفر، معماری، ماشین ها و صحنه های سبک زندگی است که ترکیب بندی آن در کنار سوژه، نور و لنز در هر فرمان نوشته شده است. شما یک درخواست را کپی میکنید، کادربندی آن را با نسبتی که نیاز دارید تطبیق میدهید و آن نسبت را در مولد تصویری که قبلاً استفاده میکنید تنظیم میکنید. LarpGPT تصاویری تولید نمی کند و نتایج بین تلاش ها متفاوت است.
سوالات
بهترین نسبت تصویر برای تصاویر هوش مصنوعی چیست؟
این بستگی به محل مشاهده تصویر و شکل سوژه دارد. 3:2 یک پیشفرض عکاسی طبیعی است، 16:9 برای صحنهها و ویدیوهای عریض، 9:16 برای تصاویر تمام صفحه تلفن و 1:1 برای سوژههای تک محور مناسب است.
چگونه نسبت تصویر را در Midjourney تغییر دهم؟
با توجه به مستندات Midjourney، --ar و سپس دو عدد کامل را در انتهای دستور اضافه کنید، برای مثال --ar 3:2. اعشار پذیرفته نمی شوند و پیش فرض مربع است.
مدل های تصویر OpenAI چه اندازه هایی را پشتیبانی می کنند؟
در زمان نوشتن، اسناد OpenAI 1024x1024، 1536x1024 و 1024x1536 را در میان اندازههای توصیهشده، به اضافه یک گزینه خودکار، فهرست میکند و اندازههای سفارشی را برای مدلهای جدیدتر در محدودههای تعیینشده توصیف میکند.
آیا می توانم بعداً یک تصویر هوش مصنوعی را به نسبت دیگری برش دهم؟
شما می توانید، اما یک ترکیب ساخته شده برای یک شکل اغلب موضوع خود را در شکل دیگر از دست می دهد. در اطراف یک موضوع مرکزی فضای خالی بگذارید، یا هر قالب را به طور جداگانه با جملات ترکیبی اقتباس شده ایجاد کنید.
