LarpGPT · الأدلة
نسب العرض إلى الارتفاع لصور الذكاء الاصطناعي: كيفية اختيارها وتعيينها
مربع، 3:2، 16:9 أو عمودي 9:16: كيفية اختيار نسبة العرض إلى الارتفاع لصورة الذكاء الاصطناعي، وكيف يتغير التكوين معها، وكيف يقوم Midjourney وOpenAI بتعيينها.

في هذا الدليل14
لماذا تأتي النسبة أولا
نسبة العرض إلى الارتفاع هي العلاقة بين عرض الصورة وارتفاعها، ويتم كتابتها كرقمين مثل 3:2 أو 16:9. إنه القرار الأول الذي يتخذه المصور، لأنه يقرر ما يمكن أن يحمله الإطار. في توليد الصور، الأمر أكثر أهمية: يقوم النموذج بتأليف المشهد بأكمله للإطار الذي تقدمه له، وبالتالي فإن تغيير النسبة بعد ذلك يعني الاقتصاص أو التجديد. اختره قبل تحسين بقية المطالبة.
النسبة ليست القرار
النسبة لا تقول شيئًا عن عدد البكسل. توضح وثائق Midjourney هذه النقطة بشكل مباشر: نسبة العرض إلى الارتفاع ليست هي نفس أبعاد الصورة، والحجم النهائي يعتمد على الإصدار وأداة الارتقاء. يمكن أن تكون الصورة مقاس 3:2 صغيرة أو كبيرة. حدد الشكل الذي سيتم من خلاله رؤية الصورة وكيف يجب أن يظهر الموضوع فيها، ثم تعامل مع الدقة كسؤال منفصل.
مربع، 1:1
المربع متوازن وثابت، وليس له اتجاه مهيمن. إنه يناسب الكائنات الفردية والتراكيب المتماثلة والموضوعات المركزية، وهو الإطار الذي استخدمته العديد من المنصات الاجتماعية منذ فترة طويلة للمنشورات وصور الملفات الشخصية. وهو أيضًا الإعداد الافتراضي في Midjourney، الذي تشير وثائقه إلى أن الصور تبدأ كمربعات. لا يعد المربع مناسبًا للمناظر الطبيعية والمشاهد الجماعية، حيث ينتشر الموضوع بشكل طبيعي بشكل جانبي.
صورة كلاسيكية، 3:2 و2:3
3:2 هي النسبة التقليدية للتصوير الفوتوغرافي الثابت، وهي موروثة من فيلم مقاس 35 مم، ولا تزال العديد من الكاميرات تستخدمها. يبدو الأمر طبيعيًا بالنسبة لموجه التصوير الفوتوغرافي لأنه هو الشكل الذي يربطه الأشخاص بالصور الفوتوغرافية. أفقي 3:2 يناسب الشوارع والديكورات الداخلية والمناظر الطبيعية؛ يناسب الوضع الرأسي 2:3 الصور الشخصية والمداخل والمباني الشاهقة، وتشير وثائق Midjourney إلى أنه شائع في التصوير الفوتوغرافي المطبوع وإطارات الصور.
4:3 و5:4
كانت نسبة 4:3 هي النسبة الأصلية للتلفزيون ولا تزال مستخدمة في العديد من الأجهزة اللوحية ومعظم الكاميرات الرقمية المدمجة. إنه مربع قليلاً من 3:2، مما يترك مساحة أكبر فوق وتحت الموضوع. 5:4 أصبح أكثر تربيعًا مرة أخرى وهو شائع في التصوير الفوتوغرافي الكبير والمتوسط وفي المطبوعات مقاس 8 × 10 بوصة. يناسب كلاهما التصميمات الداخلية والصور الشخصية حيث تريد مساحة صغيرة للتنفس دون السحب الأفقي القوي للتنسيق الواسع.
شاشة عريضة، 16:9
16:9 هي النسبة القياسية للتلفزيون والفيديو عبر الإنترنت؛ يصفها مركز مساعدة YouTube بأنها نسبة العرض إلى الارتفاع القياسية على جهاز الكمبيوتر. يتناسب إطارها العريض مع المناظر الطبيعية ومناظر المدينة والسيارات المتحركة والمشاهد السينمائية مع وضع الهدف على جانب واحد. إنه خيار قوي لللافتات وشرائح العرض التقديمي والصور المصغرة للفيديو. وهو أضعف بالنسبة للأشكال الفردية الدائمة، والتي ينتهي بها الأمر صغيرة في إطار عريض.
عمودي، 9:16
9:16 هو نفس الشكل مقلوبًا على جانبه: شاشة الهاتف الكاملة مرفوعة في وضع مستقيم. تصف وثائق Midjourney ذلك بأنه شائع بالنسبة لمحتوى الهاتف المحمول على وسائل التواصل الاجتماعي، وتشير YouTube إلى أنه يمكن عرض مقاطع الفيديو العمودية مقاس 9:16 مع الحشو على شاشات الكمبيوتر. يناسب الشخصيات الواقفة والهندسة المعمارية الطويلة والشلالات وأي شيء ذو خط عمودي قوي. يؤلف لذلك عمدا. عادةً ما يفقد المشهد الأفقي الذي تم ضغطه في 9:16 موضوعه بسبب السماء والأرضية الفارغة.
كيف يتغير التكوين مع الإطار
يوفر الإطار الأوسع مساحة أكبر للإعداد ولقاعدة الأثلاث، مع إبقاء الهدف بعيدًا عن المركز ومساحة للعين للتنقل. يؤكد الإطار الأطول على الارتفاع ويدعو إلى طبقات من المقدمة إلى الخلفية. اذكر الموضع في الموجه: "السيارة الموجودة في الثلث الأيمن من الإطار، الطريق الفارغ المؤدي من اليسار" تقرأ بشكل مختلف تمامًا في 16:9 وفي 1:1. عند تغيير النسبة، أعد قراءة الجمل التركيبية واضبطها.
ضبط النسبة في Midjourney
تسرد وثائق Midjourney المعلمة --ar، أو شكلها الطويل --aspect، الذي تمت إضافته في نهاية الموجه بمسافة قبل الشرطات، على سبيل المثال "Quiet Harbour at Dawn --ar 16:9". يجب أن تكون الأرقام كاملة: تقول الوثائق أنه لا يتم قبول الكسور العشرية وتقترح 139:100 بدلاً من 1.39:1، ويتم تبسيط حجم البكسل مثل 1920:1080 إلى 16:9. ويلاحظ أيضًا أن بعض النسب تتغير قليلاً عند الارتقاء وأن النسب الواسعة أو الطويلة للغاية هي نسب تجريبية.
ضبط الحجم باستخدام نماذج الصور OpenAI
تصف وثائق إنشاء الصور الخاصة بـ OpenAI الحجم بالبكسل وليس كنسبة. في وقت كتابة هذا التقرير، تم إدراج 1024 × 1024 كمربع، و1536 × 1024 كأفقي و1024 × 1536 كصورة عمودية من بين الأحجام الموصى بها، مع خيار تلقائي. بالنسبة لنماذجها الأحدث، فإنها تصف أيضًا الأحجام المخصصة المكتوبة بالعرض بالارتفاع، حيث يجب أن تكون كلا الحافتين من مضاعفات 16 ويجب أن تظل النسبة بين الحواف الطويلة والقصيرة في حدود 3:1. لاحظ أن 1536x1024 هو في حد ذاته شكل 3:2.
Stable Diffusion وأدوات أخرى
في مكتبة Hugging Face diffusers، يقبل مسار تحويل النص إلى صورة Stable Diffusion وسيطات الارتفاع والعرض بالبكسل. المبدأ هو نفسه في كل مكان: حدد الشكل أولاً، ثم قم بتعيين ما تطلبه الأداة، سواء بالبكسل أو النسبة. عندما توفر أداة ما عددًا قليلًا من الأحجام، اختر الحجم الأقرب وقم بالقص بعد ذلك، مع ترك هامش في التركيب حتى لا يقتطع الاقتصاص من الموضوع.
التخطيط لأكثر من تنسيق
إذا كان سيتم استخدام صورة في عدة أماكن، على سبيل المثال، لافتة ويب عريضة وقصة رأسية، نادرًا ما ينجح إنشاء صورة واحدة واقتصاصها في كلا الاتجاهين. إما أن يتم التأليف بمساحة فارغة كبيرة حول موضوع مركزي بحيث يبقى كلا المحصولين على قيد الحياة، أو أنشئ كل تنسيق بشكل منفصل عن نفس الموجه مع تكييف جمل الإنشاء. عادةً ما يعطي الخيار الثاني نتائج أفضل ويكلف وقتًا أطول قليلاً.
طريقة سريعة للاختيار
اسأل أين سيتم رؤية الصورة وما هو شكل الموضوع. كائن واحد أو مشهد متماثل مركزي يناسب المربع. صورة من المفترض أن تبدو وكأنها صورة تناسب 3:2 أو 2:3. المناظر الطبيعية الواسعة أو إطار الفيديو يناسب 16:9. صورة الهاتف بملء الشاشة أو موضوع طويل يناسب 9:16. عندما لا يوجد شيء يشير بوضوح إلى اتجاه واحد، فإن نسبة 3:2 هي نقطة بداية فوتوغرافية آمنة تتناسب بشكل جيد مع الأشكال الأخرى.
حيث يناسب LarpGPT
LarpGPT عبارة عن مكتبة لمطالبات الصور الخاصة بالسفر والهندسة المعمارية والسيارات ومشاهد نمط الحياة، مع تكوين مكتوب في كل مطالبة جنبًا إلى جنب مع الموضوع والإضاءة والعدسة. يمكنك نسخ موجه، وتكييف إطاره مع النسبة التي تحتاجها، وتعيين تلك النسبة في منشئ الصور الذي تستخدمه بالفعل. لا يقوم LarpGPT بإنشاء صور، وتختلف النتائج بين المحاولات.
الأسئلة
ما هي أفضل نسبة عرض إلى ارتفاع لصور الذكاء الاصطناعي؟
يعتمد ذلك على مكان رؤية الصورة وشكل الموضوع. 3:2 هو الإعداد الافتراضي الطبيعي للتصوير الفوتوغرافي، و16:9 يناسب المشاهد والفيديوهات الواسعة، و9:16 يناسب صور الهاتف بملء الشاشة، و1:1 يناسب الموضوعات الفردية المتمركزة.
كيف يمكنني تغيير نسبة العرض إلى الارتفاع في Midjourney؟
أضف --ar متبوعًا برقمين صحيحين في نهاية الموجه، على سبيل المثال --ar 3:2، وفقًا لوثائق Midjourney. لا يتم قبول الكسور العشرية، والافتراضي هو مربع.
ما الأحجام التي تدعمها نماذج الصور OpenAI؟
في وقت كتابة هذا التقرير، كانت وثائق OpenAI تسرد 1024x1024 و1536x1024 و1024x1536 من بين الأحجام الموصى بها، بالإضافة إلى خيار تلقائي، وتصف الأحجام المخصصة للطرز الأحدث ضمن الحدود المحددة.
هل يمكنني اقتصاص صورة AI إلى نسبة أخرى لاحقًا؟
يمكنك ذلك، لكن التركيبة المصممة لشكل ما غالبًا ما تفقد موضوعها في شكل آخر. اترك مساحة حول موضوع مركزي، أو قم بإنشاء كل تنسيق على حدة مع تكييف الجمل التركيبية.
