LarpGPT · માર્ગદર્શિકાઓ
AI છબીઓ માટે પાસા રેશિયો: તેમને કેવી રીતે પસંદ કરવા અને સેટ કરવા
સ્ક્વેર, 3:2, 16:9 અથવા વર્ટિકલ 9:16: AI ઇમેજ માટે આસ્પેક્ટ રેશિયો કેવી રીતે પસંદ કરવો, તેની સાથે કમ્પોઝિશન કેવી રીતે બદલાય છે અને તેને Midjourney અને OpenAI કેવી રીતે સેટ કરે છે.

આ માર્ગદર્શિકામાં14
ગુણોત્તર શા માટે પ્રથમ આવે છે
સાપેક્ષ ગુણોત્તર એ છબીની પહોળાઈ અને ઊંચાઈ વચ્ચેનો સંબંધ છે, જે બે સંખ્યાઓ જેમ કે 3:2 અથવા 16:9 તરીકે લખવામાં આવે છે. તે ફોટોગ્રાફરનો પ્રથમ નિર્ણય છે, કારણ કે તે નક્કી કરે છે કે ફ્રેમ શું પકડી શકે છે. ઇમેજ જનરેશનમાં તે વધુ મહત્વ ધરાવે છે: તમે જે ફ્રેમ આપો છો તેના માટે મોડલ આખું દ્રશ્ય કંપોઝ કરે છે, તેથી પછીથી રેશિયો બદલવાનો અર્થ થાય છે ક્રોપિંગ અથવા રિજનરેટ. તમે બાકીના પ્રોમ્પ્ટને રિફાઇન કરો તે પહેલાં તેને પસંદ કરો.
રેશિયો રિઝોલ્યુશન નથી
ગુણોત્તર પિક્સેલ્સની સંખ્યા વિશે કશું કહેતું નથી. Midjourneyના દસ્તાવેજીકરણ આ મુદ્દાને સીધો બનાવે છે: પાસા રેશિયો ઇમેજના પરિમાણો જેવો નથી અને અંતિમ કદ સંસ્કરણ અને અપસ્કેલર પર આધારિત છે. 3:2 ઈમેજ નાની કે મોટી હોઈ શકે છે. છબી ક્યાંથી જોવામાં આવશે અને તેમાં વિષય કેવી રીતે બેસવો જોઈએ તે નક્કી કરો, પછી એક અલગ પ્રશ્ન તરીકે રીઝોલ્યુશન સાથે વ્યવહાર કરો.
ચોરસ, 1:1
ચોરસ સંતુલિત અને સ્થિર છે, જેમાં કોઈ પ્રબળ દિશા નથી. તે સિંગલ ઑબ્જેક્ટ્સ, સપ્રમાણ રચનાઓ અને કેન્દ્રિત વિષયોને અનુકૂળ કરે છે, અને તે ફ્રેમ છે જેનો ઉપયોગ ઘણા સામાજિક પ્લેટફોર્મ પોસ્ટ્સ અને પ્રોફાઇલ છબીઓ માટે લાંબા સમયથી કરે છે. તે Midjourney માં પણ ડિફોલ્ટ છે, જેનું દસ્તાવેજીકરણ નોંધે છે કે છબીઓ ચોરસ તરીકે શરૂ થાય છે. ચોરસ એ લેન્ડસ્કેપ્સ અને જૂથ દ્રશ્યો માટે નબળું ફિટ છે, જ્યાં વિષય કુદરતી રીતે બાજુમાં ફેલાય છે.
ઉત્તમ ફોટો, 3:2 અને 2:3
3:2 એ સ્થિર ફોટોગ્રાફીનો પરંપરાગત ગુણોત્તર છે, જે 35 મીમી ફિલ્મમાંથી વારસામાં મળેલ છે અને ઘણા કેમેરા હજુ પણ તેનો ઉપયોગ કરે છે. ફોટોગ્રાફિક પ્રોમ્પ્ટ માટે તે સ્વાભાવિક લાગે છે કારણ કે તે તે આકાર છે જે લોકો ફોટોગ્રાફ્સ સાથે સાંકળે છે. આડું 3:2 શેરીઓ, આંતરિક અને લેન્ડસ્કેપ્સ માટે અનુકૂળ છે; વર્ટિકલ 2:3 પોટ્રેઇટ્સ, દરવાજાઓ અને ઊંચી ઇમારતોને અનુકૂળ કરે છે અને Midjourneyના દસ્તાવેજીકરણમાં પ્રિન્ટેડ ફોટોગ્રાફી અને પિક્ચર ફ્રેમ્સમાં તેનો સામાન્ય ઉલ્લેખ છે.
4:3 અને 5:4
4:3 મૂળ ટેલિવિઝન ગુણોત્તર હતો અને હજુ પણ ઘણા ટેબ્લેટ અને મોટાભાગના કોમ્પેક્ટ ડિજિટલ કેમેરા દ્વારા ઉપયોગમાં લેવાય છે. તે 3:2 કરતાં સહેજ ચોરસ છે, જે વિષયની ઉપર અને નીચે વધુ જગ્યા છોડે છે. 5:4 ફરીથી ચોરસ છે અને મોટા અને મધ્યમ ફોર્મેટ ફોટોગ્રાફીમાં અને 8 બાય 10 ઇંચની પ્રિન્ટ માટે સામાન્ય છે. ઈન્ટિરિયર્સ અને પોટ્રેટ્સ બંને સૂટ કરે છે જ્યાં તમને વિશાળ ફોર્મેટના મજબૂત આડા પુલ વિના થોડો શ્વાસ લેવાની જગ્યા જોઈએ છે.
વાઇડસ્ક્રીન, 16:9
16:9 એ ટેલિવિઝન અને ઑનલાઇન વિડિયો માટે પ્રમાણભૂત ગુણોત્તર છે; YouTubeનું મદદ કેન્દ્ર તેને કમ્પ્યુટર પર પ્રમાણભૂત પાસા રેશિયો તરીકે વર્ણવે છે. તેની પહોળી ફ્રેમ લેન્ડસ્કેપ્સ, સિટીસ્કેપ્સ, ગતિમાં કાર અને સિનેમેટિક દ્રશ્યોને એક બાજુએ મૂકેલા વિષયને અનુકૂળ કરે છે. તે બેનરો, પ્રસ્તુતિ સ્લાઇડ્સ અને વિડિઓ થંબનેલ્સ માટે એક મજબૂત પસંદગી છે. તે સિંગલ સ્ટેન્ડિંગ આકૃતિઓ માટે નબળા છે, જે વિશાળ ફ્રેમમાં નાના હોય છે.
વર્ટિકલ, 9:16
9:16 એ જ આકાર છે જે તેની બાજુ પર વળેલો છે: ફોનની સંપૂર્ણ સ્ક્રીન સીધી રાખવામાં આવે છે. Midjourneyના દસ્તાવેજીકરણ તેને સોશિયલ મીડિયા પર મોબાઇલ સામગ્રી માટે સામાન્ય તરીકે વર્ણવે છે, અને YouTube નોંધે છે કે વર્ટિકલ 9:16 વિડિઓઝ કમ્પ્યુટર સ્ક્રીન પર પેડિંગ સાથે બતાવી શકાય છે. તે સ્થાયી આકૃતિઓ, ઊંચા આર્કિટેક્ચર, ધોધ અને મજબૂત ઊભી રેખા સાથેની કોઈપણ વસ્તુને અનુકૂળ કરે છે. તેના માટે ઇરાદાપૂર્વક કંપોઝ કરો; 9:16 માં સ્ક્વિઝ્ડ થયેલ આડું દ્રશ્ય સામાન્ય રીતે ખાલી આકાશ અને ફ્લોર પર તેનો વિષય ગુમાવે છે.
ફ્રેમ સાથે રચના કેવી રીતે બદલાય છે
એક વિશાળ ફ્રેમ સેટિંગ અને રૂલ ઑફ થર્ડ્સ માટે વધુ જગ્યા આપે છે, જેમાં સબ્જેક્ટ ઑફ-સેન્ટર હોય છે અને આંખને મુસાફરી કરવાની જગ્યા હોય છે. ઊંચી ફ્રેમ ઊંચાઈ પર ભાર મૂકે છે અને અગ્રભૂમિથી પૃષ્ઠભૂમિ સુધી લેયરિંગને આમંત્રણ આપે છે. પ્રોમ્પ્ટમાં પ્લેસમેન્ટનો ઉલ્લેખ કરો: "ફ્રેમના જમણા ત્રીજા ભાગમાં કાર, ડાબી બાજુથી અંદર જતો ખાલી રસ્તો" 16:9 અને 1:1 માં ખૂબ જ અલગ રીતે વાંચે છે. જ્યારે તમે ગુણોત્તર બદલો છો, ત્યારે રચના વાક્યો ફરીથી વાંચો અને તેમને સમાયોજિત કરો.
રેશિયો Midjourney માં સેટ કરી રહ્યા છીએ
Midjourneyના દસ્તાવેજીકરણમાં --ar પેરામીટર અથવા તેના લાંબા ફોર્મ --aspectને સૂચિબદ્ધ કરવામાં આવે છે, જે પ્રોમ્પ્ટના અંતમાં ડેશ પહેલા સ્પેસ સાથે ઉમેરવામાં આવે છે, ઉદાહરણ તરીકે "શાંત હાર્બર એટ ડૉન --ar 16:9". સંખ્યાઓ સંપૂર્ણ હોવી જોઈએ: દસ્તાવેજીકરણ કહે છે કે દશાંશ સ્વીકૃત નથી અને 1.39:1 ને બદલે 139:100 સૂચવે છે, અને 1920:1080 જેવા પિક્સેલ કદને 16:9 માં સરળ બનાવ્યું છે. તે એ પણ નોંધે છે કે જ્યારે અપસ્કેલિંગ કરવામાં આવે છે ત્યારે કેટલાક ગુણોત્તર સહેજ બદલાય છે અને તે અત્યંત પહોળા અથવા ઊંચા ગુણોત્તર પ્રાયોગિક છે.
OpenAIના ઇમેજ મૉડલ્સ સાથે કદ સેટ કરી રહ્યું છે
OpenAIનું ઇમેજ જનરેશન ડોક્યુમેન્ટેશન રેશિયોને બદલે પિક્સેલ્સમાં કદનું વર્ણન કરે છે. લખતી વખતે તે 1024x1024 ચોરસ તરીકે, 1536x1024 લેન્ડસ્કેપ તરીકે અને 1024x1536 ની ભલામણ કરેલ કદમાં પોટ્રેટ તરીકે સ્વચાલિત વિકલ્પ સાથે સૂચિબદ્ધ કરે છે. તેના નવા મોડલ્સ માટે તે પહોળાઈ દ્વારા ઊંચાઈ તરીકે લખેલા કસ્ટમ કદનું પણ વર્ણન કરે છે, જ્યાં બંને કિનારીઓ 16 ના ગુણાંકની હોવી જોઈએ અને લાંબી અને ટૂંકી કિનારીઓ વચ્ચેનો ગુણોત્તર 3:1 ની અંદર રહેવો જોઈએ. નોંધ કરો કે 1536x1024 પોતે 3:2 આકાર છે.
Stable Diffusion અને અન્ય સાધનો
Hugging Face diffusers લાઇબ્રેરીમાં, Stable Diffusion ટેક્સ્ટ-ટુ-ઇમેજ પાઇપલાઇન પિક્સેલ્સમાં ઊંચાઈ અને પહોળાઈની દલીલો સ્વીકારે છે. સિદ્ધાંત દરેક જગ્યાએ સમાન છે: પ્રથમ આકાર નક્કી કરો, પછી સાધન જે માંગે તે સેટ કરો, પિક્સેલ્સ અથવા ગુણોત્તર. જ્યારે કોઈ ટૂલ માત્ર થોડા જ કદ પ્રદાન કરે છે, ત્યારે સૌથી નજીકનું પસંદ કરો અને પછીથી કાપો, રચનામાં માર્જિન છોડી દો જેથી કરીને વિષયમાં કાપ ન આવે.
એક કરતાં વધુ ફોર્મેટની યોજના બનાવો
જો એક છબીનો ઉપયોગ ઘણી જગ્યાએ કરવામાં આવશે, તો વિશાળ વેબ બેનર અને ઊભી વાર્તા કહો, એક છબી જનરેટ કરવી અને તેને કાપવી બંને રીતે ભાગ્યે જ કામ કરે છે. કાં તો કેન્દ્રીય વિષયની આસપાસ ઉદાર ખાલી જગ્યા સાથે કંપોઝ કરો જેથી બંને પાક ટકી રહે, અથવા અનુકૂલિત રચના વાક્યો સાથે સમાન પ્રોમ્પ્ટથી દરેક ફોર્મેટને અલગથી જનરેટ કરો. બીજો વિકલ્પ સામાન્ય રીતે વધુ સારા પરિણામો આપે છે અને માત્ર થોડો વધુ સમય લે છે.
પસંદ કરવાની ઝડપી રીત
પૂછો કે છબી ક્યાં દેખાશે અને વિષયનો આકાર શું છે. એક વસ્તુ અથવા કેન્દ્રિત સપ્રમાણ દ્રશ્ય ચોરસને અનુકૂળ આવે છે. ફોટોગ્રાફનો અર્થ એ છે કે ફોટોગ્રાફ 3:2 અથવા 2:3 માટે યોગ્ય લાગે છે. વિશાળ લેન્ડસ્કેપ અથવા વિડિયો ફ્રેમ 16:9 માટે અનુકૂળ છે. પૂર્ણ-સ્ક્રીન ફોન ઇમેજ અથવા ઊંચા વિષય 9:16 માટે અનુકૂળ છે. જ્યારે કશું સ્પષ્ટપણે એક રીતે નિર્દેશ કરતું નથી, ત્યારે 3:2 એ સુરક્ષિત ફોટોગ્રાફિક પ્રારંભિક બિંદુ છે જે અન્ય આકારોમાં સારી રીતે પાકે છે.
જ્યાં LarpGPT બંધબેસે છે
LarpGPT એ મુસાફરી, આર્કિટેક્ચર, કાર અને જીવનશૈલીના દ્રશ્યો માટે ફોટો પ્રોમ્પ્ટ્સની લાઇબ્રેરી છે, જેમાં વિષય, લાઇટિંગ અને લેન્સની સાથે દરેક પ્રોમ્પ્ટમાં રચના લખેલી છે. તમે પ્રોમ્પ્ટની નકલ કરો, તેના ફ્રેમિંગને તમને જોઈતા ગુણોત્તરમાં અનુકૂલિત કરો અને તમે પહેલાથી જ ઉપયોગ કરો છો તે ઇમેજ જનરેટરમાં તે ગુણોત્તર સેટ કરો. LarpGPT છબીઓ જનરેટ કરતું નથી, અને પરિણામો પ્રયાસો વચ્ચે બદલાય છે.
પ્રશ્નો
AI ઇમેજ માટે શ્રેષ્ઠ આસ્પેક્ટ રેશિયો શું છે?
તે છબી ક્યાં જોવામાં આવશે અને વિષયનો આકાર તેના પર નિર્ભર છે. 3:2 એ કુદરતી ફોટોગ્રાફિક ડિફૉલ્ટ છે, 16:9 વિશાળ દ્રશ્યો અને વિડિયોને અનુકૂળ છે, 9:16 પૂર્ણ-સ્ક્રીન ફોન છબીઓને અનુકૂળ છે અને 1:1 એકલ કેન્દ્રિત વિષયોને અનુકૂળ છે.
હું પાસા રેશિયોને Midjourney માં કેવી રીતે બદલી શકું?
પ્રોમ્પ્ટના અંતે બે પૂર્ણ સંખ્યાઓ પછી --ar ઉમેરો, ઉદાહરણ તરીકે --ar 3:2, Midjourneyના દસ્તાવેજીકરણ મુજબ. દશાંશ સ્વીકૃત નથી અને ડિફોલ્ટ ચોરસ છે.
OpenAIના ઇમેજ મોડલ્સ કયા કદને સપોર્ટ કરે છે?
લખવાના સમયે, OpenAIના દસ્તાવેજીકરણ ભલામણ કરેલ કદમાં 1024x1024, 1536x1024 અને 1024x1536ની યાદી આપે છે, ઉપરાંત એક સ્વચાલિત વિકલ્પ, અને સેટ મર્યાદામાં નવા મોડલ્સ માટે કસ્ટમ કદનું વર્ણન કરે છે.
શું હું પછીથી AI ઇમેજને બીજા રેશિયોમાં ક્રોપ કરી શકું?
તમે કરી શકો છો, પરંતુ એક આકાર માટે બનાવેલી રચના ઘણીવાર તેનો વિષય બીજામાં ગુમાવે છે. કેન્દ્રીય વિષયની આસપાસ જગ્યા છોડો, અથવા અનુકૂલિત રચના વાક્યો સાથે દરેક ફોર્મેટ અલગથી જનરેટ કરો.
