LarpGPT
Español
← Volver a la app

LarpGPT · Guías

Relaciones de aspecto para imágenes con IA: cómo elegirlas y configurarlas

Cuadrado, 3:2, 16:9 o vertical 9:16: cómo elegir una relación de aspecto para una imagen con IA, cómo cambia la composición con ella y cómo la configuran Midjourney y OpenAI.

LarpGPT — Tu próxima imagen
LarpGPT · Tu próxima imagen
En esta guía14

Por qué la proporción es lo primero

La relación de aspecto es la relación entre el ancho y el alto de una imagen, escrita como dos números, como 3:2 o 16:9. Es la primera decisión que toma un fotógrafo, porque decide lo que puede contener el encuadre. En la generación de imágenes, esto importa aún más: el modelo compone toda la escena para el fotograma que le asignas, por lo que cambiar la proporción posteriormente significa recortar o regenerar. Elíjalo antes de refinar el resto del mensaje.

La proporción no es resolución

Una proporción no dice nada sobre la cantidad de píxeles. La documentación de Midjourney señala este punto directamente: la relación de aspecto no es lo mismo que las dimensiones de la imagen, y el tamaño final depende de la versión y del escalador. Una imagen 3:2 puede ser pequeña o grande. Decida la forma desde donde se verá la imagen y cómo debe sentarse el sujeto en ella, luego trate la resolución como una cuestión separada.

Cuadrado, 1:1

La plaza es equilibrada y estática, sin una dirección dominante. Se adapta a objetos individuales, composiciones simétricas y sujetos centrados, y es el marco que muchas plataformas sociales han utilizado durante mucho tiempo para publicaciones e imágenes de perfil. También es el valor predeterminado en Midjourney, cuya documentación señala que las imágenes comienzan como cuadrados. Un cuadrado no encaja bien en paisajes y escenas grupales, donde el sujeto se extiende naturalmente hacia los lados.

Fotografía clásica, 3:2 y 2:3

3:2 es la proporción tradicional de la fotografía fija, heredada de la película de 35 mm, y muchas cámaras todavía la utilizan. Un mensaje fotográfico parece natural porque es la forma que la gente asocia con las fotografías. Horizontal 3:2 se adapta a calles, interiores y paisajes; El formato vertical 2:3 se adapta a retratos, entradas y edificios altos, y la documentación de Midjourney lo menciona como común en fotografías impresas y marcos de cuadros.

4:3 y 5:4

4:3 era la relación de televisión original y todavía la utilizan muchas tabletas y la mayoría de las cámaras digitales compactas. Es ligeramente más cuadrado que 3:2, lo que deja más espacio por encima y por debajo del sujeto. 5:4 vuelve a ser más cuadrado y es común en fotografías de formato grande y mediano y en impresiones de 8 por 10 pulgadas. Ambos se adaptan a interiores y retratos en los que se desea un pequeño respiro sin la fuerte atracción horizontal de un gran formato.

Pantalla panorámica, 16:9

16:9 es la relación estándar para televisión y vídeo online; El centro de ayuda de YouTube lo describe como la relación de aspecto estándar en una computadora. Su amplio encuadre se adapta a paisajes, paisajes urbanos, coches en movimiento y escenas cinematográficas con un sujeto colocado a un lado. Es una buena opción para pancartas, diapositivas de presentaciones y miniaturas de vídeos. Es más débil para figuras individuales de pie, que terminan siendo pequeñas en un marco amplio.

verticales, 9:16

9:16 es la misma forma volteada de lado: la pantalla completa de un teléfono en posición vertical. La documentación de Midjourney lo describe como común para contenido móvil en las redes sociales, y YouTube señala que los videos verticales de 9:16 se pueden mostrar con relleno en las pantallas de las computadoras. Se adapta a figuras de pie, arquitectura alta, cascadas y cualquier cosa con una línea vertical fuerte. Componga para ello deliberadamente; una escena horizontal comprimida en 9:16 generalmente pierde su tema en el cielo y el suelo vacíos.

Cómo cambia la composición con el marco

Un encuadre más amplio ofrece más espacio para el escenario y para la regla de los tercios, con el sujeto descentrado y espacio para que la vista viaje. Un marco más alto enfatiza la altura e invita a superponer capas desde el primer plano al fondo. Mencione la ubicación en el mensaje: "el automóvil en el tercio derecho del cuadro, la carretera vacía que conduce desde la izquierda" se lee de manera muy diferente en 16:9 y 1:1. Cuando cambies la proporción, vuelve a leer las oraciones de composición y ajústalas.

Configuración de la relación en Midjourney

La documentación de Midjourney enumera el parámetro --ar, o su formato largo --aspect, agregado al final del mensaje con un espacio antes de los guiones, por ejemplo "puerto tranquilo al amanecer --ar 16:9". Los números deben ser enteros: la documentación dice que no se aceptan decimales y sugiere 139:100 en lugar de 1,39:1, y un tamaño de píxel como 1920:1080 se simplifica a 16:9. También señala que algunas proporciones cambian ligeramente al aumentar la escala y que las proporciones extremadamente anchas o altas son experimentales.

Configurar el tamaño con los modelos de imagen de OpenAI

La documentación de generación de imágenes de OpenAI describe el tamaño en píxeles en lugar de como una proporción. Al momento de escribir este artículo, enumera 1024x1024 como cuadrado, 1536x1024 como paisaje y 1024x1536 como retrato entre los tamaños recomendados, con una opción automática. Para sus modelos más nuevos, también describe tamaños personalizados escritos como ancho por alto, donde ambos bordes deben ser múltiplos de 16 y la relación entre los bordes largo y corto debe permanecer dentro de 3:1. Tenga en cuenta que 1536x1024 tiene en sí misma una forma de 3:2.

Stable Diffusion y otras herramientas

En la biblioteca Hugging Face diffusers, la canalización de texto a imagen Stable Diffusion acepta argumentos de alto y ancho en píxeles. El principio es el mismo en todas partes: primero decide la forma y luego establece lo que la herramienta te pida, píxeles o proporción. Cuando una herramienta ofrece solo unos pocos tamaños, elija el más cercano y recórtelo después, dejando un margen en la composición para que el recorte no corte al sujeto.

Planifique más de un formato

Si una imagen se utilizará en varios lugares, digamos un banner web ancho y una historia vertical, generar una imagen y recortarla en ambos sentidos rara vez funciona. Redacte con un generoso espacio vacío alrededor de un tema central para que ambos cultivos sobrevivan, o genere cada formato por separado a partir del mismo mensaje con las oraciones de composición adaptadas. La segunda opción suele dar mejores resultados y sólo cuesta un poco más de tiempo.

Una forma rápida de elegir

Pregunte dónde se verá la imagen y qué forma tiene el sujeto. Un solo objeto o una escena simétrica centrada se adapta a un cuadrado. Una fotografía destinada a parecer una fotografía se adapta a 3:2 o 2:3. Un paisaje amplio o un fotograma de vídeo son adecuados para 16:9. Una imagen de teléfono en pantalla completa o un sujeto alto se adapta al formato 9:16. Cuando nada apunta claramente en una dirección, 3:2 es un punto de partida fotográfico seguro que se adapta bien a otras formas.

Donde encaja LarpGPT

LarpGPT es una biblioteca de mensajes fotográficos para viajes, arquitectura, automóviles y escenas de estilo de vida, con una composición escrita en cada mensaje junto con el tema, la iluminación y la lente. Copia un mensaje, adapta su encuadre a la proporción que necesita y establece esa proporción en el generador de imágenes que ya utiliza. LarpGPT no genera imágenes y los resultados varían entre intentos.

Preguntas

¿Cuál es la mejor relación de aspecto para imágenes con IA?

Depende de dónde se verá la imagen y de la forma del sujeto. 3:2 es un valor fotográfico natural predeterminado, 16:9 se adapta a escenas y vídeos amplios, 9:16 se adapta a imágenes de teléfonos en pantalla completa y 1:1 se adapta a sujetos centrados en un solo centro.

¿Cómo cambio la relación de aspecto en Midjourney?

Agregue --ar seguido de dos números enteros al final del mensaje, por ejemplo --ar 3:2, según la documentación de Midjourney. No se aceptan decimales y el valor predeterminado es un cuadrado.

¿Qué tamaños admiten los modelos de imagen de OpenAI?

Al momento de escribir este artículo, la documentación de OpenAI enumera 1024x1024, 1536x1024 y 1024x1536 entre los tamaños recomendados, además de una opción automática, y describe tamaños personalizados para modelos más nuevos dentro de los límites establecidos.

¿Puedo recortar una imagen AI a otra proporción más adelante?

Puedes hacerlo, pero una composición hecha para una forma a menudo pierde su tema en otra. Deje espacio alrededor de un tema central o genere cada formato por separado con las oraciones de composición adaptadas.

Para saber más

Todas las aplicaciones