LarpGPT
日本語
← アプリに戻る

LarpGPT · ガイド

AI 画像のアスペクト比: その選択と設定方法

正方形、3:2、16:9、または垂直 9:16: AI 画像のアスペクト比を選択する方法、それによって構成がどのように変化するか、および Midjourney と OpenAI がそれを設定する方法。

LarpGPT — 次の一枚の出発点
LarpGPT · 次の一枚の出発点
このガイドの内容14

なぜ比率が最初に来るのか

アスペクト比は画像の幅と高さの関係であり、3:2 や 16:9 などの 2 つの数字で表されます。フレームに何を収められるかが決まるため、これは写真家が行う最初の決定です。画像生成では、これはさらに重要です。モデルは、指定されたフレームのシーン全体を構成するため、後で比率を変更することは、トリミングまたは再生成を意味します。プロンプトの残りの部分を調整する前に、これを選択してください。

比率は解像度ではありません

比率はピクセル数については何も語ません。 Midjourney のドキュメントでは、この点を直接述べています。アスペクト比は画像の寸法と同じではなく、最終的なサイズはバージョンとアップスケーラーによって異なります。 3:2 画像は小さくても大きくても構いません。画像がどこから見える形状と、その中で被写体がどのように座るべきかを決定し、解像度を別の問題として扱います。

正方形、1:1

この正方形はバランスが取れており静的であり、支配的な方向はありません。単一のオブジェクト、対称的な構図、中心にある被写体に適しており、多くのソーシャル プラットフォームが投稿やプロフィール画像に長年使用してきたフレームです。これは Midjourney のデフォルトでもあり、ドキュメントには画像が正方形で始まることが記載されています。正方形は、被写体が自然に横に広がる風景やグループのシーンには適していません。

クラシック写真、3:2 および 2:3

3:2 は 35 mm フィルムから受け継がれた伝統的な静止画比率であり、多くのカメラが今でもそれを使用しています。写真は人々が写真から連想する形状であるため、写真のプロンプトとしては自然な感じがします。横 3:2 は街路、インテリア、風景に適しています。縦 2:3 はポートレート、出入り口、高層ビルに適しており、Midjourney のドキュメントには、印刷された写真や額縁で一般的であると記載されています。

4:3 と 5:4

4:3 は元のテレビ比率であり、今でも多くのタブレットやほとんどのコンパクト デジタル カメラで使用されています。 3:2 よりもわずかに正方形で、被写体の上下に余裕が生まれます。 5:4 は再び正方形であり、大判および中判写真や 8 x 10 インチのプリントで一般的です。どちらも、ワイドフォーマットの強い水平方向の引っ張りのない、少し息抜きのスペースが必要なインテリアやポートレートに適しています。

ワイドスクリーン、16:9

16:9 はテレビとオンライン ビデオの標準比率です。 YouTube のヘルプセンターでは、これをコンピュータの標準のアスペクト比と説明しています。ワイドなフレームは、風景、都市景観、走行中の車、被写体を脇に置いた映画のようなシーンに適しています。これは、バナー、プレゼンテーション スライド、ビデオのサムネイルに最適です。広いフレーム内で小さくなってしまう単体の立ち絵には弱いです。

縦、9:16

9:16 は、同じ形を横にしたもので、直立した携帯電話の全画面です。 Midjourney のドキュメントには、これがソーシャル メディアのモバイル コンテンツに一般的であると記載されており、YouTube は、縦長の 9:16 ビデオがコンピュータ画面にパディングして表示される可能性があると述べています。立ち姿、高層建築、滝など、垂直のラインが強いものに似合います。意図的に作曲してください。 9:16 に押し込まれた水平方向のシーンは、通常、空と床に主題を失います。

フレームによって構図がどのように変化するか

フレームの幅が広いと、被写体を中心からずらし、視線を移動させるためのスペースが得られ、設定や三分割の余地が広がります。背の高いフレームは高さを強調し、前景から背景までのレイヤードを促します。プロンプト内の配置について言及します。「フレームの右 3 分の 1 に車があり、左から続く空き道」は、16:9 と 1:1 では大きく異なります。比率を変更する場合は、構成文章を読み直して調整してください。

Midjourneyでの比率の設定

Midjourney のドキュメントには、--ar パラメーター、またはその長い形式の --aspect がリストされており、プロンプトの最後にダッシュの前にスペースを入れて追加されます (例: 「夜明けの静かな港 --ar 16:9」)。数値は整数である必要があります。ドキュメントでは、小数は受け入れられず、1.39:1 ではなく 139:100 が推奨されており、1920:1080 などのピクセル サイズは 16:9 に簡略化されます。また、アップスケーリング時に一部の比率がわずかに変化すること、および極端に広い比率や高い比率は実験的なものであることにも注意してください。

OpenAIの画像モデルでサイズを設定する

OpenAI の画像生成ドキュメントでは、サイズが比率ではなくピクセル単位で説明されています。執筆時点では、推奨サイズとして正方形として 1024x1024、横長として 1536x1024、縦長として 1024x1536 がリストされており、自動オプションも付いています。新しいモデルについては、幅×高さで記述されるカスタム サイズについても説明されています。この場合、両方のエッジが 16 の倍数であり、長辺と短辺の比率が 3:1 以内である必要があります。 1536x1024 自体は 3:2 形状であることに注意してください。

Stable Diffusion およびその他のツール

Hugging Face diffusers ライブラリでは、Stable Diffusion テキストから画像へのパイプラインは、ピクセル単位で高さと幅の引数を受け入れます。原則はどこでも同じです。最初に形状を決定し、次にツールが要求するピクセルや比率を設定します。ツールがいくつかのサイズしか提供していない場合は、最も近いサイズを選択し、後でトリミングし、トリミングが被写体に食い込まないように、構図にマージンを残します。

複数のフォーマットを計画する

画像が複数の場所で使用される場合、たとえば、ワイド Web バナーや縦方向のストーリーなど、1 つの画像を生成して両方の方法でトリミングしても機能することはほとんどありません。両方の作物が生き残れるように中心となる主題の周囲に十分な空きスペースを設けて作曲するか、構成文を調整して同じプロンプトから各形式を個別に生成します。通常、2 番目のオプションの方が良い結果が得られ、時間も少しだけ長くなります。

簡単な選択方法

画像がどこに表示されるか、被写体がどのような形をしているかを尋ねます。単一のオブジェクトまたは中心にある対称的なシーンが正方形に適しています。写真のような感じの写真には、3:2 または 2:3 が適しています。広い風景やビデオフレームには 16:9 が適しています。携帯電話の全画面画像や背の高い被写体は 9:16 に適しています。明確に一方向を指すものが何もない場合、3:2 は他の形状に適切にトリミングできる安全な写真の開始点です。

LarpGPT が当てはまる場所

LarpGPT は、旅行、建築、車、ライフスタイル シーンの写真プロンプトのライブラリで、被写体、照明、レンズとともに各プロンプトに構図が書き込まれています。プロンプトをコピーし、そのフレームを必要な比率に調整し、既に使用している画像ジェネレーターでその比率を設定します。 LarpGPT はイメージを生成しないため、結果は試行ごとに異なります。

よくある質問

AI 画像に最適なアスペクト比はどれですか?

画像が見える場所や被写体の形状によって異なります。 3:2 は自然な写真のデフォルトで、16:9 は広いシーンやビデオに適しており、9:16 は全画面の携帯電話の画像に適しており、1:1 は中央に配置された単一の被写体に適しています。

Midjourney でアスペクト比を変更するにはどうすればよいですか?

Midjourney のドキュメントに従って、プロンプトの最後に --ar に続けて 2 つの整数を追加します (例: --ar 3:2)。小数は受け入れられず、デフォルトは正方形です。

OpenAI の画像モデルはどのサイズをサポートしていますか?

執筆時点では、OpenAI のドキュメントには、推奨サイズとして 1024x1024、1536x1024、および 1024x1536 と自動オプションがリストされており、設定された制限内での新しいモデルのカスタム サイズについて説明されています。

AI 画像を後で別の比率にトリミングできますか?

それは可能ですが、ある形状に合わせて作られた構図が、別の形状では主題を失ってしまうことがよくあります。中心となる主題の周りにスペースを残すか、構成文を調整して各フォーマットを個別に生成します。

参考情報

すべてのアプリ