# 逼真图像提示的剖析

Canonical: https://romeoapps.app/zh-Hans/larpgpt/anatomy-of-a-photo-prompt/
Author: Roméo Gambino · Published: 2026-09-08 · Updated: 2026-09-08 · App: LarpGPT (https://romeoapps.app/zh-Hans/larpgpt/)

提示的每个部分在图像生成器中的作用是什么，为什么每个决定一个句子比一堵形容词更有效，以及如何在不破坏提示功能的情况下调整提示。

## 提示是简短的，而不是咒语

关于图像提示最持久的误解是某些单词具有魔力，而工作就是收集它们。真正有效的方法更接近于向无法提问的摄影师介绍情况。您正在描述一个必须有人设置、照明和拍摄的场景，您未说明的每一个决定都是模型为您做出的决定，通常是针对您所要求的最平均版本。


## 每个决定一句话

长提示之所以失败，不是因为它们太长，而是因为它们没有区别。一句话中的二十个形容词相互竞争，模型对它们进行平均。将相同的内容分成短句，每个短句都包含一个决定，从而产生更可预测的结果。它还使提示可以编辑，因为当出现问题时您可以看到要更改哪个句子。


## 主题是第一位的，也是最有分量的

立场很重要。提示中较早出现的内容通常权重较大，因此该主题属于前面，具体描述。具体的主题是你可以拍摄的主题：一个物体、一个地方、一个具有物理属性的情况。抽象主题没有给模型提供任何可以构建的东西，它会发明一些通用的东西来填充空间。


## 描述可见的内容，而不是感觉到的内容

这是最有用的学科。像忧郁这样的词是一种解释，模型必须猜测是哪种视觉排列产生的。窗户上的雨、一盏亮着的灯、一把空椅子：这些都是相机记录的东西。写出原因而不是结果，结果会自行出现，并且更加一致。


## 场景设定约束

布置不是装饰。它决定了可用的光线、反射光线的表面、背景中可以出现的内容以及所有内容的读取比例。详细描述但没有指定设置的主题将被放置在通用的地方，然后通用设置将与您对该主题所做的一半选择相矛盾。


## 这一刻将场景缩小为照片

一天中的时间、天气和季节的作用比大多数人预期的要多，因为每个时间、天气和季节都带有完整的照明设置。秋天的午后意味着低矮的温暖阳光、长长的阴影和特殊的色偏，这一切都来自四个词。在大多数提示中，命名时刻是最有效的句子。


## 光是一个决定，而不是事后的想法

照片主要是由光组成的，而未说明的照明选择是获得看起来合成的平坦、光线均匀的图像的最快途径。说出光从哪里来以及它是什么类型的。窗户的光从左边射过来。单一开销来源。阴天。阳光直射透过树叶。每个都会从相同的主题和场景产生不同的图像。


## 硬光和柔光有不同的作用

来自小光源或远光源的光线很硬：阴影边缘清晰、对比度高、纹理可见。来自大光源或漫射光源的光线柔和：渐变阴影、低对比度、柔和的表面。与任何有关情绪的形容词相比，命名您想要的图像可以让模型更多地了解图像的情绪。


## 模型可以遵循的构图说明

框架术语很有用，因为它们是明确的。特写、广角镜头、视线水平、低角度、头顶。拍摄对象是否位于中央或偏向一侧。前面是什么，后面是什么。这些是摄影师在片场会使用的词语，它们的翻译很干净，因为它们描述的是几何形状而不是品味。


## 镜头语言及其实际作用

宽焦距会夸大深度并使附近的物体变大。长焦距会压缩距离并使图层变平。大光圈会使背景失焦并孤立主体。这些术语在提示中起作用，因为它们对应于真实的光学行为，并且要求浅景深比要求模糊背景更精确。


## 色彩，内敛

命名两种或三种颜色会产生连贯的图像。命名八个会产生混乱，因为模型试图包含所有它们，但没有一个占主导地位。如果颜色很重要，请将其附加到一个物体上，而不是整个图片上：红色的门比红色场景更容易阅读，并且它使调色板的其余部分可以自由地跟随光线。


## 一次改变一件事

当结果接近但错误时，本能地会重写提示。抵制它。改一句话，重生，看看感动了什么。每次尝试速度较慢，但总体速度要快得多，因为您了解每个句子的作用。重写的有效提示不会告诉你明天可以重复使用的内容。


## 保留您丢弃的版本

产生一些有趣但不是您想要的内容的提示值得保留。提示库是根据这些而不是根据成功建立的，因为当下一个简报略有不同时，你会适应那些未遂事件。关于结果实际情况的注释比单独的提示更有价值。


## 在不破坏结构的情况下进行调整

当您重复使用提示时，请交换主题和设置，并首先保留灯光、构图和镜头句子。这些部分使图像看起来像照片一样，当提示太长时，人们就会删除它们。一旦新的主题开始发挥作用，就有意地改变它们，一次一个。


## 说说图片是什么

以这种方式制作的图像不是照片，并且这样说的标准已经存在。 IPTC 数字源类型词汇表提供了区分从现实生活中采样的数字捕获与使用生成式 AI 创建的媒体的值，C2PA 规范定义了来源信息如何随文件传输。如果图像可能被用来记录真实的事物，请对其进行标记。 LarpGPT 提供提示和参考资料，您生成的内容由您使用并由您公开。


## 常见问题

### 为什么长图提示经常失败？

因为它们没有区别，而不是因为它们很长。一句话中的 20 个形容词相互竞争，模型对它们进行平均。将相同的内容分成简短的句子，每个句子包含一个决定，结果变得更加可预测。

### 我应该描述心情还是可见的东西？

什么是可见的。像 melancholic 这样的词是模型必须猜测的解释。窗户上的雨、一盏亮着的灯、一张空椅子都是相机记录的东西。写出原因，心情随之而来。

### 提示中的单词顺序重要吗？

是的。较早出现的内容通常权重较大，因此该主题属于靠近前面的位置，描述得足够具体，以便您可以拍摄它。

### 像焦距这样的相机术语真的有用吗？

它们确实如此，因为它们对应于真实的光学行为。宽焦距会夸大深度，长焦距会压缩深度，大光圈会隔离拍摄对象。要求浅景深比要求模糊背景更精确。

### 我应该如何标记人工智能生成的图像？

标准是存在的。 IPTC 数字源类型词汇将现实生活中采样的数字捕获与使用生成式 AI 创建的媒体区分开来，C2PA 规范定义了文件的来源如何传输。给任何可能被用来记录真实事物的东西贴上标签。

## 延伸阅读

- IPTC Digital Source Type NewsCodes — https://cv.iptc.org/newscodes/digitalsourcetype/
- C2PA technical specification — https://c2pa.org/specifications/specifications/2.1/index.html
- IPTC Photo Metadata Standard — https://www.iptc.org/std/photometadata/specification/IPTC-PhotoMetadata

