GPT图像2.5提示指南:如何写出更好的图像提示
一个强大的GPT Image 2.5提示词是一份可读的生产规格说明。它说明了图像的用途、必须出现的内容、场景如何构图、外观应如何以及哪些内容不得更改。冗长的形容词列表不如可见的、可测试的指令有用。
OpenAI 的官方指南建议从预期结果开始,然后描述主体、构图、风格和限制条件。对于修改,请将请求的更改与受保护的细节分开。一次优化一个方面,并检查每个结果。
五部分提示结构
1. 目的
为交付物命名:电商主图、垂直动漫关键帧、编辑图表或透明抠图。明确用途有助于解决模棱两可的选择。
2. 主题
描述可见的身份、材质、服装、姿势和动作。优先选择“全身可见,包括脚部,低头看着打开的书”,而不是“充满活力的自信姿势”。
3. 组成
指定镜头尺寸、视角、相对位置和留白。摄影术语是视觉提示,而非精确光学模拟的保证。
4. 风格与灯光
命名媒介与具体外观:赛璐珞风格动画、无涂层纸张的编辑插画、写实影棚照片。描述光线的方向、色彩与柔和度。
5. 约束条件
列出所需文本、排除项和需保留的细节。约束条件应可观察:“一人”、“标签不变”、“无额外文本”、“透明背景”。
生成提示示例
用途:原创超自然动画短片9:16开场关键帧。 主题:一位年轻档案管理员,留着齐耳红褐色短发,戴着黑色圆框眼镜,身穿海军蓝工作外套。她手持一封带有红色蜡封月亮标志的密封纸信封。 构图:全身,可见双脚,低角度镜头。角色位于左侧三分之一处;身后是无尽延伸的档案架。右上角留出干净的暗色区域,供后续放置标题。 风格:精细手绘动漫背景,克制赛璐珞着色,自然比例。 灯光:一盏暖色台灯,映衬着高窗外清冷的蓝色月光。 限制:仅限一个角色。信封和徽章清晰可见。无文字、标志、水印、现代电子设备或发光眼睛。
使用API时,将模型、尺寸、质量和背景作为API参数设置,而不是将它们埋没在文字描述中。
## 编辑提示公式
用法:**变更 + 受保护详情 + 集成要求 + 排除项**。
```text
仅将角色海军工作外套更换为图2中的米色野战夹克。 保持她的面部特征、眼镜、发型、身材比例、姿势、手部动作、信封以及精确的画面构图。 将夹克与现有的月光、台灯阴影和身体几何形状相匹配。 不要改变背景、摄像机角度、蜡印或图像风格。不要添加文字、珠宝或水印。
审查整个输出。重复编辑可能会改变本应受保护的细节,因此在每一步都重新陈述关键锚点。
## 为参考图像分配角色
为每个输入编号并定义其任务:
```text
图片1:身份与姿势参考。 图片2:仅作服装参考。 图3:仅作灯光和色彩参考。
保留图像1的人物和构图。仅使用图像2替换服装。应用图像3中冷窗与暖灯的关系,但不复制其房间或物体。
这比“以此为灵感”更清晰,后者让模型自行决定哪些细节重要。
## 提示精确文本
将所需的文案放入引号中,并指明位置、字体样式和排除项:
```text
"最后的档案" 排版:紧凑大写无衬线字体,宽字距,白色。 位置:右上角留白区域,左对齐。 无字幕、演职员表、标志、水印或额外文字。
检查每个字符。官方文档指出,文本渲染仍可能存在问题,尤其是在小字号、信息密集或使用多种字体的情况下。对于关键业务文案,请在生成图像时预留空间,并在设计工具中添加最终排版。
## 角色一致性提示
在生成场景之前,先创建一个标准参考。定义一小套身份锚点:脸型、发型、眼睛颜色、身材比例、标志性服装和一个道具。重复使用已批准的图像作为参考,并重复这些锚点。
不要在每个提示中都塞满背景信息。只有视觉事实会影响图像。将场景状态——如雨、泥土、临时损坏——放在稳定的身份模块之后,这样它就不会取代标准设计。
## 选择 Sunburst 或 Flare
当速度至关重要时,请使用 Flare。当工作流程对质量或编辑有较高要求时,请使用 Sunburst。保持提示词、输入、尺寸和质量不变以进行比较。
不要因为提示词含糊就立即选择最高质量来弥补。首先要判断结果出错是因为指令不清晰,还是因为渲染保真度不足。
## 按故障类型进行故障排除
### 缺失对象
描述其位置、关系和可见性:“破碎的指南针在她的右手中,无障碍,面向镜头。”移除竞争物体。
### 错误的构图
降低场景复杂度。指定主体位置、画幅大小和留白空间。要求一个镜头概念,而非多个运镜或镜头。
### 身份漂移
使用已批准的参考,重复不可变锚点,请求一次更改,并明确保护面部、比例、发型和姿势。
### 不需要的文本
要求“无文字、字母、数字、标志、标识或水印。”检查可能引发标识的背景物体。
### 编辑改变一切
以“仅更改X”开头。列出保留的身份、几何形状、布局、光照和标签。如果某个区域必须保持像素一致,则在生成步骤之外将其合成。
### 提示词过长
移除背景故事和同义词。将需求整理成带标签的模块。一个可维护的提示比充满重复想法的诗意段落更容易调试。
## 有意识的迭代循环
1. 使用显式模型和质量生成基线。
2. 将结果与书面验收清单进行比较。
3. 识别一个失效类别。
4. 更改一条指令或参数。
5. 将批准的结果传递到下一轮编辑。
6. 记录已接受资产的提示和设置。
改变五个变量会让学习变得不可能。狭窄的迭代也会降低成功细节消失的可能性。
## 从静态图像到Elser动画
如果预期交付物是动画,请提示生成可用的关键帧:清晰的轮廓、可辨识的手部、简洁的前景、稳定的服装以及足够的动作空间。然后将已获得版权授权的图像用于动画工作流程,例如 [Elser AI](https://www.elser.ai/zh),在该流程中可继续完成角色、故事板、视频、音频和剪辑等步骤。
除非当前产品界面确认原生可用,否则不得声称 GPT Image 2.5 是在 Elser 内部生成的。请准确描述交接过程:该静态图像是使用 GPT Image 2.5 创建或编辑的,随后在支持的情况下导入 Elser 进行下游生产。
## 按使用场景分类的提示词模板
### 产品主图
```text
用途:可重复使用钢制水瓶的电商主图。 主题:保留图1中的瓶身几何形状、瓶盖、哑光鼠尾草色饰面及标签。 构图:在浅色石头上居中四分之三视角,上方留出充足空间,完整展示产品。 灯光:左上角大型柔光箱,可控接触阴影,真实反射。 限制:不得更改标签、不得有凹痕、液滴、手部、道具、文字或水印。
### 编辑示意图
定义少量带标签的元素、它们的层级结构和阅读顺序。如果精确的文案内容较多,可先生成视觉结构,然后在模型外部添加最终的排版。一个视觉上美观但事实模糊的图表并不算成功。
### 透明资产
提示词:一个孤立的居中主体,边缘清晰,无阴影或背景。在API中,同时设置透明背景和PNG/WebP格式。检查实际的Alpha通道数据。
### 电影级环境
指定地点、时间、天气、规模、前景/中景/背景以及叙事焦点。用空间关系替代模糊的“史诗”语言。
## 在提示前构建验收清单
在生成之前,先写出五到十条通过/失败要求。对于角色关键帧,这可能包括正确的眼睛颜色、可见的指南针、一个人物、无文字、清晰的右手握持和空白的标题空间。对照清单进行审查,而不是仅凭感觉判断图像是否良好。
记录已接受的提示词、模型、快照、参数和参考信息。这将成功的图像转化为可复用的配方,并使后续的偏差可诊断。
## 常见问题解答
### 更长的提示词能生成更好的图像吗?
不会自动进行。请包含有用的可见要求,并删除矛盾或不相关的细节。
### 参数应该放在提示词内部吗?
使用API时,通过其参数设置模型、质量、尺寸、格式和背景。使用提示词指定视觉内容和约束条件。
### 一个编辑请求应包含多少更改?
倾向于一次连贯的变更。窄小的编辑使故障更易诊断,受保护的细节更易审查。
### GPT Image 2.5 能否完美保持角色一致性?
它可以保留主语,但官方文档仍承认可能存在一致性问题。请使用参考资料,重复锚点并检查每个输出。
### 哪种模型最适合提示测试?
Flare 是通常以速度为首选的选择。在需要高质量或精确编辑的实际需求时,请使用 Sunburst。
## 结论
可靠的 GPT Image 2.5 提示应描述可交付成果,而非空想。明确目的、主体、构图、外观和约束条件。对于编辑,应准确说明哪些内容需更改、哪些保持不变。为每个引用指定角色,并每次只迭代一个变量。
模型固然重要,但提示的清晰度和审查的严谨性决定了有吸引力的生成结果能否成为可用的生产资产。




