很多人写提示词时,一上来就堆一大串形容词,最后画面还是不太听话。FLUX.2更适合用清楚的自然语言,把最重要的内容放在前面,再一点点补充细节。记住下面这套顺序,写起来会轻松很多。
先搭好四要素骨架
一条提示词可以先按“主体、动作、风格、场景”来写。主体说清楚画面中心是谁或是什么,动作说明它在做什么,风格决定画面的媒介和审美,场景补充环境、光线、时间和氛围。
词序也有影响。建议按核心主体、关键动作、核心风格、必要场景、次要细节排列。真正不能丢的内容放在最前面,别让一堆装饰词把重点挤到后面。

提示词不用越长越好
10到30词适合快速试想法,30到80词能覆盖大多数创作,80词以上适合复杂场景和精细规格。刚开始可以先写中等长度,画面方向稳定后,再补镜头、材质、颜色和环境细节。
不同场景要换写法
写实画面
只写“专业照片”通常太泛。想要年代感或特定摄影效果,可以补上相机、镜头、胶片和拍摄方式,例如 Shot on Fujifilm X-T5, 35mm f/1.4,或者写明 early digital camera, slight noise, flash photography, candid。
画面里的文字
需要生成文字时,用英文引号标出具体内容,再说明它放在哪里、是什么字体、字号多大。比如:The text 'OPEN' appears in red neon letters above the door。品牌字样还可以绑定十六进制色号,例如 the logo text 'ACME' in color #FF5733。
颜色和信息图
色号要和具体物体绑定。a vintage illustration of an apple in color #0047AB比“用蓝色”更明确。渐变要写清起点、终点和方向;信息图则要交代图表类型、标题、分栏、数据、图标、配色和整体风格。元素很多时,可以用 JSON 结构分别写明主体、颜色、位置、风格和光线。
多语言和连续画面
有地域文化的场景,尽量用当地语言写提示词,建筑、街道和生活细节会更贴近语境。漫画分镜或连续艺术要逐镜生成,并固定人物年龄、肤色、发型、五官、服装和标志性元素。每个分镜都重复这些核心描述,角色才不容易越画越变。

复杂需求再用进阶方法
JSON 适合多元素画面、批量生成和需要精确控制的项目。多参考图融合时,要说清每张图负责什么,比如主体来自图1、风格来自图2、背景来自图3。需要快速扩写时,可以开启 prompt_upsampling,让模型在保留原意的基础上补充画面细节。
别忽略画幅和参数
尺寸要按使用场景选,且输出宽高应为16的倍数。1:1适合社交媒体和产品图,16:9适合风景和电影感画面,9:16适合移动端和人像,4:3适合杂志和演示文稿,21:9适合全景。分辨率最低64×64,最高4MP,日常创作一般控制在2MP以内更方便。
想复现结果,可以写 seed: 42。Flex 版本可设置 guidance: 4.5 和 steps: 50,guidance常用范围为1.5到10,steps最多50步,具体还要看速度和质量的取舍。

最后记住三个避坑点
- FLUX.2不使用负面提示词,直接用正向语言描述你想要的结果。
- 想要清晰画面,写
sharp focus throughout,不要只写no blur。 - 想要空场景,写
empty scene,不要写no people。
提示词的重点从来不是把句子写得玄乎,而是让模型知道画面里有什么、它们怎么排列、整体要呈现什么感觉。先用简单结构跑通,再逐步增加控制项,通常比一开始写满一整页更容易得到稳定结果。需要批量制作商业图片时,也可以了解AI图像生成服务的实际交付方式。
附件:FLUX.2 提示词撰写核心规则总结
基于官方文档,FLUX.2 提示词撰写以「结构可控、精准正向、场景适配」为核心,完整规则分为基础框架、分场景专项规则、进阶技巧、格式参数规范、最佳实践与避坑准则五大模块,具体如下:
一、基础提示词核心框架与优先级
这是保证生成效果稳定的底层规则,必须严格遵循。
四要素固定结构:统一使用 主体 (Subject)+ 动作 (Action)+ 风格 (Style)+ 场景 (Context) 框架撰写
主体:画面核心焦点(人物、物品、角色等)
动作:主体的行为、姿态
风格:艺术手法、媒介、审美调性
场景:环境、光线、时间、氛围、画面情绪
词序与权重规则:FLUX.2 对前置内容关注度更高,必须按优先级排序,核心需求放在最开头
优先级顺序:核心主体 → 关键动作 → 核心风格 → 必要场景 → 次要细节
长度规范
短提示词(10-30 词):快速概念验证、风格探索
中提示词(30-80 词):绝大多数创作场景的最优选择
长提示词(80 词以上):复杂场景、多元素精细化规格要求
二、分场景专项撰写规则
1. 写实风格(Photorealism)撰写规则
核心逻辑:通过自然语言即可生成基础写实效果,差异化风格需明确指定年代、相机型号、镜头参数、胶片类型、拍摄技法。
官方标准化风格模板
2000 年代数码相机:early digital camera, slight noise, flash photography, candid, 2000s digicam style
80 年代复古胶片:film grain, warm color cast, soft focus, 80s vintage photo
进阶技巧:精准标注硬件参数,例:Shot on Fujifilm X-T5, 35mm f/1.4,效果远优于泛泛的「专业照片」描述。
2. 文字排版(Typography)专项规则
核心原则:清晰、具象地描述文本信息,才能生成可读、精准的文字内容,关键要点如下:
用英文引号标注目标文本内容,例:The text ‘OPEN’ appears in red neon letters above the door
明确指定文本的摆放位置(相对其他元素的方位)
详细描述字体风格,例:elegant serif typography、bold industrial lettering、handwritten script
标注字号规格,例:large headline text、small body copy、medium subheading
品牌类文本推荐用十六进制色号精准定色,例:The logo text ‘ACME’ in color #FF5733
3. 精准色彩控制(HEX 色号)撰写规则
基础语法:用color/hex关键词 + 色号,必须将色号与具体物体强绑定,禁止模糊表述
正确示例:a vintage illustration of an apple in color #0047AB
错误示例:use #FF0000 somewhere
渐变色彩撰写:明确指定渐变起止位置、起止色号,支持线性、径向、多段渐变
线性渐变示例:the color of the vase is a gradient, starting with color #02eb3c and finishing with color #edfa3c
径向渐变示例:radial gradient from rich purple (#6A0DAD) at the center fading outward to warm gold (#FFD700) at the edges
多段渐变示例:分区域指定Upper sky/Middle sky/Horizon glow对应的色号,实现平滑色彩过渡
结构化色彩控制:支持 JSON 格式提示词,为不同物体分别指定色号数组,实现多元素精准色彩匹配。
4. 信息图表与数据可视化撰写规则
支持 JSON 结构化模板,核心字段:type、title、subtitle、sections(含heading/content/visual)、color_scheme、style
自然语言撰写要点:明确图表类型、标题、分栏数量、统计内容、图标类型、配色方案、整体风格,示例:
Create a vertical infographic about coffee consumption worldwide. Title: ‘Global Coffee Culture’. Include 3 sections with statistics, use icons for each country, color scheme #4A2C2A (brown) and #F5E6D3 (cream). Modern minimalist style with clean typography.
5. 多语言提示词规则
FLUX.2 支持多语言理解,使用目标场景的母语撰写提示词,能获得更地道、符合当地文化的生成效果。
示例:用法语写诺曼底乡村集市、泰语写曼谷近郊早市、韩语写首尔市中心屋顶花园,可精准还原当地建筑、氛围、人文细节。
6. 漫画分镜与连续艺术撰写规则
核心原则:分镜单独生成,人物核心描述全程保持高度一致,保证角色连贯性。
关键撰写技巧:
每个分镜都固定人物核心特征:年龄、肤色、发型、五官、核心服饰、标志性元素,全程重复这些细节;
每个分镜明确标注:统一的风格、角色描述、场景、台词文本、画面情绪、色调;
按剧情拆分分镜,逐个生成,保证叙事和角色的一致性。
三、进阶提示词技巧
JSON 结构化提示词
适用场景:复杂多元素场景、自动化批量生成、极致精准控制需求
核心逻辑:可定义scene、subjects(含每个主体的 description、colors、position)、style、lighting等字段,实现颗粒度极细的画面控制。
多参考图融合提示词
适用场景:时尚穿搭、室内设计、产品合成、角色一致性保持
撰写要点:清晰描述每张参考图的作用,例:主体来自图1、风格来自图2、背景来自图3,模型会按描述精准融合参考元素。
提示词上采样(Prompt Upsampling)
适用场景:快速迭代、创意变体探索、基础概念扩写
使用方法:开启prompt_upsampling参数,模型会在保留原始创作意图的前提下,自动补充细节、丰富画面元素,无需手动撰写冗长提示词。
四、画幅、分辨率与参数规范
宽高比选择规则:按使用场景匹配对应比例,所有输出尺寸必须是 16 的倍数
| 宽高比 | 核心适用场景 | 参考尺寸 |
|---|---|---|
| 1:1(方形) | 社交媒体、产品图 | 1024×1024、1536×1536 |
| 16:9(宽屏) | 风景、电影感镜头 | 1920×1080、1536×864 |
| 9:16(竖屏) | 移动端内容、人像 | 1080×1920、864×1536 |
| 4:3(经典) | 杂志排版、演示文稿 | 1536×1152、1024×768 |
| 21:9(超宽屏) | 全景、大场景 | 2048×864 |
分辨率规范:最小 64×64,最大 4MP(如 2048×2048),绝大多数场景推荐 2MP 以内的分辨率。
核心参数标注规范
种子数(Seed):标注seed: 数字,实现可复现的生成结果
引导度(Guidance,仅 flex 版):标注guidance: 4.5,推荐范围 1.5-10,数值越高提示词贴合度越强
步数(Steps,仅 flex 版):标注steps: 50,最大 50 步,平衡生成质量与速度
五、核心最佳实践与避坑准则
结构控制:从简单提示词起步,逐步增加复杂度;极致控制需求优先使用 JSON 结构化提示词。
色彩控制:永远将十六进制色号与具体物体绑定,避免模糊的色彩描述。
正向描述优先:FLUX.2 不支持负面提示词,必须用正向表述描述想要的效果,而非禁止的内容
正确示例:sharp focus throughout(全程清晰对焦),而非no blur(不要模糊)
正确示例:empty scene(空场景),而非no people(不要有人)
风格参考:写实类内容优先指定相机、镜头、胶片型号,年代风格明确标注对应时期关键词。
文化适配:对应地域 / 文化的场景,使用当地母语撰写提示词,提升还原度。
多参考图使用:清晰定义每张参考图的作用,避免模糊的融合指令。