用 DALL·E 4 做内容配图,先把画面叙事拆成角色、动作、场景

文章导读
写文章配图时,提示词生成得跟段落不贴,通常不是模型能力问题,而是起点错了:很多人从“孤独”“温暖”“科技感”这类情绪主题出发,把形容词直接丢给 DALL·E 4,模型只能自己补人物、补场景、补光线。更稳的做法是先回到段落本身,把要画的那一句拆成角色、动作、场景三块可观察的内容,再翻译成短句提示词。下面给的三要素拆分表、句式骨架和回写对照表,可以直接套在自己的稿子上先跑一轮,再按出图结果逐词修改。
📋 目录
  1. 从文章段落里标出角色、动作、场景
  2. 把三要素排成 DALL·E 4 可读的短句
  3. 同一叙事换画幅与视角做对照
  4. 按出图结果回写提示词差异
A A

写文章配图时,提示词生成得跟段落不贴,通常不是模型能力问题,而是起点错了:很多人从“孤独”“温暖”“科技感”这类情绪主题出发,把形容词直接丢给 DALL·E 4,模型只能自己补人物、补场景、补光线。更稳的做法是先回到段落本身,把要画的那一句拆成角色、动作、场景三块可观察的内容,再翻译成短句提示词。下面给的三要素拆分表、句式骨架和回写对照表,可以直接套在自己的稿子上先跑一轮,再按出图结果逐词修改。

适用场景:正文段落需要一到三张主体和情绪都贴合的配图。操作动作:从段落里圈出角色、动作、场景,各写少量可观察词,再按“主体+动作+环境+镜头”排成短句。验证方式:固定叙事,只改画幅比例或镜头距离,对比主体占比、留白位置和背景细节是否变化。风险边界:提示词能约束主体和构图方向,无法保证风格、手部、画面内文字一次到位,仍要人工筛选和局部重写。

从文章段落里标出角色、动作、场景

先选一段有具体画面的文字,不要用整篇的抽象主旨。下面这段是常见的叙事型段落,可以直接拿来练手:

“凌晨的旧仓库里,一个背着帆布包的年轻人蹲在地上,把散落的信件一封封码进木箱。”

把它拆成三列,每一列只写能在图里看得见的内容。形容词可以留,但必须挂在具体物件或姿态上,否则模型无法落地:

要素从段落里取出的内容可观察词(提示词素材)
角色年轻人、背着帆布包young adult, canvas satchel, worn jacket, short hair
动作蹲在地上、一封封码放信件crouching, stacking letters, both hands on paper, neat piles
场景凌晨、旧仓库、木箱dim warehouse interior, pre-dawn light, wooden crate, dust in the air

拆的时候守两条:一是每格不超过五个词,词多了模型会自行取舍;二是场景词只留能影响光线的项,比如“凌晨”“仓库”,像“破旧”“有故事感”这种判断词先不写,它们不会改变画面,只会稀释主体权重。拆完先自己读一遍,如果三格里任意一格能对应到画面上的具体位置,这段就够用了。

用 DALL·E 4 做内容配图,先把画面叙事拆成角色、动作、场景

把三要素排成 DALL·E 4 可读的短句

三栏素材直接堆成一句长串,模型容易漏项。建议按固定骨架拼装,顺序决定权重,靠前的部分更容易被保留:

主体 + 动作 + 环境 + 镜头

[who]            a young adult with a canvas satchel
[doing what]     crouching and stacking faded letters into a wooden crate
[where / light]  dim warehouse interior, pre-dawn light, dust in the air
[shot]           medium shot, eye-level, 35mm feel, no text

占位词替换规则很简单:主体写成“人/物 + 一个识别特征”,动作写成“动词 + 受作用的对象”,环境写成“地点 + 光源”,镜头单独放最后。镜头行是唯一允许放“medium shot”“close-up”“top-down”这类构图词的位置,这样后面做画幅对照时,只动最后一行,叙事部分保持不动。

还需要一个可复核的检查环节:把拼好的提示词反读一遍,逐句问“这句话在画面里对应什么位置”。如果某句找不到落点,比如“充满希望的氛围”,就删掉,换成能落地的物件或光线,比如“warm desk lamp”“open window with morning light”。这一步能在出图前过滤掉大半偏题。

用 DALL·E 4 做内容配图,先把画面叙事拆成角色、动作、场景

同一叙事换画幅与视角做对照

出图偏题时,先分清是叙事缺失还是构图参数问题。做法是锁定前三行叙事文字一个字不改,只改比例和镜头距离,一次只动一处,其余全部复制,然后记录差异:

只改这一处提示词片段观察记录(自己填)
画幅:横16:9, wide shot主体占比、左右留白位置
画幅:方1:1, medium shot主体是否居中、背景是否被裁切
画幅:竖9:16, full body shot上下留白是否够放标题
距离:近close-up on hands and letters手部与信件是否成为主体

记录时只看可观察项:主体在画面中的占比、留白落在哪一侧、有没有自动多出无关人物、背景元素是否抢主体。如果换完比例和距离,主体依然是你要的那个人和那个动作,说明叙事部分是对的,剩下的只是选图;如果换了镜头距离后主体变了,问题在角色和动作写得太宽,要回到第一张表把词收窄,而不是继续加形容词。

按出图结果回写提示词差异

挑一张基本可用的图,把它对应的提示词存下来,然后做增删对照,把有效的写法沉淀成模板。下面是同一段叙事的前后差异:

# 改前
an artist, painting, in a studio, cinematic lighting, masterpiece

# 改后
a mid-30s ceramic artist kneeling at a low wheel,
shaping a bowl with both hands,
small studio at night, single warm desk lamp, clay dust on the floor,
medium shot, slight top-down angle, no text
改动通常带来的画面变化
cinematic lighting、masterpiece空泛风格词减少,模型开始依赖具体光源,光线位置更明确
both hands手部动作成为可见主体,不再只是“在画”这种笼统状态
kneeling at a low wheel身体姿态与道具的空间关系被确定
single warm desk lamp光源数量收敛,明暗对比更集中
在主体后堆叠多个形容词角色识别特征更稳定,不容易中途换人

回写时一次只改一到两个词,改完立刻再生成,否则无法判断是哪个词起了作用。记录表里保留“原句—改动—结果”三列,攒到五到十条之后,属于自己稿件的角色库、光源库和镜头库就基本成形了,新段落配图时可以直接调用,不必每次从主题词重新推。需要说明的是,同一批提示词在不同账号、不同时段生成的结果可能有差异,模板应作为起点而不是固定答案。