要回答这个疑问,先要把“草图”定义清楚,并把“生成”分成两种入口:纯文本生成和图生图。当前 Qwen 系图像模型在主流部署环境下,通常同时提供文生图和参考图条件生成能力;但具体版本是否开放参考图输入,需要看调用环境或产品文档,而不是只看模型名字。
如果能用参考图输入,Qwen-Image-3.0 可以将线稿或草图作为结构约束,配合提示词补全光影、颜色和细节;但这不是自动脑补,草图层级乱、线与底色区分度低,输出稳定度会明显下降。建议先用小样本草图试跑,重点检查结构一致性和风格一致性,再决定是否进入正式流程。
先定位任务:是文生图、图生图还是局部编辑
你手头如果只有一句“画一个机器人草图”,那是标准文生图,模型自由发挥。如果你有一张实际线稿、白底产品图或粗糙涂鸦,那要确认模型是否允许把图片作为输入。同一个模型通常会用不同参数区分“整体重绘”和“局部修改”,用错入口会出现“模型完全没参考你的图”的情况。
- 纯文字描述草图:适合概念发散,结构控制弱,适合最初期灵感。
- 线稿/白底图作为参考:结构可控,适合保留构图的完整图像生成。
- 局部遮罩编辑:只重绘选中区域,适合在已有草图上改局部,不改变整体。
如果支持参考图,请求骨架怎么搭
不同服务商接口不完全相同,但多数支持图片输入的图像模型请求里会有 image 和 prompt 字段。可以先用下面的 JSON 做连通性测试,确认你的环境是否真的支持参考图。下面是一个“通用接入骨架”,endpoint 和鉴权方式以实际环境为准。
{
"model": "qwen-image-3.0",
"prompt": "根据这张线稿生成完整彩图:卡通风格,暖黄灯光,细节丰富",
"image": "data:image/png;base64,<草图的base64内容>",
"size": "1024x1024",
"response_format": "url"
}
如果接口返回“image 不是合法参数”或“不允许该字段”,说明当前部署不支持参考图输入,只能走文生图。如果返回图片 URL,说明草图输入已生效。
三个提示词版本,拿来直接试
提示词决定最终风格和细节完成度。同一个草图,建议至少试三个版本,不要只跑一次就下结论。
- A版(干净线稿,风格自由):把这张线稿完整渲染为彩色插画,保留原始构图和物体轮廓,添加柔和光影和自然材质,背景简洁,不要改变主体结构。
- B版(粗糙涂鸦,需要产品级输出):这是产品设计草图,请根据黑色线条生成真实感产品渲染图,白色背景,顶部光照,注意边缘抗锯齿,不要使用卡通风格。
- C版(需要局部扩展):保留图中左侧建筑轮廓,扩展为完整街景,补全天空、道路和树木,光线为下午自然光,透视与现有草图一致。
如果模型支持 negative_prompt,建议统一加上:低分辨率、线条模糊、多余物体、结构变形。如果不支持,就在 prompt 末尾写明“不要改变轮廓,不要增加无关物体”。
验证清单与风险边界
不要看第一次生成图是否惊艳,要看同一个草图跑 3-5 次后是否稳定。下面这个清单可以直接用来做判断。
- 结构一致性:主体轮廓是否和草图一致,有没有出现多手指、多窗户、线条被重新解释成其他物体。
- 风格一致性:同一批草图用同一条提示词,是否出现完全不同的画风;如果风格漂移大,说明提示词对风格约束不足。
- 输入干扰:草图底色、手写注释、杂线是否自动被去掉;如果被画进画面,需要先在图像软件里清理草图。
- 尺寸与接口:同一提示词在不同尺寸下是否截断构图;同一草图用文生图接口和图生图接口,结果差异有多大。
- 能力边界:草图生成通常适合插画、概念图、产品渲染初稿;但“把流程草图直接转成可开发的 UI 设计稿”这类任务,模型只能给视觉参考,不能保证细节规范。
常见问题
草图很乱,模型总把杂线画进去,怎么办?
先对草图做二值化或重新描一遍,去掉阴影和注释;提示词中写明“白底、黑线、干净线稿”。如果部署环境有预处理参数,可以先开启边缘检测再送入模型。
生成结果不按草图构图,是不是模型不支持?
先检查请求体里 image 字段是否真的传了草图,而不是只有 prompt 文本。其次确认当前调用的是图生图接口,而不是文生图接口。如果两者都对,再提高提示词中对位置和比例的约束,比如“保持物体之间距离不变”。