用外部 LLM 做设计决策的 Qwen Image 2.1 提示词模板实测
作者测试了一套面向视觉决策的提示词模板,先用外部 LLM 把实际图像需求转成包含构图、层级、字体与版式决策的结构化提示词,再交给 Qwen Image 2.1 生成,并与多个闭源图像模型对比最终设计结果和使用体验。
作者测试了一套面向视觉决策的提示词模板,先用外部 LLM 把实际图像需求转成包含构图、层级、字体与版式决策的结构化提示词,再交给 Qwen Image 2.1 生成,并与多个闭源图像模型对比最终设计结果和使用体验。
一位 ComfyUI 用户分享用 MiniMax H3 制作短片的流程:让 Claude 写带时间轴的脚本提示词,用 Qwen 2.1 生成角色设定图,以尾帧截图作参考统一场景氛围,必要时在 Blender 搭简单 blockout 场景。
一名 ComfyUI Cloud 新手在 r/comfyui 求助,希望用 Pinterest 真人照片作姿势/构图参考、自己的真实照片作身份参考,生成保留本人面部、发型和真实比例且带真实皮肤质感的照片,而非粗糙换脸或 AI 磨皮感。
ComfyUI 用户 No-Bad-4838 分享了一个名为 Krea2 Enhancer 的自定义节点,在纯 turbo 模型 8 步、不使用 LoRA 的情况下,提示词跟随和画质均有明显提升。
Scumble 是一款免费开源(GPL-3.0)的局部重绘编辑器,已开放下载,支持涂抹或输入名称(如 sky、shirt)选择区域后写一行提示词生成。每次结果作为独立图层返回,原图不被改动,只有选区外框送入模型再按全分辨率拼回,并支持逐图层色彩匹配。
作者在 r/comfyui 分享了一套角色设定表工作流,基于他人原始工作流修改,去掉了本地 LLM 节点,改为把一张参考图交给 Qwen chat 等 LLM,配合固定指令生成设定表提示词,再导入工作流出图。
Gradio 内置的 gr.Workflow 把多步 AI 流水线变成可拖拽的节点画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点类型、并行 fan-out 用法与 REST 端点示例,读者可据此判断能否把多步生成流程搬进 Gradio。
fal 团队基于 1000 次以上测试生成,给出 Seedream 5.0 Lite 的提示词结构 Subject > Setting > Style > Lighting > Technical,并称该模型会先对提示词做多步推理再出图。
推荐理由:作者基于上千次测试给出 Seedream 5.0 Lite 的提示词结构与编辑用法,可迁移到自己的出图流程。