ComfyUI Cloud 新手求助:如何用参考图把 Pinterest 照片里的人换成自己并分别控制姿势与背景
一名 ComfyUI Cloud 新手在 r/comfyui 求助,希望用 Pinterest 真人照片作姿势/构图参考、自己的真实照片作身份参考,生成保留本人面部、发型和真实比例且带真实皮肤质感的照片,而非粗糙换脸或 AI 磨皮感。
一名 ComfyUI Cloud 新手在 r/comfyui 求助,希望用 Pinterest 真人照片作姿势/构图参考、自己的真实照片作身份参考,生成保留本人面部、发型和真实比例且带真实皮肤质感的照片,而非粗糙换脸或 AI 磨皮感。
ComfyUI 用户 No-Bad-4838 分享了一个名为 Krea2 Enhancer 的自定义节点,在纯 turbo 模型 8 步、不使用 LoRA 的情况下,提示词跟随和画质均有明显提升。
MiniMax-H3-Character-Swap-LoRA 的 1000 步最终版已发布,并配套 REF2VA 工作流,可输入源视频与单张角色设定图完成角色替换,同时保留其余画面元素并迁移设定图的渲染风格,无需触发词,但近景面部表情常无法跟随。
Scumble 是一款免费开源(GPL-3.0)的局部重绘编辑器,已开放下载,支持涂抹或输入名称(如 sky、shirt)选择区域后写一行提示词生成。每次结果作为独立图层返回,原图不被改动,只有选区外框送入模型再按全分辨率拼回,并支持逐图层色彩匹配。
作者在 r/comfyui 分享了一套角色设定表工作流,基于他人原始工作流修改,去掉了本地 LLM 节点,改为把一张参考图交给 Qwen chat 等 LLM,配合固定指令生成设定表提示词,再导入工作流出图。
作者在 ComfyUI 中把 SeedVR2 的 VAE Encoder 跑通到 TensorRT,发布 ComfyUI-SeedVR2-VideoUpscaler-with-TensorRT v1.5.5,v1.5.4 修复了 TensorRT VAE Decoder 左上角伪影。
Comfy 官方发布 Comfy Router,用一个 API 接入前沿图像、视频、3D 和音频模型,模型字符串和参数保持不变,无需新 SDK、新密钥或重新部署。
Comfy Router 已在 Comfy Developer Platform 上线,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,首日接入 Seedance 2.5、MiniMax H3、Nano Banana Pro、GPT Image 2、Kling 和 Black Forest Labs。
推荐理由:Comfy Router 把多家供应商的前沿图像、视频、3D、音频模型收进一个 API,读者可据此判断多供应商切换与排队重试是否适合自己的调用场景。
ComfyUI 官方博客介绍 MiniMax H3 视频 VAE 的提速更新,编码最高约快 2.2 倍、解码快约 1.4-2.7 倍,1344x768、129 帧的编解码往返从 24.3 秒降到 12.7 秒。
推荐理由:原文给出 MiniMax H3 视频 VAE 在 ComfyUI 中的提速幅度、开启方式和画质数据,读者可据此判断是否值得升级。
ComfyUI 发布 v0.37.0,新增 Qwen-Image 2.1、MoGe 3 和 Meshy 7.1 支持,并为 GPT Image 2 加入透明背景功能。该版本在磁盘性能足够时自动启用 --fast-disk,动态显存下文本编码器常驻 GPU,同时为 YuE2 音乐生成节点加入 CFG 控制。
阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。
推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成。
推荐理由:原文完整拆解了 Workflow1111 的十一条管线与节点构成,可对照 ComfyUI 判断这类画布工作流的适用边界。
ComfyUI 推出 Forward Deployed Creative(FDCT)企业服务,由 Comfy 专家嵌入企业团队,在客户自己的 Comfy Enterprise 环境中用其模型与素材构建工作流。服务分 Validate、Build、Enable、Own 四步,并以团队能否自行修改工作流而非只会点“run”来衡量赋能效果。工作流最终交付归企业所有,FDCT 支持线在企业协议下保持开放。
ComfyUI 公布 Comfy × MiniMax H3 Sync Sound Challenge 获奖名单,要求音视频在同一次生成中产出、不得后期配音。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic 视频理解,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:原文给出该功能在三个 Gemini 模型上的 token、成本与准确率变化区间,并说明 API 开启方式,便于开发者判断是否接入。
Gemini Omni 1.1 Flash 通过 Partner Nodes 接入 ComfyUI,在 Gemini Video Omni 节点中可选 Omni Flash 1.1,单个节点覆盖文生视频、图生视频、参考生视频、视频编辑和场景延展。
推荐理由:原文给出 Gemini Omni 1.1 Flash 在 ComfyUI 节点中的任务类型、分辨率档位与提示词写法,可据此判断能否接入现有工作流。
Comfy 宣布成为 MiniMax H3 商用许可的首个官方转售方,用户可通过 Comfy 获取本地商用授权。许可包含输出内容的完整商用权利、微调与 LoRA 训练、客户及下游项目使用,并覆盖 MiniMax 的音频与音乐模型;分 Professional 和 Enterprise 两档,Enterprise 可使用包括未蒸馏权重在内的全部 H3 模型版本。
阿里最新视频生成模型 Wan 3.0 已在 ComfyUI 上线,可一次生成最长 30 秒视频,无需拼接。提示词输入扩展到 20000 字符,参考素材上限提升到 10 张图片、5 段视频和 5 段音频,并支持网页与文档解析,参考素材通过 @Image1、@Video2 等 @ 语法在提示词中指定用途。
推荐理由:原文列出 Wan 3.0 在 ComfyUI 中的原生 30 秒时长、参考素材上限与分辨率档位,便于判断它能否直接接入现有工作流。
Gradio 内置的 gr.Workflow 把多步 AI 流水线变成可拖拽的节点画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点类型、并行 fan-out 用法与 REST 端点示例,读者可据此判断能否把多步生成流程搬进 Gradio。
ComfyUI 与 MiniMax 联合发起 H3 Sync Sound 社区挑战赛,要求参赛者用 MiniMax H3 在同一次生成中同时产出视频与同步音频,禁止后期拼接独立音轨。
ComfyUI 开源本地版 Comfy MCP,用户可将 Claude、Codex、Cursor 等智能体连接到本机安装的 ComfyUI,云端与本地合并为同一个 MCP。
推荐理由:Comfy MCP 从云端扩展到本地并开源,读者可以了解智能体如何读取本地 GPU、节点与模型来搭建工作流。
ComfyUI 在 LTX-2.5 发布当天提供支持,开放权重版含 dev 与 distilled 两个变体,另可通过 Partner Nodes 调用 Fast 和 Pro。
推荐理由:ComfyUI 官方给出 LTX-2.5 的 Day-0 支持范围与两种使用路径,读者可据此判断本地部署还是走 Partner Nodes。
Wan Animate 2 已在 ComfyUI 原生支持,该模型用端到端角色动画框架直接读取驱动视频,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。
推荐理由:原文说明了 Wan Animate 2 在 ComfyUI 的原生支持范围、两个新节点和实时延迟变体,读者可据此判断能否接入自己的角色动画流程。
Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,一次生成可输出单段连续 30 秒视频,无需拼接短片。单次生成最多接受 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中内联指定。
推荐理由:原文列出 Seedance 2.5 在 ComfyUI 中的单次 30 秒连续生成、50 个参考素材与时间轴级镜头控制,可据此判断长镜头工作流是否可行。
FLUX 3 Video 已在 ComfyUI 通过 Partner Nodes 提供,目前上线的是视频生成,开放权重稍后发布。单次生成最长 20 秒,音频与画面同批原生产出,支持文生视频、图生视频、视频续写、单次生成内多场景与多语言对白口型。官方同时提供 I2V、T2V 和 Storyboard 三个工作流,更新 ComfyUI 或打开 Comfy Cloud 即可使用。
推荐理由:ComfyUI 官方给出 FLUX 3 Video 在 Partner Nodes 的可用范围与三种工作流,读者可据此判断能否接入现有出片流程。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并经 FlashDreams 加速推理库部署。
ComfyUI 上线 Comfy Team 计划,将团队集中到一个共享工作区、一个共享 credit 池和一张账单中,管理员可管理账单、邮件邀请成员并随时移除访问权限。该计划不按席位定价,分五档月度 credit 承诺,从 $200 到 $2,500,年度方案最高可享 20% 折扣、月度最高 10% 折扣。后续将加入共享工作流与素材库、用户/项目/工作区级预算、按项目计费和自动充值。
Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载量化 checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,也无需单独的推理引擎。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断能否在消费级显卡上跑扩散模型。
ComfyUI 背后的 Comfy Org 与伦敦艺术大学创意计算研究所(CCI)达成 Creative Campus 合作,CCI 成为即将推出的 Comfy Education Initiative 创始合作伙伴。
ComfyUI 为 Comfy MCP 推出批量生成能力,新增 submit_batch、get_batch_status、get_batch_output 三个工具,单次调用最多提交 50 个任务,可混合合作方模型与自有工作流,返回一个 batch_id,且该 batch_id 可跨会话保留,提交后次日在新会话中仍能收集结果。
推荐理由:Comfy MCP 新增批量提交与收集工具,并给出角色拍摄、素材矩阵等真实生产用例,可据此判断批量出片能否接入现有流程。
Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。
推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。
fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。
推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。
FASHN 面向时尚品牌提供目录级 on-model 图像生成与消费者虚拟试穿,在 fal 的 serverless 基础设施上支持企业客户 500 并发请求,可一次提交整季产品目录后批量产出成品图。
fal.ai 在 SGLang 上用 DSpark 为 Ideogram V4 的提示词扩展功能实现约 1000 tok/s 和 16 倍吞吐。该功能基于微调后的 Qwen 3.5 35B MoE(FP8)模型,此前在 SGLang 上并发为 1 时仅 328 tok/s,启用 MTP 投机解码后提升至 500 tok/s。
fal 营销与增长负责人 Tina Sang 在 Cannes Lions 后指出,AI 公司内部并未把工作流交给自主智能体,而是在制作 mockup、创意探索、快速起草初稿和可视化想法等环节选择性使用 AI。
fal 宣布与 Amazon Web Services 达成战略合作,为其生成式媒体平台引入 AWS 的全球算力与弹性基础设施。目前已有超过 250 万开发者在 fal 上构建应用,Amazon MGM Studios、Canva 和 Adobe 每天在该平台运行图像、视频、音频和 3D 生产工作负载。fal CTO 表示,AWS 提供的全球规模与可靠性层将帮助其推理引擎覆盖更多生产级团队。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成起始位置对应真实街景的交互世界。
推荐理由:原文说明了 Street View 实景锚定在 Project Genie 中的使用方式与开放范围,可据此判断它能否用于智能体或机器人训练场景。
fal.ai 发布 fal MCP Server,这是一个托管端点,让 Claude、Cursor、Windsurf 等 AI 助手在对话中搜索、运行并串联 1000+ 生成式 AI 模型,覆盖图像、视频、音频、3D 与超分。
推荐理由:原文给出 fal MCP Server 的接入命令与 9 个工具清单,读者可据此判断能否把自家模型调用接进对话式助手。