Qwen-Image-2.1 在 ComfyUI 原生支持:开源权重图像生成与编辑,支持透明通道
阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。
推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。
阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。
推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。
H3 Max 生成 5 秒视频耗时不到 3 秒,在针对十二个领先视频模型的人类偏好评测中,其质量、提示词理解与美学均排名第一,Artificial Analysis 和 Design Arena 的独立基准测试同样将其列为第一。该模型由 fal Research 团队在 fal Compute 上完成后期训练,训练集群为互联的 GB200 NVL72 节点,最终训练运行耗时约一周到十天。
ChatGPT Images 2.5 发布,可将想法、草图与参考照片转化为更个性化、更精致的图像,更贴合用户原本的创意意图。
fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。
推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频控制能力。
推荐理由:官方列出场景延长、首尾帧插值与 4K 超分的具体参数和开放范围,可据此判断能否接入现有视频工作流。
阿里最新视频生成模型 Wan 3.0 已在 ComfyUI 上线,可一次生成最长 30 秒视频,无需拼接。提示词输入扩展到 20000 字符,参考素材上限提升到 10 张图片、5 段视频和 5 段音频,并支持网页与文档解析,参考素材通过 @Image1、@Video2 等 @ 语法在提示词中指定用途。
推荐理由:原文列出 Wan 3.0 在 ComfyUI 中的原生 30 秒时长、参考素材上限与分辨率档位,便于判断它能否直接接入现有工作流。
ComfyUI 在 LTX-2.5 发布当天提供支持,开放权重版含 dev 与 distilled 两个变体,另可通过 Partner Nodes 调用 Fast 和 Pro。
推荐理由:ComfyUI 官方给出 LTX-2.5 的 Day-0 支持范围与两种使用路径,读者可据此判断本地部署还是走 Partner Nodes。
Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,一次生成可输出单段连续 30 秒视频,无需拼接短片。单次生成最多接受 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中内联指定。
推荐理由:原文列出 Seedance 2.5 在 ComfyUI 中的单次 30 秒连续生成、50 个参考素材与时间轴级镜头控制,可据此判断长镜头工作流是否可行。
MiniMax H3 今日发布并开放权重,ComfyUI 当天完成原生支持。这是 MiniMax 第三代视频模型,前两代为 Hailuo 01 和 Hailuo 02,H3 是首个开放权重的版本,支持文生视频、图生视频、首尾帧控制和参考生视频,输出最高 2K、单段最长 15 秒,音频与视频同一次生成、原生立体声。
推荐理由:ComfyUI 官方给出 H3 的本地部署路径与显存优化细节,读者可据此判断消费级显卡能否跑起 2K 视频生成。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并经 FlashDreams 加速推理库部署。
Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。
推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:原文给出两款新模型的定价、延迟与能力边界,读者可据此判断能否接入自己的图像与视频工作流。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言对话进行多轮编辑,保持角色一致性与物理表现。
推荐理由:Gemini Omni Flash 支持图像、音频、视频和文本混合输入生成视频,并可用自然语言多轮编辑,读者可据此判断它能否接入自己的创作流程。