跳到正文
9月20日周日
  1. ComfyUI 官方博客71

    Qwen-Image-2.1 在 ComfyUI 原生支持:开源权重图像生成与编辑,支持透明通道

    阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。

    推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。

9月18日周五
  1. fal.ai Blog34

    H3 Max:基于 fal 推理与训练平台打造

    H3 Max 生成 5 秒视频耗时不到 3 秒,在针对十二个领先视频模型的人类偏好评测中,其质量、提示词理解与美学均排名第一,Artificial Analysis 和 Design Arena 的独立基准测试同样将其列为第一。该模型由 fal Research 团队在 fal Compute 上完成后期训练,训练集群为互联的 GB200 NVL72 节点,最终训练运行耗时约一周到十天。

9月8日周二
8月28日周五
  1. fal.ai Blog83

    fal 发布 H3 Max:基于 MiniMax H3 后训练,5 秒视频约 3 秒生成

    fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。

    推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。

8月25日周二
  1. ComfyUI 官方博客88

    Wan 3.0 上线 ComfyUI:原生 30 秒视频与 Omni-Reference 控制

    阿里最新视频生成模型 Wan 3.0 已在 ComfyUI 上线,可一次生成最长 30 秒视频,无需拼接。提示词输入扩展到 20000 字符,参考素材上限提升到 10 张图片、5 段视频和 5 段音频,并支持网页与文档解析,参考素材通过 @Image1、@Video2 等 @ 语法在提示词中指定用途。

    推荐理由:原文列出 Wan 3.0 在 ComfyUI 中的原生 30 秒时长、参考素材上限与分辨率档位,便于判断它能否直接接入现有工作流。

8月12日周三
8月8日周六
  1. ComfyUI 官方博客82

    Seedance 2.5 通过 Partner Nodes 上线 ComfyUI

    Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,一次生成可输出单段连续 30 秒视频,无需拼接短片。单次生成最多接受 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中内联指定。

    推荐理由:原文列出 Seedance 2.5 在 ComfyUI 中的单次 30 秒连续生成、50 个参考素材与时间轴级镜头控制,可据此判断长镜头工作流是否可行。

8月3日周一
  1. ComfyUI 官方博客88

    MiniMax H3 开源权重发布,ComfyUI 首日支持 2K 视频与原生立体声

    MiniMax H3 今日发布并开放权重,ComfyUI 当天完成原生支持。这是 MiniMax 第三代视频模型,前两代为 Hailuo 01 和 Hailuo 02,H3 是首个开放权重的版本,支持文生视频、图生视频、首尾帧控制和参考生视频,输出最高 2K、单段最长 15 秒,音频与视频同一次生成、原生立体声。

    推荐理由:ComfyUI 官方给出 H3 的本地部署路径与显存优化细节,读者可据此判断消费级显卡能否跑起 2K 视频生成。

7月27日周一
7月15日周三
  1. Hugging Face Blog62

    Thinking Machines 发布 Inkling 与 Inkling-Small 多模态开源模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。

    推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。

7月1日周三
  1. Google DeepMind(Veo)80

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。

    推荐理由:原文给出两款新模型的定价、延迟与能力边界,读者可据此判断能否接入自己的图像与视频工作流。

5月18日周一
  1. Google DeepMind(Veo)88

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑

    Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言对话进行多轮编辑,保持角色一致性与物理表现。

    推荐理由:Gemini Omni Flash 支持图像、音频、视频和文本混合输入生成视频,并可用自然语言多轮编辑,读者可据此判断它能否接入自己的创作流程。