跳到正文
9月21日周一
9月20日周日
  1. ComfyUI 官方博客71

    Qwen-Image-2.1 在 ComfyUI 原生支持:开源权重图像生成与编辑,支持透明通道

    阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。

    推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。

9月16日周三
9月10日周四
8月28日周五
  1. fal.ai Blog83

    fal 发布 H3 Max:基于 MiniMax H3 后训练,5 秒视频约 3 秒生成

    fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。

    推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。

8月25日周二
  1. ComfyUI 官方博客88

    Wan 3.0 上线 ComfyUI:原生 30 秒视频与 Omni-Reference 控制

    阿里最新视频生成模型 Wan 3.0 已在 ComfyUI 上线,可一次生成最长 30 秒视频,无需拼接。提示词输入扩展到 20000 字符,参考素材上限提升到 10 张图片、5 段视频和 5 段音频,并支持网页与文档解析,参考素材通过 @Image1、@Video2 等 @ 语法在提示词中指定用途。

    推荐理由:原文列出 Wan 3.0 在 ComfyUI 中的原生 30 秒时长、参考素材上限与分辨率档位,便于判断它能否直接接入现有工作流。

8月19日周三
  1. r/aivideo78

    Seedance 2.5 单次生成 30 秒,MiniMax H3 开源,原生音频成新标配

    r/aivideo 汇总了近期 AI 视频模型更新:Seedance 2.5 支持单次生成最长 30 秒的多镜头视频,最高 4K 并带同步音频;MiniMax 发布 H3 并开放 H3 Base 权重,可本地运行并接入 ComfyUI 等工具,本地生成 768p,2K 阶段仍为服务端。

    推荐理由:汇总了 Seedance 2.5、MiniMax H3、Wan 3.0 等多家模型在时长、音频与开源上的同期进展,便于横向比较当前能力边界。

8月12日周三
8月3日周一
  1. ComfyUI 官方博客88

    MiniMax H3 开源权重发布,ComfyUI 首日支持 2K 视频与原生立体声

    MiniMax H3 今日发布并开放权重,ComfyUI 当天完成原生支持。这是 MiniMax 第三代视频模型,前两代为 Hailuo 01 和 Hailuo 02,H3 是首个开放权重的版本,支持文生视频、图生视频、首尾帧控制和参考生视频,输出最高 2K、单段最长 15 秒,音频与视频同一次生成、原生立体声。

    推荐理由:ComfyUI 官方给出 H3 的本地部署路径与显存优化细节,读者可据此判断消费级显卡能否跑起 2K 视频生成。

7月27日周一
7月15日周三
  1. Hugging Face Blog62

    Thinking Machines 发布 Inkling 与 Inkling-Small 多模态开源模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。

    推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。