跳到正文
今天9月29日周二
9月28日周一
9月23日周三
9月21日周一
9月20日周日
  1. ComfyUI 官方博客71

    Qwen-Image-2.1 在 ComfyUI 原生支持:开源权重图像生成与编辑,支持透明通道

    阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。

    推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。

9月10日周四
  1. Hugging Face Blog62

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111,Workflow1111 含 73 个节点

    Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成。

    推荐理由:原文完整拆解了 Workflow1111 的十一条管线与节点构成,可对照 ComfyUI 判断这类画布工作流的适用边界。

8月28日周五
  1. ComfyUI 官方博客58

    Comfy 成为 MiniMax H3 商用许可官方转售方

    Comfy 宣布成为 MiniMax H3 商用许可的首个官方转售方,用户可通过 Comfy 获取本地商用授权。许可包含输出内容的完整商用权利、微调与 LoRA 训练、客户及下游项目使用,并覆盖 MiniMax 的音频与音乐模型;分 Professional 和 Enterprise 两档,Enterprise 可使用包括未蒸馏权重在内的全部 H3 模型版本。

  2. fal.ai Blog83

    fal 发布 H3 Max:基于 MiniMax H3 后训练,5 秒视频约 3 秒生成

    fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。

    推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。

8月25日周二
  1. ComfyUI 官方博客88

    Wan 3.0 上线 ComfyUI:原生 30 秒视频与 Omni-Reference 控制

    阿里最新视频生成模型 Wan 3.0 已在 ComfyUI 上线,可一次生成最长 30 秒视频,无需拼接。提示词输入扩展到 20000 字符,参考素材上限提升到 10 张图片、5 段视频和 5 段音频,并支持网页与文档解析,参考素材通过 @Image1、@Video2 等 @ 语法在提示词中指定用途。

    推荐理由:原文列出 Wan 3.0 在 ComfyUI 中的原生 30 秒时长、参考素材上限与分辨率档位,便于判断它能否直接接入现有工作流。

8月20日周四
8月19日周三
  1. r/aivideo78

    Seedance 2.5 单次生成 30 秒,MiniMax H3 开源,原生音频成新标配

    r/aivideo 汇总了近期 AI 视频模型更新:Seedance 2.5 支持单次生成最长 30 秒的多镜头视频,最高 4K 并带同步音频;MiniMax 发布 H3 并开放 H3 Base 权重,可本地运行并接入 ComfyUI 等工具,本地生成 768p,2K 阶段仍为服务端。

    推荐理由:汇总了 Seedance 2.5、MiniMax H3、Wan 3.0 等多家模型在时长、音频与开源上的同期进展,便于横向比较当前能力边界。

8月12日周三
8月3日周一
  1. ComfyUI 官方博客88

    MiniMax H3 开源权重发布,ComfyUI 首日支持 2K 视频与原生立体声

    MiniMax H3 今日发布并开放权重,ComfyUI 当天完成原生支持。这是 MiniMax 第三代视频模型,前两代为 Hailuo 01 和 Hailuo 02,H3 是首个开放权重的版本,支持文生视频、图生视频、首尾帧控制和参考生视频,输出最高 2K、单段最长 15 秒,音频与视频同一次生成、原生立体声。

    推荐理由:ComfyUI 官方给出 H3 的本地部署路径与显存优化细节,读者可据此判断消费级显卡能否跑起 2K 视频生成。

7月27日周一
7月23日周四
  1. Hugging Face Blog62

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载量化 checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,也无需单独的推理引擎。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断能否在消费级显卡上跑扩散模型。

7月16日周四
7月15日周三
  1. Hugging Face Blog62

    Thinking Machines 发布 Inkling 与 Inkling-Small 多模态开源模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。

    推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。

7月13日周一
  1. fal.ai Blog78

    fal.ai 开源 3DREAL Strong v2 适配器,并公开 3D 灰模转实拍短片全流程

    fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。

    推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。

2月24日周二