跳到正文
今天9月29日周二
9月28日周一
9月25日周五
  1. Google DeepMind(Veo)62

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。

9月24日周四
9月23日周三
  1. ComfyUI 官方博客62

    ComfyUI 推出 Comfy Router,用一个 API 调用前沿图像、视频、3D 与音频模型

    Comfy Router 已在 Comfy Developer Platform 上线,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,首日接入 Seedance 2.5、MiniMax H3、Nano Banana Pro、GPT Image 2、Kling 和 Black Forest Labs。

    推荐理由:Comfy Router 把多家供应商的前沿图像、视频、3D、音频模型收进一个 API,读者可据此判断多供应商切换与排队重试是否适合自己的调用场景。

9月21日周一
9月20日周日
  1. ComfyUI 官方博客71

    Qwen-Image-2.1 在 ComfyUI 原生支持:开源权重图像生成与编辑,支持透明通道

    阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。

    推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。

9月18日周五
  1. fal.ai Blog34

    H3 Max:基于 fal 推理与训练平台打造

    H3 Max 生成 5 秒视频耗时不到 3 秒,在针对十二个领先视频模型的人类偏好评测中,其质量、提示词理解与美学均排名第一,Artificial Analysis 和 Design Arena 的独立基准测试同样将其列为第一。该模型由 fal Research 团队在 fal Compute 上完成后期训练,训练集群为互联的 GB200 NVL72 节点,最终训练运行耗时约一周到十天。

9月5日周六
  1. ComfyUI 官方博客15

    ComfyUI 推出 Forward Deployed Creative 企业服务,帮团队把 AI 工作流送进生产管线

    ComfyUI 推出 Forward Deployed Creative(FDCT)企业服务,由 Comfy 专家嵌入企业团队,在客户自己的 Comfy Enterprise 环境中用其模型与素材构建工作流。服务分 Validate、Build、Enable、Own 四步,并以团队能否自行修改工作流而非只会点“run”来衡量赋能效果。工作流最终交付归企业所有,FDCT 支持线在企业协议下保持开放。

9月4日周五
8月28日周五
  1. ComfyUI 官方博客71

    Gemini Omni 1.1 Flash 上线 ComfyUI,支持 4K 输出与视频编辑

    Gemini Omni 1.1 Flash 通过 Partner Nodes 接入 ComfyUI,在 Gemini Video Omni 节点中可选 Omni Flash 1.1,单个节点覆盖文生视频、图生视频、参考生视频、视频编辑和场景延展。

    推荐理由:原文给出 Gemini Omni 1.1 Flash 在 ComfyUI 节点中的任务类型、分辨率档位与提示词写法,可据此判断能否接入现有工作流。

  2. ComfyUI 官方博客58

    Comfy 成为 MiniMax H3 商用许可官方转售方

    Comfy 宣布成为 MiniMax H3 商用许可的首个官方转售方,用户可通过 Comfy 获取本地商用授权。许可包含输出内容的完整商用权利、微调与 LoRA 训练、客户及下游项目使用,并覆盖 MiniMax 的音频与音乐模型;分 Professional 和 Enterprise 两档,Enterprise 可使用包括未蒸馏权重在内的全部 H3 模型版本。

  3. fal.ai Blog83

    fal 发布 H3 Max:基于 MiniMax H3 后训练,5 秒视频约 3 秒生成

    fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。

    推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。

8月19日周三
  1. r/aivideo78

    Seedance 2.5 单次生成 30 秒,MiniMax H3 开源,原生音频成新标配

    r/aivideo 汇总了近期 AI 视频模型更新:Seedance 2.5 支持单次生成最长 30 秒的多镜头视频,最高 4K 并带同步音频;MiniMax 发布 H3 并开放 H3 Base 权重,可本地运行并接入 ComfyUI 等工具,本地生成 768p,2K 阶段仍为服务端。

    推荐理由:汇总了 Seedance 2.5、MiniMax H3、Wan 3.0 等多家模型在时长、音频与开源上的同期进展,便于横向比较当前能力边界。

7月13日周一
  1. fal.ai Blog78

    fal.ai 开源 3DREAL Strong v2 适配器,并公开 3D 灰模转实拍短片全流程

    fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。

    推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。

7月11日周六
7月8日周三
6月29日周一
5月20日周三
  1. fal.ai Blog22

    fal 与 AWS 达成战略合作,共建生成式媒体下一阶段基础设施

    fal 宣布与 Amazon Web Services 达成战略合作,为其生成式媒体平台引入 AWS 的全球算力与弹性基础设施。目前已有超过 250 万开发者在 fal 上构建应用,Amazon MGM Studios、Canva 和 Adobe 每天在该平台运行图像、视频、音频和 3D 生产工作负载。fal CTO 表示,AWS 提供的全球规模与可靠性层将帮助其推理引擎覆盖更多生产级团队。