跳到正文
今天9月29日周二
9月28日周一
9月25日周五
  1. Google DeepMind(Veo)62

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。

9月24日周四
9月23日周三
  1. ComfyUI 官方博客62

    ComfyUI 推出 Comfy Router,用一个 API 调用前沿图像、视频、3D 与音频模型

    Comfy Router 已在 Comfy Developer Platform 上线,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,首日接入 Seedance 2.5、MiniMax H3、Nano Banana Pro、GPT Image 2、Kling 和 Black Forest Labs。

    推荐理由:Comfy Router 把多家供应商的前沿图像、视频、3D、音频模型收进一个 API,读者可据此判断多供应商切换与排队重试是否适合自己的调用场景。

9月21日周一
9月10日周四
  1. Hugging Face Blog62

    Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111,Workflow1111 含 73 个节点

    Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成。

    推荐理由:原文完整拆解了 Workflow1111 的十一条管线与节点构成,可对照 ComfyUI 判断这类画布工作流的适用边界。

9月2日周三
  1. Google DeepMind(Veo)66

    Google DeepMind 为 Gemini 3.7 Flash 等模型推出 agentic 视频理解

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic 视频理解,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。

    推荐理由:原文给出该功能在三个 Gemini 模型上的 token、成本与准确率变化区间,并说明 API 开启方式,便于开发者判断是否接入。

8月28日周五
  1. ComfyUI 官方博客71

    Gemini Omni 1.1 Flash 上线 ComfyUI,支持 4K 输出与视频编辑

    Gemini Omni 1.1 Flash 通过 Partner Nodes 接入 ComfyUI,在 Gemini Video Omni 节点中可选 Omni Flash 1.1,单个节点覆盖文生视频、图生视频、参考生视频、视频编辑和场景延展。

    推荐理由:原文给出 Gemini Omni 1.1 Flash 在 ComfyUI 节点中的任务类型、分辨率档位与提示词写法,可据此判断能否接入现有工作流。

8月25日周二
  1. Hugging Face Blog62

    Gradio 内置 gr.Workflow 上线,把 AI 流水线变成可拖拽画布与 REST API

    Gradio 内置的 gr.Workflow 把多步 AI 流水线变成可拖拽的节点画布,每个节点可运行、每个中间结果可见,同一张图同时是 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点类型、并行 fan-out 用法与 REST 端点示例,读者可据此判断能否把多步生成流程搬进 Gradio。

8月19日周三
8月8日周六
  1. ComfyUI 官方博客82

    Wan Animate 2 在 ComfyUI 原生支持,新增两个节点

    Wan Animate 2 已在 ComfyUI 原生支持,该模型用端到端角色动画框架直接读取驱动视频,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。

    推荐理由:原文说明了 Wan Animate 2 在 ComfyUI 的原生支持范围、两个新节点和实时延迟变体,读者可据此判断能否接入自己的角色动画流程。

8月6日周四
  1. ComfyUI 官方博客82

    FLUX 3 Video 通过 ComfyUI Partner Nodes 上线

    FLUX 3 Video 已在 ComfyUI 通过 Partner Nodes 提供,目前上线的是视频生成,开放权重稍后发布。单次生成最长 20 秒,音频与画面同批原生产出,支持文生视频、图生视频、视频续写、单次生成内多场景与多语言对白口型。官方同时提供 I2V、T2V 和 Storyboard 三个工作流,更新 ComfyUI 或打开 Comfy Cloud 即可使用。

    推荐理由:ComfyUI 官方给出 FLUX 3 Video 在 Partner Nodes 的可用范围与三种工作流,读者可据此判断能否接入现有出片流程。

7月24日周五
  1. ComfyUI 官方博客39

    ComfyUI 推出 Comfy Team 团队协作计划

    ComfyUI 上线 Comfy Team 计划,将团队集中到一个共享工作区、一个共享 credit 池和一张账单中,管理员可管理账单、邮件邀请成员并随时移除访问权限。该计划不按席位定价,分五档月度 credit 承诺,从 $200 到 $2,500,年度方案最高可享 20% 折扣、月度最高 10% 折扣。后续将加入共享工作流与素材库、用户/项目/工作区级预算、按项目计费和自动充值。

7月23日周四
  1. Hugging Face Blog62

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载量化 checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,也无需单独的推理引擎。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断能否在消费级显卡上跑扩散模型。

7月16日周四
  1. ComfyUI 官方博客66

    ComfyUI 为 Comfy MCP 上线批量生成工具

    ComfyUI 为 Comfy MCP 推出批量生成能力,新增 submit_batch、get_batch_status、get_batch_output 三个工具,单次调用最多提交 50 个任务,可混合合作方模型与自有工作流,返回一个 batch_id,且该 batch_id 可跨会话保留,提交后次日在新会话中仍能收集结果。

    推荐理由:Comfy MCP 新增批量提交与收集工具,并给出角色拍摄、素材矩阵等真实生产用例,可据此判断批量出片能否接入现有流程。

5月18日周一
  1. Google DeepMind(Veo)62

    Google DeepMind 为 Project Genie 加入 Street View 实景锚定能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成起始位置对应真实街景的交互世界。

    推荐理由:原文说明了 Street View 实景锚定在 Project Genie 中的使用方式与开放范围,可据此判断它能否用于智能体或机器人训练场景。

3月20日周五
  1. fal.ai Blog62

    fal.ai 发布 fal MCP Server,让 AI 助手直接调用 1000+ 生成模型

    fal.ai 发布 fal MCP Server,这是一个托管端点,让 Claude、Cursor、Windsurf 等 AI 助手在对话中搜索、运行并串联 1000+ 生成式 AI 模型,覆盖图像、视频、音频、3D 与超分。

    推荐理由:原文给出 fal MCP Server 的接入命令与 9 个工具清单,读者可据此判断能否把自家模型调用接进对话式助手。

3月3日周二