Google DeepMind 推出 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
Comfy Router 已在 Comfy Developer Platform 上线,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,首日接入 Seedance 2.5、MiniMax H3、Nano Banana Pro、GPT Image 2、Kling 和 Black Forest Labs。
推荐理由:Comfy Router 把多家供应商的前沿图像、视频、3D、音频模型收进一个 API,读者可据此判断多供应商切换与排队重试是否适合自己的调用场景。
ComfyUI 发布 v0.37.0,新增 Qwen-Image 2.1、MoGe 3 和 Meshy 7.1 支持,并为 GPT Image 2 加入透明背景功能。该版本在磁盘性能足够时自动启用 --fast-disk,动态显存下文本编码器常驻 GPU,同时为 YuE2 音乐生成节点加入 CFG 控制。
阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。
推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。
H3 Max 生成 5 秒视频耗时不到 3 秒,在针对十二个领先视频模型的人类偏好评测中,其质量、提示词理解与美学均排名第一,Artificial Analysis 和 Design Arena 的独立基准测试同样将其列为第一。该模型由 fal Research 团队在 fal Compute 上完成后期训练,训练集群为互联的 GB200 NVL72 节点,最终训练运行耗时约一周到十天。
ChatGPT Images 2.5 发布,可将想法、草图与参考照片转化为更个性化、更精致的图像,更贴合用户原本的创意意图。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic 视频理解,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:原文给出该功能在三个 Gemini 模型上的 token、成本与准确率变化区间,并说明 API 开启方式,便于开发者判断是否接入。
Gemini Omni 1.1 Flash 通过 Partner Nodes 接入 ComfyUI,在 Gemini Video Omni 节点中可选 Omni Flash 1.1,单个节点覆盖文生视频、图生视频、参考生视频、视频编辑和场景延展。
推荐理由:原文给出 Gemini Omni 1.1 Flash 在 ComfyUI 节点中的任务类型、分辨率档位与提示词写法,可据此判断能否接入现有工作流。
fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。
推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频控制能力。
推荐理由:官方列出场景延长、首尾帧插值与 4K 超分的具体参数和开放范围,可据此判断能否接入现有视频工作流。
阿里最新视频生成模型 Wan 3.0 已在 ComfyUI 上线,可一次生成最长 30 秒视频,无需拼接。提示词输入扩展到 20000 字符,参考素材上限提升到 10 张图片、5 段视频和 5 段音频,并支持网页与文档解析,参考素材通过 @Image1、@Video2 等 @ 语法在提示词中指定用途。
推荐理由:原文列出 Wan 3.0 在 ComfyUI 中的原生 30 秒时长、参考素材上限与分辨率档位,便于判断它能否直接接入现有工作流。
r/aivideo 汇总了近期 AI 视频模型更新:Seedance 2.5 支持单次生成最长 30 秒的多镜头视频,最高 4K 并带同步音频;MiniMax 发布 H3 并开放 H3 Base 权重,可本地运行并接入 ComfyUI 等工具,本地生成 768p,2K 阶段仍为服务端。
推荐理由:汇总了 Seedance 2.5、MiniMax H3、Wan 3.0 等多家模型在时长、音频与开源上的同期进展,便于横向比较当前能力边界。
ComfyUI 在 LTX-2.5 发布当天提供支持,开放权重版含 dev 与 distilled 两个变体,另可通过 Partner Nodes 调用 Fast 和 Pro。
推荐理由:ComfyUI 官方给出 LTX-2.5 的 Day-0 支持范围与两种使用路径,读者可据此判断本地部署还是走 Partner Nodes。
Wan Animate 2 已在 ComfyUI 原生支持,该模型用端到端角色动画框架直接读取驱动视频,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。
推荐理由:原文说明了 Wan Animate 2 在 ComfyUI 的原生支持范围、两个新节点和实时延迟变体,读者可据此判断能否接入自己的角色动画流程。
Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,一次生成可输出单段连续 30 秒视频,无需拼接短片。单次生成最多接受 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中内联指定。
推荐理由:原文列出 Seedance 2.5 在 ComfyUI 中的单次 30 秒连续生成、50 个参考素材与时间轴级镜头控制,可据此判断长镜头工作流是否可行。
FLUX 3 Video 已在 ComfyUI 通过 Partner Nodes 提供,目前上线的是视频生成,开放权重稍后发布。单次生成最长 20 秒,音频与画面同批原生产出,支持文生视频、图生视频、视频续写、单次生成内多场景与多语言对白口型。官方同时提供 I2V、T2V 和 Storyboard 三个工作流,更新 ComfyUI 或打开 Comfy Cloud 即可使用。
推荐理由:ComfyUI 官方给出 FLUX 3 Video 在 Partner Nodes 的可用范围与三种工作流,读者可据此判断能否接入现有出片流程。
MiniMax H3 今日发布并开放权重,ComfyUI 当天完成原生支持。这是 MiniMax 第三代视频模型,前两代为 Hailuo 01 和 Hailuo 02,H3 是首个开放权重的版本,支持文生视频、图生视频、首尾帧控制和参考生视频,输出最高 2K、单段最长 15 秒,音频与视频同一次生成、原生立体声。
推荐理由:ComfyUI 官方给出 H3 的本地部署路径与显存优化细节,读者可据此判断消费级显卡能否跑起 2K 视频生成。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并经 FlashDreams 加速推理库部署。
Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。
推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:原文给出两款新模型的定价、延迟与能力边界,读者可据此判断能否接入自己的图像与视频工作流。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成起始位置对应真实街景的交互世界。
推荐理由:原文说明了 Street View 实景锚定在 Project Genie 中的使用方式与开放范围,可据此判断它能否用于智能体或机器人训练场景。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言对话进行多轮编辑,保持角色一致性与物理表现。
推荐理由:Gemini Omni Flash 支持图像、音频、视频和文本混合输入生成视频,并可用自然语言多轮编辑,读者可据此判断它能否接入自己的创作流程。
HeyGen 的模型现已上线 fal,提供 Video Agent、Avatar IV、Video Translate 和 Avatar Video 等能力。Video Agent API 输入提示词或 URL 即可端到端完成脚本撰写、素材选择与剪辑,输出完整视频;Avatar IV API 用单张照片生成带自然表情和手势的说话数字人。