Google DeepMind 推出 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
Comfy Router 已在 Comfy Developer Platform 上线,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,首日接入 Seedance 2.5、MiniMax H3、Nano Banana Pro、GPT Image 2、Kling 和 Black Forest Labs。
推荐理由:Comfy Router 把多家供应商的前沿图像、视频、3D、音频模型收进一个 API,读者可据此判断多供应商切换与排队重试是否适合自己的调用场景。
ComfyUI 发布 v0.37.0,新增 Qwen-Image 2.1、MoGe 3 和 Meshy 7.1 支持,并为 GPT Image 2 加入透明背景功能。该版本在磁盘性能足够时自动启用 --fast-disk,动态显存下文本编码器常驻 GPU,同时为 YuE2 音乐生成节点加入 CFG 控制。
ComfyUI 发布 v0.36.0,新增 Marigold v2 与 Yue2 音乐模型支持,并加入 Flux Video Edit、Bria 图像编辑与 Video Eraser、Pruna P-Video-2 文生视频/图生视频、Tripo P2 等 Partner Nodes。
ComfyUI 发布 v0.35.0,Partner Nodes 新增 WAN3-Prime、Claude Fable 5.1、gpt 6 astra 与 Muse Image 支持,并下线已退役的 Veo 2 和 Veo 3.0。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic 视频理解,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:原文给出该功能在三个 Gemini 模型上的 token、成本与准确率变化区间,并说明 API 开启方式,便于开发者判断是否接入。
Gemini Omni 1.1 Flash 通过 Partner Nodes 接入 ComfyUI,在 Gemini Video Omni 节点中可选 Omni Flash 1.1,单个节点覆盖文生视频、图生视频、参考生视频、视频编辑和场景延展。
推荐理由:原文给出 Gemini Omni 1.1 Flash 在 ComfyUI 节点中的任务类型、分辨率档位与提示词写法,可据此判断能否接入现有工作流。
Wan Animate 2 已在 ComfyUI 原生支持,该模型用端到端角色动画框架直接读取驱动视频,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。
推荐理由:原文说明了 Wan Animate 2 在 ComfyUI 的原生支持范围、两个新节点和实时延迟变体,读者可据此判断能否接入自己的角色动画流程。
FLUX 3 Video 已在 ComfyUI 通过 Partner Nodes 提供,目前上线的是视频生成,开放权重稍后发布。单次生成最长 20 秒,音频与画面同批原生产出,支持文生视频、图生视频、视频续写、单次生成内多场景与多语言对白口型。官方同时提供 I2V、T2V 和 Storyboard 三个工作流,更新 ComfyUI 或打开 Comfy Cloud 即可使用。
推荐理由:ComfyUI 官方给出 FLUX 3 Video 在 Partner Nodes 的可用范围与三种工作流,读者可据此判断能否接入现有出片流程。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成起始位置对应真实街景的交互世界。
推荐理由:原文说明了 Street View 实景锚定在 Project Genie 中的使用方式与开放范围,可据此判断它能否用于智能体或机器人训练场景。
HeyGen 的模型现已上线 fal,提供 Video Agent、Avatar IV、Video Translate 和 Avatar Video 等能力。Video Agent API 输入提示词或 URL 即可端到端完成脚本撰写、素材选择与剪辑,输出完整视频;Avatar IV API 用单张照片生成带自然表情和手势的说话数字人。