跳到正文
9月25日周五
  1. Google DeepMind(Veo)62

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。

8月8日周六
  1. ComfyUI 官方博客82

    Wan Animate 2 在 ComfyUI 原生支持,新增两个节点

    Wan Animate 2 已在 ComfyUI 原生支持,该模型用端到端角色动画框架直接读取驱动视频,省去中间运动提取器,以提升运动保真度和角色身份一致性,并支持文本驱动的视角控制。

    推荐理由:原文说明了 Wan Animate 2 在 ComfyUI 的原生支持范围、两个新节点和实时延迟变体,读者可据此判断能否接入自己的角色动画流程。

5月18日周一
  1. Google DeepMind(Veo)88

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑

    Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言对话进行多轮编辑,保持角色一致性与物理表现。

    推荐理由:Gemini Omni Flash 支持图像、音频、视频和文本混合输入生成视频,并可用自然语言多轮编辑,读者可据此判断它能否接入自己的创作流程。

3月3日周二