Google DeepMind 推出 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
ComfyUI 公布 Comfy × MiniMax H3 Sync Sound Challenge 获奖名单,要求音视频在同一次生成中产出、不得后期配音。
ComfyUI 与 MiniMax 联合发起 H3 Sync Sound 社区挑战赛,要求参赛者用 MiniMax H3 在同一次生成中同时产出视频与同步音频,禁止后期拼接独立音轨。
MiniMax H3 今日发布并开放权重,ComfyUI 当天完成原生支持。这是 MiniMax 第三代视频模型,前两代为 Hailuo 01 和 Hailuo 02,H3 是首个开放权重的版本,支持文生视频、图生视频、首尾帧控制和参考生视频,输出最高 2K、单段最长 15 秒,音频与视频同一次生成、原生立体声。
推荐理由:ComfyUI 官方给出 H3 的本地部署路径与显存优化细节,读者可据此判断消费级显卡能否跑起 2K 视频生成。
HeyGen 的模型现已上线 fal,提供 Video Agent、Avatar IV、Video Translate 和 Avatar Video 等能力。Video Agent API 输入提示词或 URL 即可端到端完成脚本撰写、素材选择与剪辑,输出完整视频;Avatar IV API 用单张照片生成带自然表情和手势的说话数字人。