Google DeepMind 推出 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
Comfy Router 已在 Comfy Developer Platform 上线,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,首日接入 Seedance 2.5、MiniMax H3、Nano Banana Pro、GPT Image 2、Kling 和 Black Forest Labs。
推荐理由:Comfy Router 把多家供应商的前沿图像、视频、3D、音频模型收进一个 API,读者可据此判断多供应商切换与排队重试是否适合自己的调用场景。
ComfyUI 官方博客介绍 MiniMax H3 视频 VAE 的提速更新,编码最高约快 2.2 倍、解码快约 1.4-2.7 倍,1344x768、129 帧的编解码往返从 24.3 秒降到 12.7 秒。
推荐理由:原文给出 MiniMax H3 视频 VAE 在 ComfyUI 中的提速幅度、开启方式和画质数据,读者可据此判断是否值得升级。
阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。
推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。
Gemini Omni 1.1 Flash 通过 Partner Nodes 接入 ComfyUI,在 Gemini Video Omni 节点中可选 Omni Flash 1.1,单个节点覆盖文生视频、图生视频、参考生视频、视频编辑和场景延展。
推荐理由:原文给出 Gemini Omni 1.1 Flash 在 ComfyUI 节点中的任务类型、分辨率档位与提示词写法,可据此判断能否接入现有工作流。
fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。
推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。
fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。
推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。