H3 Max:基于 fal 推理与训练平台打造
H3 Max 生成 5 秒视频耗时不到 3 秒,在针对十二个领先视频模型的人类偏好评测中,其质量、提示词理解与美学均排名第一,Artificial Analysis 和 Design Arena 的独立基准测试同样将其列为第一。该模型由 fal Research 团队在 fal Compute 上完成后期训练,训练集群为互联的 GB200 NVL72 节点,最终训练运行耗时约一周到十天。
H3 Max 生成 5 秒视频耗时不到 3 秒,在针对十二个领先视频模型的人类偏好评测中,其质量、提示词理解与美学均排名第一,Artificial Analysis 和 Design Arena 的独立基准测试同样将其列为第一。该模型由 fal Research 团队在 fal Compute 上完成后期训练,训练集群为互联的 GB200 NVL72 节点,最终训练运行耗时约一周到十天。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成。
推荐理由:原文完整拆解了 Workflow1111 的十一条管线与节点构成,可对照 ComfyUI 判断这类画布工作流的适用边界。
Gemini Omni 1.1 Flash 通过 Partner Nodes 接入 ComfyUI,在 Gemini Video Omni 节点中可选 Omni Flash 1.1,单个节点覆盖文生视频、图生视频、参考生视频、视频编辑和场景延展。
推荐理由:原文给出 Gemini Omni 1.1 Flash 在 ComfyUI 节点中的任务类型、分辨率档位与提示词写法,可据此判断能否接入现有工作流。
fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。
推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频控制能力。
推荐理由:官方列出场景延长、首尾帧插值与 4K 超分的具体参数和开放范围,可据此判断能否接入现有视频工作流。
ComfyUI 在 LTX-2.5 发布当天提供支持,开放权重版含 dev 与 distilled 两个变体,另可通过 Partner Nodes 调用 Fast 和 Pro。
推荐理由:ComfyUI 官方给出 LTX-2.5 的 Day-0 支持范围与两种使用路径,读者可据此判断本地部署还是走 Partner Nodes。
Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,一次生成可输出单段连续 30 秒视频,无需拼接短片。单次生成最多接受 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中内联指定。
推荐理由:原文列出 Seedance 2.5 在 ComfyUI 中的单次 30 秒连续生成、50 个参考素材与时间轴级镜头控制,可据此判断长镜头工作流是否可行。
FLUX 3 Video 已在 ComfyUI 通过 Partner Nodes 提供,目前上线的是视频生成,开放权重稍后发布。单次生成最长 20 秒,音频与画面同批原生产出,支持文生视频、图生视频、视频续写、单次生成内多场景与多语言对白口型。官方同时提供 I2V、T2V 和 Storyboard 三个工作流,更新 ComfyUI 或打开 Comfy Cloud 即可使用。
推荐理由:ComfyUI 官方给出 FLUX 3 Video 在 Partner Nodes 的可用范围与三种工作流,读者可据此判断能否接入现有出片流程。
MiniMax H3 今日发布并开放权重,ComfyUI 当天完成原生支持。这是 MiniMax 第三代视频模型,前两代为 Hailuo 01 和 Hailuo 02,H3 是首个开放权重的版本,支持文生视频、图生视频、首尾帧控制和参考生视频,输出最高 2K、单段最长 15 秒,音频与视频同一次生成、原生立体声。
推荐理由:ComfyUI 官方给出 H3 的本地部署路径与显存优化细节,读者可据此判断消费级显卡能否跑起 2K 视频生成。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言对话进行多轮编辑,保持角色一致性与物理表现。
推荐理由:Gemini Omni Flash 支持图像、音频、视频和文本混合输入生成视频,并可用自然语言多轮编辑,读者可据此判断它能否接入自己的创作流程。
HeyGen 的模型现已上线 fal,提供 Video Agent、Avatar IV、Video Translate 和 Avatar Video 等能力。Video Agent API 输入提示词或 URL 即可端到端完成脚本撰写、素材选择与剪辑,输出完整视频;Avatar IV API 用单张照片生成带自然表情和手势的说话数字人。