AMD以82亿美元全股票收购李飞飞World Labs,李飞飞将任首席科学家
AMD宣布以82亿美元全股票收购李飞飞创办的空间智能公司World Labs,交易预计2026年底前完成,仍须取得监管批准。交割后李飞飞将加入AMD担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。
AMD宣布以82亿美元全股票收购李飞飞创办的空间智能公司World Labs,交易预计2026年底前完成,仍须取得监管批准。交割后李飞飞将加入AMD担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。
MiniMax-H3-Character-Swap-LoRA 的 1000 步最终版已发布,并配套 REF2VA 工作流,可输入源视频与单张角色设定图完成角色替换,同时保留其余画面元素并迁移设定图的渲染风格,无需触发词,但近景面部表情常无法跟随。
作者在 ComfyUI 中把 SeedVR2 的 VAE Encoder 跑通到 TensorRT,发布 ComfyUI-SeedVR2-VideoUpscaler-with-TensorRT v1.5.5,v1.5.4 修复了 TensorRT VAE Decoder 左上角伪影。
ComfyUI 官方博客介绍 MiniMax H3 视频 VAE 的提速更新,编码最高约快 2.2 倍、解码快约 1.4-2.7 倍,1344x768、129 帧的编解码往返从 24.3 秒降到 12.7 秒。
推荐理由:原文给出 MiniMax H3 视频 VAE 在 ComfyUI 中的提速幅度、开启方式和画质数据,读者可据此判断是否值得升级。
ComfyUI 发布 v0.37.0,新增 Qwen-Image 2.1、MoGe 3 和 Meshy 7.1 支持,并为 GPT Image 2 加入透明背景功能。该版本在磁盘性能足够时自动启用 --fast-disk,动态显存下文本编码器常驻 GPU,同时为 YuE2 音乐生成节点加入 CFG 控制。
阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。
推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成。
推荐理由:原文完整拆解了 Workflow1111 的十一条管线与节点构成,可对照 ComfyUI 判断这类画布工作流的适用边界。
Comfy 宣布成为 MiniMax H3 商用许可的首个官方转售方,用户可通过 Comfy 获取本地商用授权。许可包含输出内容的完整商用权利、微调与 LoRA 训练、客户及下游项目使用,并覆盖 MiniMax 的音频与音乐模型;分 Professional 和 Enterprise 两档,Enterprise 可使用包括未蒸馏权重在内的全部 H3 模型版本。
fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。
推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。
阿里最新视频生成模型 Wan 3.0 已在 ComfyUI 上线,可一次生成最长 30 秒视频,无需拼接。提示词输入扩展到 20000 字符,参考素材上限提升到 10 张图片、5 段视频和 5 段音频,并支持网页与文档解析,参考素材通过 @Image1、@Video2 等 @ 语法在提示词中指定用途。
推荐理由:原文列出 Wan 3.0 在 ComfyUI 中的原生 30 秒时长、参考素材上限与分辨率档位,便于判断它能否直接接入现有工作流。
ComfyUI 与 MiniMax 联合发起 H3 Sync Sound 社区挑战赛,要求参赛者用 MiniMax H3 在同一次生成中同时产出视频与同步音频,禁止后期拼接独立音轨。
r/aivideo 汇总了近期 AI 视频模型更新:Seedance 2.5 支持单次生成最长 30 秒的多镜头视频,最高 4K 并带同步音频;MiniMax 发布 H3 并开放 H3 Base 权重,可本地运行并接入 ComfyUI 等工具,本地生成 768p,2K 阶段仍为服务端。
推荐理由:汇总了 Seedance 2.5、MiniMax H3、Wan 3.0 等多家模型在时长、音频与开源上的同期进展,便于横向比较当前能力边界。
ComfyUI 在 LTX-2.5 发布当天提供支持,开放权重版含 dev 与 distilled 两个变体,另可通过 Partner Nodes 调用 Fast 和 Pro。
推荐理由:ComfyUI 官方给出 LTX-2.5 的 Day-0 支持范围与两种使用路径,读者可据此判断本地部署还是走 Partner Nodes。
MiniMax H3 今日发布并开放权重,ComfyUI 当天完成原生支持。这是 MiniMax 第三代视频模型,前两代为 Hailuo 01 和 Hailuo 02,H3 是首个开放权重的版本,支持文生视频、图生视频、首尾帧控制和参考生视频,输出最高 2K、单段最长 15 秒,音频与视频同一次生成、原生立体声。
推荐理由:ComfyUI 官方给出 H3 的本地部署路径与显存优化细节,读者可据此判断消费级显卡能否跑起 2K 视频生成。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并经 FlashDreams 加速推理库部署。
Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载量化 checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,也无需单独的推理引擎。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断能否在消费级显卡上跑扩散模型。
ComfyUI 背后的 Comfy Org 与伦敦艺术大学创意计算研究所(CCI)达成 Creative Campus 合作,CCI 成为即将推出的 Comfy Education Initiative 创始合作伙伴。
Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。
推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。
fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。
推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。
fal.ai 在 8 张 B200 上对视频扩散模型常用的 Ulysses 上下文并行做了通信-计算重叠实验:Async Ulysses 让 pre-attention 分块延迟在 2/4/8 GPU 下降约 23–25%,端到端提升约 3%。