AMD以82亿美元全股票收购李飞飞World Labs,李飞飞将任首席科学家
AMD宣布以82亿美元全股票收购李飞飞创办的空间智能公司World Labs,交易预计2026年底前完成,仍须取得监管批准。交割后李飞飞将加入AMD担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。
AMD宣布以82亿美元全股票收购李飞飞创办的空间智能公司World Labs,交易预计2026年底前完成,仍须取得监管批准。交割后李飞飞将加入AMD担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。
OpenAI 扩大 Lenfest AI 协作与奖学金计划,提供 500 万美元资金,以及最高 500 万美元的软件额度和工程支持。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的可用范围、多语言同步与自定义头像的开放条件,可据此判断能否接入企业对话场景。
OpenAI Academy 迎来两周年,目标是把 AI 技能带给更多社区。
Comfy Router 已在 Comfy Developer Platform 上线,开发者只需集成一次即可调用前沿图像、视频、3D 和音频模型,首日接入 Seedance 2.5、MiniMax H3、Nano Banana Pro、GPT Image 2、Kling 和 Black Forest Labs。
推荐理由:Comfy Router 把多家供应商的前沿图像、视频、3D、音频模型收进一个 API,读者可据此判断多供应商切换与排队重试是否适合自己的调用场景。
Anthropic 和 OpenAI 的新模型给出相同承诺:性能小幅提升,价格大幅下降。前沿 AI 模型竞赛已进入比价阶段。
ComfyUI 官方博客介绍 MiniMax H3 视频 VAE 的提速更新,编码最高约快 2.2 倍、解码快约 1.4-2.7 倍,1344x768、129 帧的编解码往返从 24.3 秒降到 12.7 秒。
推荐理由:原文给出 MiniMax H3 视频 VAE 在 ComfyUI 中的提速幅度、开启方式和画质数据,读者可据此判断是否值得升级。
ComfyUI 发布 v0.37.0,新增 Qwen-Image 2.1、MoGe 3 和 Meshy 7.1 支持,并为 GPT Image 2 加入透明背景功能。该版本在磁盘性能足够时自动启用 --fast-disk,动态显存下文本编码器常驻 GPU,同时为 YuE2 音乐生成节点加入 CFG 控制。
阿里 Qwen 团队的新图像模型 Qwen-Image-2.1 已在 ComfyUI 原生支持,开源权重、7B 参数,基于优化的 MMDiT 架构,可直接生成带 alpha 通道的 RGBA 图像。
推荐理由:ComfyUI 原生支持 Qwen-Image-2.1,读者可了解其 RGBA 输出、原生 2K 与最多 10 张参考图在生成和编辑中的具体用法。
H3 Max 生成 5 秒视频耗时不到 3 秒,在针对十二个领先视频模型的人类偏好评测中,其质量、提示词理解与美学均排名第一,Artificial Analysis 和 Design Arena 的独立基准测试同样将其列为第一。该模型由 fal Research 团队在 fal Compute 上完成后期训练,训练集群为互联的 GB200 NVL72 节点,最终训练运行耗时约一周到十天。
ComfyUI 推出 Forward Deployed Creative(FDCT)企业服务,由 Comfy 专家嵌入企业团队,在客户自己的 Comfy Enterprise 环境中用其模型与素材构建工作流。服务分 Validate、Build、Enable、Own 四步,并以团队能否自行修改工作流而非只会点“run”来衡量赋能效果。工作流最终交付归企业所有,FDCT 支持线在企业协议下保持开放。
ComfyUI 公布 Comfy × MiniMax H3 Sync Sound Challenge 获奖名单,要求音视频在同一次生成中产出、不得后期配音。
Gemini Omni 1.1 Flash 通过 Partner Nodes 接入 ComfyUI,在 Gemini Video Omni 节点中可选 Omni Flash 1.1,单个节点覆盖文生视频、图生视频、参考生视频、视频编辑和场景延展。
推荐理由:原文给出 Gemini Omni 1.1 Flash 在 ComfyUI 节点中的任务类型、分辨率档位与提示词写法,可据此判断能否接入现有工作流。
Comfy 宣布成为 MiniMax H3 商用许可的首个官方转售方,用户可通过 Comfy 获取本地商用授权。许可包含输出内容的完整商用权利、微调与 LoRA 训练、客户及下游项目使用,并覆盖 MiniMax 的音频与音乐模型;分 Professional 和 Enterprise 两档,Enterprise 可使用包括未蒸馏权重在内的全部 H3 模型版本。
fal Research 发布 H3 Max,这是基于开源权重 MiniMax H3 后训练的版本,由 fal 推理团队针对速度优化。官方称其 5 秒视频生成约需 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍,并在整体质量、提示词理解和美学三个维度的人类偏好评测中排名第一。
推荐理由:fal 公布 H3 Max 的偏好评测排名与生成速度数据,并说明后训练与推理协同优化的思路,可对照其与官方 H3 端点的差异。
r/aivideo 汇总了近期 AI 视频模型更新:Seedance 2.5 支持单次生成最长 30 秒的多镜头视频,最高 4K 并带同步音频;MiniMax 发布 H3 并开放 H3 Base 权重,可本地运行并接入 ComfyUI 等工具,本地生成 768p,2K 阶段仍为服务端。
推荐理由:汇总了 Seedance 2.5、MiniMax H3、Wan 3.0 等多家模型在时长、音频与开源上的同期进展,便于横向比较当前能力边界。
fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。
推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。
FASHN 面向时尚品牌提供目录级 on-model 图像生成与消费者虚拟试穿,在 fal 的 serverless 基础设施上支持企业客户 500 并发请求,可一次提交整季产品目录后批量产出成品图。
fal.ai 在 SGLang 上用 DSpark 为 Ideogram V4 的提示词扩展功能实现约 1000 tok/s 和 16 倍吞吐。该功能基于微调后的 Qwen 3.5 35B MoE(FP8)模型,此前在 SGLang 上并发为 1 时仅 328 tok/s,启用 MTP 投机解码后提升至 500 tok/s。
fal 营销与增长负责人 Tina Sang 在 Cannes Lions 后指出,AI 公司内部并未把工作流交给自主智能体,而是在制作 mockup、创意探索、快速起草初稿和可视化想法等环节选择性使用 AI。
fal 宣布与 Amazon Web Services 达成战略合作,为其生成式媒体平台引入 AWS 的全球算力与弹性基础设施。目前已有超过 250 万开发者在 fal 上构建应用,Amazon MGM Studios、Canva 和 Adobe 每天在该平台运行图像、视频、音频和 3D 生产工作负载。fal CTO 表示,AWS 提供的全球规模与可靠性层将帮助其推理引擎覆盖更多生产级团队。