NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式仿真
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并经 FlashDreams 加速推理库部署。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并经 FlashDreams 加速推理库部署。
ComfyUI 上线 Comfy Team 计划,将团队集中到一个共享工作区、一个共享 credit 池和一张账单中,管理员可管理账单、邮件邀请成员并随时移除访问权限。该计划不按席位定价,分五档月度 credit 承诺,从 $200 到 $2,500,年度方案最高可享 20% 折扣、月度最高 10% 折扣。后续将加入共享工作流与素材库、用户/项目/工作区级预算、按项目计费和自动充值。
Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载量化 checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,也无需单独的推理引擎。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断能否在消费级显卡上跑扩散模型。
ComfyUI 背后的 Comfy Org 与伦敦艺术大学创意计算研究所(CCI)达成 Creative Campus 合作,CCI 成为即将推出的 Comfy Education Initiative 创始合作伙伴。
ComfyUI 为 Comfy MCP 推出批量生成能力,新增 submit_batch、get_batch_status、get_batch_output 三个工具,单次调用最多提交 50 个任务,可混合合作方模型与自有工作流,返回一个 batch_id,且该 batch_id 可跨会话保留,提交后次日在新会话中仍能收集结果。
推荐理由:Comfy MCP 新增批量提交与收集工具,并给出角色拍摄、素材矩阵等真实生产用例,可据此判断批量出片能否接入现有流程。
Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。
推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。
fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。
推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。
FASHN 面向时尚品牌提供目录级 on-model 图像生成与消费者虚拟试穿,在 fal 的 serverless 基础设施上支持企业客户 500 并发请求,可一次提交整季产品目录后批量产出成品图。
fal.ai 在 SGLang 上用 DSpark 为 Ideogram V4 的提示词扩展功能实现约 1000 tok/s 和 16 倍吞吐。该功能基于微调后的 Qwen 3.5 35B MoE(FP8)模型,此前在 SGLang 上并发为 1 时仅 328 tok/s,启用 MTP 投机解码后提升至 500 tok/s。
Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,将顶尖研究实验室与电影人导向的制片厂配对,帮助艺术家开发新工作流与技术。双方将围绕多个项目展开长期深度研发协作,Google 同时已对 A24 进行投资。该合作初期聚焦弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:原文给出两款新模型的定价、延迟与能力边界,读者可据此判断能否接入自己的图像与视频工作流。
fal 营销与增长负责人 Tina Sang 在 Cannes Lions 后指出,AI 公司内部并未把工作流交给自主智能体,而是在制作 mockup、创意探索、快速起草初稿和可视化想法等环节选择性使用 AI。
fal 宣布与 Amazon Web Services 达成战略合作,为其生成式媒体平台引入 AWS 的全球算力与弹性基础设施。目前已有超过 250 万开发者在 fal 上构建应用,Amazon MGM Studios、Canva 和 Adobe 每天在该平台运行图像、视频、音频和 3D 生产工作负载。fal CTO 表示,AWS 提供的全球规模与可靠性层将帮助其推理引擎覆盖更多生产级团队。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成起始位置对应真实街景的交互世界。
推荐理由:原文说明了 Street View 实景锚定在 Project Genie 中的使用方式与开放范围,可据此判断它能否用于智能体或机器人训练场景。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言对话进行多轮编辑,保持角色一致性与物理表现。
推荐理由:Gemini Omni Flash 支持图像、音频、视频和文本混合输入生成视频,并可用自然语言多轮编辑,读者可据此判断它能否接入自己的创作流程。
Google 在 Search、Gemini、Chrome、Pixel 和 Cloud 中扩展内容透明度与验证工具,SynthID 已为超 1000 亿张图片和视频、6 万年音频嵌入水印。
fal.ai 发布 fal MCP Server,这是一个托管端点,让 Claude、Cursor、Windsurf 等 AI 助手在对话中搜索、运行并串联 1000+ 生成式 AI 模型,覆盖图像、视频、音频、3D 与超分。
推荐理由:原文给出 fal MCP Server 的接入命令与 9 个工具清单,读者可据此判断能否把自家模型调用接进对话式助手。
HeyGen 的模型现已上线 fal,提供 Video Agent、Avatar IV、Video Translate 和 Avatar Video 等能力。Video Agent API 输入提示词或 URL 即可端到端完成脚本撰写、素材选择与剪辑,输出完整视频;Avatar IV API 用单张照片生成带自然表情和手势的说话数字人。
fal 团队基于 1000 次以上测试生成,给出 Seedream 5.0 Lite 的提示词结构 Subject > Setting > Style > Lighting > Technical,并称该模型会先对提示词做多步推理再出图。
推荐理由:作者基于上千次测试给出 Seedream 5.0 Lite 的提示词结构与编辑用法,可迁移到自己的出图流程。
fal.ai 在 8 张 B200 上对视频扩散模型常用的 Ulysses 上下文并行做了通信-计算重叠实验:Async Ulysses 让 pre-attention 分块延迟在 2/4/8 GPU 下降约 23–25%,端到端提升约 3%。