跳到正文
7月27日周一
7月24日周五
  1. ComfyUI 官方博客39

    ComfyUI 推出 Comfy Team 团队协作计划

    ComfyUI 上线 Comfy Team 计划,将团队集中到一个共享工作区、一个共享 credit 池和一张账单中,管理员可管理账单、邮件邀请成员并随时移除访问权限。该计划不按席位定价,分五档月度 credit 承诺,从 $200 到 $2,500,年度方案最高可享 20% 折扣、月度最高 10% 折扣。后续将加入共享工作流与素材库、用户/项目/工作区级预算、按项目计费和自动充值。

7月23日周四
  1. Hugging Face Blog62

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载量化 checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,也无需单独的推理引擎。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断能否在消费级显卡上跑扩散模型。

7月16日周四
  1. ComfyUI 官方博客66

    ComfyUI 为 Comfy MCP 上线批量生成工具

    ComfyUI 为 Comfy MCP 推出批量生成能力,新增 submit_batch、get_batch_status、get_batch_output 三个工具,单次调用最多提交 50 个任务,可混合合作方模型与自有工作流,返回一个 batch_id,且该 batch_id 可跨会话保留,提交后次日在新会话中仍能收集结果。

    推荐理由:Comfy MCP 新增批量提交与收集工具,并给出角色拍摄、素材矩阵等真实生产用例,可据此判断批量出片能否接入现有流程。

7月15日周三
  1. Hugging Face Blog62

    Thinking Machines 发布 Inkling 与 Inkling-Small 多模态开源模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列多模态开源模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生支持图像、文本和音频输入,上下文窗口 1M,训练数据 45 万亿 token。

    推荐理由:原文给出 Inkling 系列的参数规模、多模态输入与部署配置,读者可据此判断本地或云端部署的硬件门槛。

7月13日周一
  1. fal.ai Blog78

    fal.ai 开源 3DREAL Strong v2 适配器,并公开 3D 灰模转实拍短片全流程

    fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。

    推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。

7月11日周六
7月8日周三
7月3日周五
  1. Google DeepMind(Veo)36

    Google DeepMind 与 A24 宣布首个研究型合作伙伴关系

    Google DeepMind 与 A24 宣布达成首个研究型合作伙伴关系,将顶尖研究实验室与电影人导向的制片厂配对,帮助艺术家开发新工作流与技术。双方将围绕多个项目展开长期深度研发协作,Google 同时已对 A24 进行投资。该合作初期聚焦弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。

7月1日周三
  1. Google DeepMind(Veo)80

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。

    推荐理由:原文给出两款新模型的定价、延迟与能力边界,读者可据此判断能否接入自己的图像与视频工作流。

6月29日周一
5月20日周三
  1. fal.ai Blog22

    fal 与 AWS 达成战略合作,共建生成式媒体下一阶段基础设施

    fal 宣布与 Amazon Web Services 达成战略合作,为其生成式媒体平台引入 AWS 的全球算力与弹性基础设施。目前已有超过 250 万开发者在 fal 上构建应用,Amazon MGM Studios、Canva 和 Adobe 每天在该平台运行图像、视频、音频和 3D 生产工作负载。fal CTO 表示,AWS 提供的全球规模与可靠性层将帮助其推理引擎覆盖更多生产级团队。

5月18日周一
  1. Google DeepMind(Veo)62

    Google DeepMind 为 Project Genie 加入 Street View 实景锚定能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成起始位置对应真实街景的交互世界。

    推荐理由:原文说明了 Street View 实景锚定在 Project Genie 中的使用方式与开放范围,可据此判断它能否用于智能体或机器人训练场景。

  2. Google DeepMind(Veo)88

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑

    Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言对话进行多轮编辑,保持角色一致性与物理表现。

    推荐理由:Gemini Omni Flash 支持图像、音频、视频和文本混合输入生成视频,并可用自然语言多轮编辑,读者可据此判断它能否接入自己的创作流程。

5月17日周日
3月20日周五
  1. fal.ai Blog62

    fal.ai 发布 fal MCP Server,让 AI 助手直接调用 1000+ 生成模型

    fal.ai 发布 fal MCP Server,这是一个托管端点,让 Claude、Cursor、Windsurf 等 AI 助手在对话中搜索、运行并串联 1000+ 生成式 AI 模型,覆盖图像、视频、音频、3D 与超分。

    推荐理由:原文给出 fal MCP Server 的接入命令与 9 个工具清单,读者可据此判断能否把自家模型调用接进对话式助手。

3月3日周二
2月26日周四
2月24日周二