跳到正文

模型与工具更新

视频模型的发布、版本更新与工具上新:能力、价格、可用性的第一时间记录。

24条精选相关主题可灵 AISora(OpenAI)ComfyUI

最新精选

第 21–24 条 · 共 24 条
7月1日周三
  1. Google DeepMind(Veo)80

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。

    推荐理由:原文给出两款新模型的定价、延迟与能力边界,读者可据此判断能否接入自己的图像与视频工作流。

5月18日周一
  1. Google DeepMind(Veo)62

    Google DeepMind 为 Project Genie 加入 Street View 实景锚定能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成起始位置对应真实街景的交互世界。

    推荐理由:原文说明了 Street View 实景锚定在 Project Genie 中的使用方式与开放范围,可据此判断它能否用于智能体或机器人训练场景。

  2. Google DeepMind(Veo)88

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑

    Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言对话进行多轮编辑,保持角色一致性与物理表现。

    推荐理由:Gemini Omni Flash 支持图像、音频、视频和文本混合输入生成视频,并可用自然语言多轮编辑,读者可据此判断它能否接入自己的创作流程。

3月20日周五
  1. fal.ai Blog62

    fal.ai 发布 fal MCP Server,让 AI 助手直接调用 1000+ 生成模型

    fal.ai 发布 fal MCP Server,这是一个托管端点,让 Claude、Cursor、Windsurf 等 AI 助手在对话中搜索、运行并串联 1000+ 生成式 AI 模型,覆盖图像、视频、音频、3D 与超分。

    推荐理由:原文给出 fal MCP Server 的接入命令与 9 个工具清单,读者可据此判断能否把自家模型调用接进对话式助手。