要不要给 H3 做个远程文本编码 API,把 32B 编码器从 GPU 上挪走?
ComfyUI 用户 frankmanbb 提议为 H3 做一个纯文本编码 API:本地只留 DiT 和 VAE,把提示词发给远程接口,返回 H3 兼容的 text conditioning 张量,从而不必在 24–32GB 显卡上同时装下约 20–25GB 的 DiT 和截断版 Qwen3-VL-32B 编码器。
ComfyUI 用户 frankmanbb 提议为 H3 做一个纯文本编码 API:本地只留 DiT 和 VAE,把提示词发给远程接口,返回 H3 兼容的 text conditioning 张量,从而不必在 24–32GB 显卡上同时装下约 20–25GB 的 DiT 和截断版 Qwen3-VL-32B 编码器。
MiniMax-H3-Character-Swap-LoRA 的 1000 步最终版已发布,并配套 REF2VA 工作流,可输入源视频与单张角色设定图完成角色替换,同时保留其余画面元素并迁移设定图的渲染风格,无需触发词,但近景面部表情常无法跟随。
作者在 ComfyUI 中把 SeedVR2 的 VAE Encoder 跑通到 TensorRT,发布 ComfyUI-SeedVR2-VideoUpscaler-with-TensorRT v1.5.5,v1.5.4 修复了 TensorRT VAE Decoder 左上角伪影。
ComfyUI 官方博客介绍 MiniMax H3 视频 VAE 的提速更新,编码最高约快 2.2 倍、解码快约 1.4-2.7 倍,1344x768、129 帧的编解码往返从 24.3 秒降到 12.7 秒。
推荐理由:原文给出 MiniMax H3 视频 VAE 在 ComfyUI 中的提速幅度、开启方式和画质数据,读者可据此判断是否值得升级。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成。
推荐理由:原文完整拆解了 Workflow1111 的十一条管线与节点构成,可对照 ComfyUI 判断这类画布工作流的适用边界。
Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载量化 checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,也无需单独的推理引擎。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断能否在消费级显卡上跑扩散模型。
fal.ai 发布并开源 3DREAL Strong v2 适配器,该 LoRA 基于 LTX 2.3,可将 3D 灰模渲染为写实画面,新增跨镜头一致性、同步音频生成和更好的说话角色表现,权重已在 Hugging Face 上线,托管端点 fal-ai/ltx-2.3-quality/render-to-real 已支持。
推荐理由:原文完整公开了三段式提示词与各阶段验证工具,读者可据此复现从3D灰模到成片的可控流程。