跳转至

Encode Media Latent 算子节点

调用管线绑定的 VAE 编码器(Encoder)对输入图像或视频执行空间特征压缩,生成可直接送入去噪调度器的潜空间张量——是图生图 (Image-to-Image) 与视频重绘 (Video-to-Video) 工作流的标志性入口起点。

算子所属分类:ModularDiffusion/Encode\Decode


核心速查 (TL;DR)

  • 输入插槽动态自适应切换 (Dynamic slot):连入 pipeline 后,输入插槽会自动变更为图像管线对应的 image,或视频管线(如 LTX、LTX2、WAN 等)对应的 input_video;
  • 潜变量标准对齐:编码产出的潜空间张量经过了规范化解包——其张量维度与数学流形与 Create Noise Latents 产出的初始噪声张量保持百分之百结构兼容,可以直接接入所有的潜空间代数运算(加减乘)或蒙版合成算子;
  • 与下游去噪节点的 add_noise=True 协同实现经典图生图:送入下游 Generate Media Latents 时开启 add_noise=True。所注入的扰动噪声强度由下游节点的 start_step 严格数学调控(等价重绘幅度公式:$\text{strength} = 1 - \frac{\text{start_step}}{\text{num_inference_steps}}$)。以总步数 num_inference_steps=20 为例:
    • start_step=0 $\rightarrow$ 全量噪声(重绘幅度 1.0):原始画面被彻底抹平覆盖,行为退化为纯文本生图;
    • start_step=10 $\rightarrow$ 半量噪声(重绘幅度 0.5):在原图大体结构与新生成构图之间取得完美平衡;
    • start_step=18 $\rightarrow$ 极低噪声(重绘幅度 0.1):仅微调微观高频细节,最大程度锁定原图画面内容。

典型工作流编排拓扑

Load Image (参考素材) → [Encode Media Latent] → Generate Media Latents → Decode Media Latent

节点外观预览

Encode Media Latent 算子节点外观


输入端口规范 (Inputs)

端口名称 数据类型 是否必填 详细功能与业务规范说明
pipeline Pipeline Config 是 来自上游 Pipeline Builder。决定当前节点展示 image 还是 input_video 插槽,并决定调用哪个 VAE 编码器。
image ImageArtifact / ImageUrlArtifact 仅在图像管线下必填 输入的源图像素材文件。
input_video VideoArtifact / VideoUrlArtifact 仅在视频管线下必填 输入的源视频流素材。

输出端口矩阵 (Outputs)

端口名称 数据类型 详细功能与业务规范说明
latent_tensor LatentArtifact 经 VAE 压缩编码后的强类型潜空间特征张量,无损承载原素材的高维特征。

避坑技巧与最佳实践 (Tips & pitfalls)

  • 管线架构类型决定输入端口形态:图像架构(如 Flux、SD3、SDXL 等)仅展示 image 端口;时序视频架构(如 LTX、WAN)则呈现 input_video。如果更换了不同生态的 Pipeline Builder,原有的连线插槽可能会发生变动,请在切换模型后检查并重新连接输入线缆。
  • 纯粹的从零文生图请勿选用本节点:若你的意图是仅凭提示词从空白画布开始生成画面,请始终改用 Create Noise Latents 生成纯高斯随机噪声。本节点专用于图生图、视频风格迁移或作为局部蒙版替换的源特征池。

推荐延伸阅读

  • Encode Masked Media Latent — 局部重绘 (Inpaint) 专用的带蒙版空间编码算子
  • Decode Media Latent — 逆向操作算子,负责将潜变量反向还原为直观像素
  • 经典图生图工作流源码:workflows/templates/Image2Image.py