输入
注意:
clip_vision_output 必须来自提供完整隐藏状态和倒数第二个隐藏状态的 CLIP 视觉模型。该节点会将倒数第 20 个、倒数第 11 个和倒数第二个隐藏状态组合为风格嵌入。model_patch 必须通过其 model 属性暴露一个投影模型,该投影模型会将这些图像特征转换为风格嵌入。在采样过程中,风格嵌入会被添加到文本条件序列的开头,从而影响生成结果。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
9033dddb76fafb388c67dcd09d96102a7ab3e5bc416cec61bf18d088da37a0f0