> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-chore-sync-comfy-api-v2-spec.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMaxH3ReferenceToVideo - ComfyUI Built-in Node Documentation

> MiniMax H3 Reference to Video creates the text conditioning and the empty audio-video latent needed for MiniMax H3 reference-to-video generation.

## 입력

| 매개변수               | 설명                                                                                                                                                                                             | 데이터 타입 | 필수  | 범위                     |
| ------------------ | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------ | --- | ---------------------- |
| `clip`             | 프롬프트를 토큰화하고 참조 미디어를 컨디셔닝 토큰으로 인코딩하는 데 사용되는 CLIP 모델입니다.                                                                                                                                         | CLIP   | 예   |                        |
| `vae`              | 참조 이미지와 참조 비디오 프레임을 잠재 공간으로 인코딩하는 데 사용되는 VAE입니다.                                                                                                                                               | VAE    | 예   |                        |
| `audio_vae`        | 참조 오디오를 잠재 공간으로 인코딩하는 데 사용되는 VAE입니다. 오디오는 오디오 VAE 샘플 레이트(기본값 32kHz)로 리샘플링됩니다.                                                                                                                  | VAE    | 예   |                        |
| `prompt`           | 비디오용 텍스트 프롬프트입니다. 참조 미디어는 `<Picture i>`, `<Video k>`, `<Audio j>` 태그(각 유형별 1부터 시작)로 지정할 수 있습니다. 여러 줄 및 동적 프롬프트를 지원합니다.                                                                         | STRING | 예   |                        |
| `width`            | 생성되는 비디오의 너비(픽셀)입니다(기본값: 1344).                                                                                                                                                                | INT    | 예   | 32 \~ 16384 (step 32)  |
| `height`           | 생성되는 비디오의 높이(픽셀)입니다(기본값: 768).                                                                                                                                                                 | INT    | 예   | 32 \~ 16384 (step 32)  |
| `length`           | 24fps에서의 프레임 수입니다. 124 = 약 5초, 학습된 범위는 약 124-362입니다(기본값: 124).                                                                                                                                 | INT    | 예   | 5 \~ 3600 (step 17)    |
| `ref_image_size`   | 참조 이미지 크기 조정 방식입니다. `match`는 각 참조 이미지의 종횡비를 유지하면서 생성 픽셀 영역에 맞춰 축소만 수행합니다. `max`는 참조 파이프라인의 2048px 짧은 변을 사용하여 최상의 정체성 충실도를 얻습니다. 참조 토큰은 모든 샘플링 단계에서 전달되므로 `max`는 몇 배 더 느릴 수 있습니다(기본값: `match`). | COMBO  | 예   | `"match"`<br />`"max"` |
| `ref_images`       | 확장 가능한 슬롯: 참조 이미지 1\~9개(`ref_image_1` ... `ref_image_9`)를 연결합니다. 각 이미지는 더 큰 경우 2048px 짧은 변으로 축소되며 절대 확대되지 않습니다.                                                                                | IMAGE  | 아니요 | 0 \~ 9                 |
| `ref_videos`       | 확장 가능한 슬롯: 참조 비디오 1~~3개(`ref_video_1` ... `ref_video_3`)를 연결합니다. 24fps(2~~15초)의 참조 비디오 프레임입니다.                                                                                                 | IMAGE  | 아니요 | 0 \~ 3                 |
| `ref_video_audios` | 확장 가능한 슬롯: 사운드트랙 1\~3개(`ref_video_audio_1` ... `ref_video_audio_3`)를 연결합니다. 같은 번호의 참조 비디오 사운드트랙입니다.                                                                                            | AUDIO  | 아니요 | 0 \~ 3                 |
| `ref_audios`       | 확장 가능한 슬롯: 독립형 참조 오디오 클립 1\~3개(`ref_audio_1` ... `ref_audio_3`)를 연결합니다.                                                                                                                        | AUDIO  | 아니요 | 0 \~ 3                 |

참고:

* 프롬프트는 유형별로 1부터 시작하는 태그를 사용하여 참조 미디어를 지정합니다: 이미지는 `<Picture i>`, 비디오는 `<Video k>`, 오디오는 `<Audio j>`입니다. 참조는 고정된 순서로 모델에 제공됩니다: 이미지, 그 다음 비디오(각 사운드트랙의 `<Audio j>` 라벨은 해당 `<Video k>` 바로 앞에 위치), 그 다음 독립형 오디오 순서입니다.
* 참조 비디오는 최소 5프레임(24fps에서 약 0.2초)을 포함해야 합니다. 그렇지 않으면 노드에서 오류가 발생합니다. 비디오 프레임은 선택한 `length`로 제한되고 지원되는 프레임 수로 잘립니다.
* 요청된 `length`는 잠재 변수가 생성되기 전에 지원되는 프레임 수로 정렬됩니다.

## 출력

| 출력 이름      | 설명                                                                    | 데이터 타입       |
| ---------- | --------------------------------------------------------------------- | ------------ |
| `positive` | 프롬프트와 함께 MiniMax H3 모델이 사용하는 인코딩된 참조 이미지, 비디오 및 오디오 토큰을 포함하는 컨디셔닝입니다. | CONDITIONING |
| `latent`   | 요청된 `width`, `height`, `length`(프레임 수)에 해당하는 빈 오디오-비디오 잠재(latent)입니다. | LATENT       |

> 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/MiniMaxH3ReferenceToVideo/ko.md)

***

**Source fingerprint (SHA-256):** `d9a444e712cdc255d7c56a3ab38d0523659f198b3228b9283a7028cfd0e4f3f9`
