본문 바로가기

AI영상생성3

MiniMax H3 특이성, 영상 생성에서 오디오까지 한 모델이 처리한다 MiniMax H3를 단순히 새로운 Text-to-Video 모델로 보면 가장 중요한 특징을 놓치게 된다. H3의 핵심은 영상 해상도나 생성 길이보다 텍스트·이미지·영상·오디오를 하나의 문맥으로 받아들이고, 영상과 소리를 함께 생성하도록 설계된 omni-modal 구조에 있다. MiniMax는 2026년 7월 H3를 공개하며 최대 2K 해상도, 최대 15초 영상과 네이티브 스테레오 오디오 생성을 주요 기능으로 제시했다.따라서 기존 I2V 워크플로우에서 영상 생성 후 별도의 TTS, 효과음, 음악 생성 단계를 이어 붙이던 사용자라면 H3를 볼 때 벤치마크 점수보다 먼저 확인할 부분이 있다. 영상과 오디오가 처음부터 같은 생성 문맥 안에서 만들어진다는 점이 실제 제작 파이프라인에 어떤 차이를 만드는가다.미니.. 2026. 8. 19.
LTX-2.5 ComfyUI VAE가 사라졌나? Diffusion Video Decoder 변화 LTX-2.5에서 눈여겨볼 변화 중 하나는 생성 모델 자체보다 마지막 영상을 복원하는 방식이다. 기존 LTX 계열에서 익숙했던 VAE 디코딩 단계에 Diffusion Video Decoder가 들어오면서, 얼굴이나 작은 텍스트, 빠르게 움직이는 장면을 복원하는 방식이 달라졌다.여기서 바로 생기는 질문이 있다. "그러면 LTX-2.5에서는 VAE가 사라진 것인가?" 결론부터 말하면 아니다. VAE의 역할이 없어졌다기보다 최종 복원 단계가 확장된 것으로 이해하는 편이 정확하다.vae관련 혹은 인코더 관련에서 가장 먼저 볼 변화LTX-2.5는 왜 일반 VAE Decode를 바꿨나일반적인 latent 기반 생성 모델에서는 픽셀 상태의 이미지나 영상을 작은 latent 표현으로 압축한 뒤, 모델이 이 공간에서 생.. 2026. 8. 18.
LTX-2.5 ComfyUI 네이티브 지원, 2.3 워크플로우와 달라진 점 LTX-2.5가 ComfyUI 0.32.0에 네이티브로 추가됐다. 기존 LTX-2.3 사용자가 가장 먼저 확인할 부분은 성능 수치보다 기존 워크플로우에 LTX-2.5 체크포인트만 넣으면 되는가다.결론부터 말하면 단순 체크포인트 교체 방식으로 접근하지 않는 편이 안전하다. LTX-2.5는 Transformer뿐 아니라 텍스트 인코더와 비디오 디코딩 계층까지 바뀌었고, ComfyUI 공식 템플릿도 LTX-2.5용으로 별도 제공된다.LTX-2.5 ComfyUI 네이티브 지원에서 가장 먼저 볼 변화LTX-2.5는 단순한 LTX-2.3 체크포인트 업데이트가 아니다LTX-2.3도 이미 22B 기반의 오디오·비디오 생성 모델이었으며 dev와 distilled 모델, spatial upscaler 등을 조합하는 구조를.. 2026. 8. 17.