LTX-2.5: Lightricks가 생성 영상 가중치를 API 밖으로 꺼냈지만, 라이선스는 여전히 “조건부”
Lightricks(LTX)는 2026년 8월 11일 가중치를 공개한 영상·오디오 생성 모델 LTX‑2.5를 내놓았다. 파트너사들의 발언이 담긴 보도자료가 돈 것은 8월 13일이다. Hugging Face의 공식 모델 카드는 220억 파라미터 규모의 diffusion transformer라고 설명하며, ComfyUI 릴리스 노트에서는 이를 “asymmetric dual‑stream”이라 부른다. 가중치는 여러 변형이 공개됐다. 증류된 DiT(bf16, int8, NVFP4)와 완전한 학습 가능 DiT(bf16, int8), 그리고 영상·오디오 VAE, 업스케일러, LoRA, “duration head” 패치가 함께 배포된다. 텍스트 인코더는 LTX에 맞춰 조정된 120억 파라미터 Gemma 4이며, GitHub의 공식 저장소는 표준 Gemma 4는 호환되지 않는다고 못 박는다.
발표된 기능에는 한 번의 생성으로 처리하는 네이티브 멀티숏(컷이 바뀌어도 인물·배경·목소리의 일관성 유지), 영상과 함께 생성되는 동기화 오디오, 길이 자동 예측, 4K HDR 출력, 그리고 고정 압축률 대신 장면 복잡도에 따라 연산을 배분하는 “Diffusion Fidelity Rendering”이 있다. 공식 저장소가 나열한 생성 모드는 텍스트→영상, 이미지→영상, 영상→영상, 오디오→영상, 키프레임 보간, 영역 재생성이다. 모델 카드에 적힌 소프트웨어 요구 사항은 Python 3.12 이상, CUDA 12.7 이상, PyTorch 2.7 안팎이며, 증류 모델에는 8스텝 고정 스케줄이 마련돼 있다. ComfyUI는 첫날부터 지원하고, 텍스트→영상, 이미지→영상, 첫/마지막 프레임→영상용 공식 템플릿을 제공한다.
실사용 측면에서 Lightricks는 이미지에서 만든 10초 클립이 NVIDIA GB200 슈퍼칩 두 개에서 6.8초, LTX API를 통하면 23.7초 걸린다고 밝혔다. 최소 사양으로는 VRAM 16GB를 제시한다. 공개된 API 요금은 720p 초당 0.09달러, 1080p 0.15달러, 2K 0.19달러, 4K 0.37달러다. LTX가 배포한 자료에서 아티팩트 점수(낮을수록 좋다)는 LTX‑2.5 Pro가 0.28, LTX‑2.5 Fast가 0.39로, Seedance 2.5의 0.69와 Google Veo 3.1의 1.20보다 낮다. LTX 스스로 예비 수치라고 부른다.
라이선스는 LTX‑2.x Community License다. 연 매출 1000만 달러 미만이면 상업적 이용이 무료이고, 그 이상이면 유료 계약이 필요하다. OSI가 승인한 오픈소스 라이선스가 아니며, 변경 사항 통지 의무를 부과하고 합성 콘텐츠 표시 장치를 제거하거나 우회하는 것을 금지한다. 이번 릴리스에는 도메인 데이터 파인튜닝을 염두에 둔, 피지컬 AI와 로보틱스용 사전학습 체크포인트도 포함됐다. “월드 모델”이라는 자리매김에 대해 LTX/Lightricks 공동창업자이자 최고경영자인 Zeev Farbman은 8월 13일 배포된 자료에서 이렇게 말했다. “World models face challenges that LLMs never had to solve, like holding motion, space, and sound consistent across time”(월드 모델은 LLM이 풀 필요가 없었던 과제, 즉 움직임과 공간과 소리를 시간에 걸쳐 일관되게 유지하는 문제와 마주한다). 로컬 실행에 대해서는 NVIDIA의 Local AI 담당 시니어 디렉터 Gerardo Delgado Cabrera가 같은 8월 13일 자료에서 말했다. “Local models enable creators and developers to freely explore their ideas thanks to their local GPUs”(로컬 모델은 손안의 GPU 덕분에 창작자와 개발자가 아이디어를 자유롭게 탐색할 수 있게 해준다).
이 수치들 가운데 지금까지 제3자가 재현한 것은 하나도 없다. 전부 제작사의 주장이다. LTX가 공개한 비교는 방법론적으로 균질하지 않다. 경쟁 모델은 대체로 720p에서 측정된 반면 LTX는 자체 1080p 측정이고, 다른 모델의 소요 시간에는 대기열과 제3자 호스팅(fal.run)이 포함되며, Veo 3.1과의 비교는 8초 클립 대 LTX의 10초다. 6.8초는 GB200 두 개를 쓴 결과로, 흔한 하드웨어가 아니다. VRAM 16GB 최소 사양에 대한 독립 측정치는 없고, int8/NVFP4 양자화와 fp8 캐스트, CPU 오프로드로 인한 품질 저하 검증도 없다. 멀티숏 일관성, VAE 대비 디퓨전 디코더의 이점, 길이 예측기의 작동도 확인되지 않은 채다. 아티팩트 점수는 98개 프롬프트를 10개 모델에 돌린 자동 측정이며, LTX는 프롬프트 전체를 공개하지 않았다. 모델 카드 자체도 한계를 명시한다. 사실 정보를 제공하도록 설계되지 않았고, 사회적 편견을 증폭할 수 있으며, 프롬프트 준수도가 글쓰기 방식에 따라 달라져 요청과 맞지 않는 결과가 나올 수 있다는 것이다. 사소한 메모: Hugging Face 페이지의 한 항목에 2026년 1월 6일이라는 날짜가 적혀 있어 8월 11일 발표와 어긋난다(LTX‑2의 잔재로 보인다). 3300만 회가 넘는다는 다운로드 수는 이 모델이 아니라 LTX 제품군 전체를 가리킨다.
LTX는 쓸모 있는 길을 열었다. 내려받을 수 있는 가중치, ComfyUI에서 바로 쓰는 파이프라인, 로보틱스를 향한 구체적인 신호. 다만 매출에 연동된 라이선스 조건은 여기서 “오픈”이 무엇보다 검증 가능하다는 뜻이지 조건에서 자유롭다는 뜻은 아님을 상기시킨다. 다음에 흥미로운 소식은 데모가 아니라, 독립적인 재현과 평범한 GPU에서 나온 첫 의미 있는 벤치마크일 것이다. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Hugging Face의 공식 모델 카드(Lightricks/LTX-2.5)와 GitHub의 Lightricks/LTX-2 저장소를 읽고 파라미터, 가중치 변형, Gemma 4 12B 인코더, 생성 모드, 소프트웨어 요구 사항, 라이선스, 제작사가 밝힌 한계를 확인했다. 공개 날짜와 파일은 2026년 8월 11일 자 ComfyUI Wiki 문서와, 임원 발언(LTX, Markov Robotics, ComfyUI, NVIDIA)은 8월 13일 Robotics & Automation News 기사와 대조했다. 벤치마크는 LTX 비교의 방법론적 불일치를 짚은 NYU Shanghai RITS의 비판적 분석을 참고했다. ltx.io/model/ltx-2-5 페이지와 VentureBeat 기사는 세션 중 접근할 수 없었으나(헤더 오류, HTTP 403/429), 두 곳이 인용한 사실은 위의 공개 자료로 모두 확인된다. Stripe–OpenRouter 소식은 일차 출처가 없어 제외했다. 익명 소식통을 인용한 Bloomberg 보도뿐이고, Stripe 대변인은 소문이나 추측에 논평하지 않는다고 밝혔으며, 금액도 70억과 80억 사이에서 엇갈린다.
- Incertezze
- 속도와 품질 수치는 모두 제작사의 주장이며 제3자 재현이 아직 없다. LTX가 공개한 비교에는 인정된 방법론적 문제가 있다. 경쟁 모델은 대체로 720p에서 측정된 반면 LTX API 수치는 자체 1080p 측정이고, 다른 모델의 시간에는 대기열과 제3자 호스팅(fal.run)이 들어가며, Veo 3.1 비교는 8초 클립 대 LTX 10초다. 아티팩트 점수는 98개 프롬프트에 대한 자동 측정인데 프롬프트 전체는 공개되지 않았다. 6.8초는 GB200 두 개 기준으로, 일반 사용자가 접근할 수 있는 하드웨어가 아니다. 공표된 최소 사양 VRAM 16GB에 대한 독립 측정치는 없고, int8/NVFP4 양자화와 fp8 캐스트, CPU 오프로드가 부르는 품질 저하 검증도 없다. 멀티숏 일관성, VAE 대비 디퓨전 디코더의 이점, 길이 예측기 역시 확인되지 않았다. 사소한 메모: Hugging Face 페이지의 한 항목이 2026년 1월 6일로 표시돼 8월 11일 발표와 어긋나는데, LTX‑2 저장소의 잔재로 보인다. 3300만 회 이상의 다운로드는 LTX 제품군 전체 수치이지 이 모델의 것이 아니다.
- Perché pubblicarla
- 가중치를 내려받을 수 있으면서 최상위 성능을 표방하는 첫 상용급 영상·오디오 모델이고, 질문을 «어느 API가 더 싼가»에서 «집에서 무엇을 돌릴 수 있는가»로 옮겨 놓는다. 클라우드 예산 없이 영상 작업을 하는 독자에게는 곧 자기 문제다. 정직한 편집 작업에도 알맞은 소재다. 수치는 전부 제조사 발이고, 라이선스는 열려 있다고 이야기되지만 OSI 정의로는 그렇지 않으며, 로보틱스 체크포인트는 업계가 이 모델들을 어디로 데려가려는지 보여준다. 검증된 것과 마케팅을 갈라내는 일, 그것이 우리가 더할 수 있는 가치다.