LTX-2.5: Lightricks haalt de gewichten van generatieve video buiten de API, maar de licentie blijft “voorwaardelijk”
Lightricks (LTX) bracht op 11 augustus 2026 LTX‑2.5 uit, een generatief video‑audiomodel met open gewichten; het persbericht met de uitspraken van partners circuleerde op 13 augustus. De officiële model card op Hugging Face beschrijft een diffusion transformer van 22 miljard parameters, in de releasenotitie van ComfyUI “asymmetric dual‑stream” genoemd. Er zijn meerdere varianten van de gewichten gepubliceerd: een gedistilleerde DiT (bf16, int8, NVFP4) en een volledige, trainbare DiT (bf16, int8), samen met video‑ en audio‑VAE’s, een upscaler, LoRA’s en een “duration head”‑patch. De tekstencoder is een Gemma 4 van 12 miljard, bijgesteld voor LTX; de officiële repository op GitHub stelt dat de standaard Gemma 4 niet compatibel is.
Tot de aangekondigde functies horen native multishot‑generatie in één doorloop (personage, omgeving en stem blijven consistent over de sneden heen), geluid dat synchroon met het beeld wordt gegenereerd, automatische voorspelling van de duur, 4K HDR‑uitvoer en “Diffusion Fidelity Rendering”, dat rekenkracht verdeelt naar de complexiteit van de scène in plaats van een vaste compressieverhouding toe te passen. De officiële repository somt de generatiemodi op: tekst→video, beeld→video, video→video, audio→video, keyframe‑interpolatie en het opnieuw genereren van regio’s. Softwarevereisten volgens de model card: Python ≥ 3.12, CUDA ≥ 12.7, PyTorch ~2.7; voor de gedistilleerde modellen geldt een vast schema van 8 stappen. ComfyUI ondersteunt het vanaf dag één, met officiële templates voor tekst→video, beeld→video en eerste/laatste frame→video.
In de praktijk stelt Lightricks dat een clip van 10 seconden gegenereerd uit een beeld 6,8 seconden kost op twee NVIDIA GB200‑superchips en 23,7 seconden via de LTX‑API; als minimum wordt 16 GB VRAM genoemd. De gepubliceerde API‑tarieven zijn $0,09/s bij 720p, $0,15/s bij 1080p, $0,19/s bij 2K en $0,37/s bij 4K. In de door LTX verspreide cijfers is de artefactscore (lager is beter) 0,28 voor LTX‑2.5 Pro en 0,39 voor LTX‑2.5 Fast, tegenover 0,69 voor Seedance 2.5 en 1,20 voor Google Veo 3.1; LTX noemt hem voorlopig.
De licentie is de LTX‑2.x Community License: commercieel gebruik is gratis onder 10 miljoen dollar jaaromzet, daarboven volgt een betaalde overeenkomst. Het is geen door de OSI goedgekeurde opensourcelicentie en ze legt een meldplicht voor wijzigingen op, plus een verbod om mechanismen voor het aanduiden van synthetische inhoud te verwijderen of te omzeilen. De release bevat ook een voorgetraind checkpoint voor fysieke AI en robotica, bedoeld voor fine‑tuning op domeindata. Over de positionering als “world model” zegt medeoprichter en topman van LTX/Lightricks Zeev Farbman in de op 13 augustus verspreide notities: “World models face challenges that LLMs never had to solve, like holding motion, space, and sound consistent across time” (world models staan voor uitdagingen die LLM’s nooit hoefden op te lossen: beweging, ruimte en geluid consistent houden in de tijd). Over lokaal draaien zegt Gerardo Delgado Cabrera, senior director Local AI bij NVIDIA, in dezelfde notities van 13 augustus: “Local models enable creators and developers to freely explore their ideas thanks to their local GPUs” (lokale modellen laten makers en ontwikkelaars hun ideeën vrij verkennen dankzij hun lokale GPU’s).
Geen van deze cijfers is tot nu toe door derden gereproduceerd: het zijn allemaal uitspraken van de leverancier. De vergelijking die LTX publiceerde is methodologisch ongelijk: concurrenten grotendeels gemeten op 720p tegenover een interne meting van LTX op 1080p; in de tijden van anderen zitten wachtrij en hosting bij derden (fal.run); de vergelijking met Veo 3.1 gebruikt een clip van 8 seconden tegen 10 seconden voor LTX. De 6,8 seconden slaan op twee GB200’s, geen alledaagse hardware; er zijn geen onafhankelijke metingen bij het minimum van 16 GB VRAM, en evenmin controles op de achteruitgang door int8/NVFP4‑kwantisatie, fp8‑cast en CPU‑offload. Onbevestigd blijven ook de multishot‑consistentie, het voordeel van de diffusiedecoder boven de VAE en de werking van de duurvoorspeller. De artefactscore is een automatische meting over 98 prompts die door 10 modellen zijn gehaald, en LTX heeft de volledige promptset niet gepubliceerd. De model card zelf noemt uitdrukkelijke beperkingen: het model is niet bedoeld om feitelijke informatie te leveren, het kan sociale vooroordelen versterken en de trouw aan de prompt wisselt met de schrijfstijl, tot generaties die niet aan het verzoek voldoen. Kleine kanttekening: in één veld van de Hugging Face‑pagina staat de datum 6 januari 2026, wat niet strookt met de aankondiging van 11 augustus (waarschijnlijk een restant van LTX‑2). Het cijfer van 33+ miljoen downloads slaat op de hele LTX‑familie, niet op dit model.
LTX opent een nuttige weg: downloadbare gewichten, kant‑en‑klare pipelines in ComfyUI, een concrete knipoog naar robotica. Maar de aan omzet gekoppelde licentievoorwaarde herinnert eraan dat “open” hier vooral controleerbaar betekent, niet vrij van voorwaarden. Het volgende interessante nieuws zijn niet de demo’s, maar onafhankelijke reproducties en de eerste zinvolle benchmarks op gewone GPU’s. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik heb de officiële model card op Hugging Face (Lightricks/LTX-2.5) en de repository Lightricks/LTX-2 op GitHub gelezen: parameters, varianten van de gewichten, de Gemma 4 12B‑encoder, generatiemodi, softwarevereisten, licentie en de door de maker genoemde beperkingen. Datum en releasebestanden heb ik gekruist met de ComfyUI Wiki‑notitie van 11 augustus 2026, en de uitspraken van de bestuurders (LTX, Markov Robotics, ComfyUI, NVIDIA) met het stuk van Robotics & Automation News van 13 augustus. Voor de benchmarks gebruikte ik de kritische analyse van NYU Shanghai RITS. De pagina ltx.io/model/ltx-2-5 en het artikel van VentureBeat waren tijdens de sessie niet bereikbaar (headerfout, HTTP 403/429), maar de feiten die zij aanhaalden worden door bovenstaande open bronnen bevestigd. Het bericht over Stripe–OpenRouter heb ik laten vallen: geen primaire bron, alleen Bloomberg met anonieme bronnen, een woordvoerder van Stripe die niet ingaat op geruchten, en bedragen die schommelen tussen 7 en 8 miljard.
- Incertezze
- Alle cijfers over snelheid en kwaliteit zijn uitspraken van de leverancier, nog niet door derden gereproduceerd. De door LTX gepubliceerde vergelijking heeft erkende methodologische problemen: concurrenten grotendeels gemeten op 720p terwijl het API‑cijfer van LTX een interne meting op 1080p is; in de tijden van anderen zitten wachtrij en hosting bij derden (fal.run); en de vergelijking met Veo 3.1 gebruikt een clip van 8 seconden tegen de 10 van LTX. De artefactscore is automatisch, over 98 prompts die nooit volledig zijn gepubliceerd. De 6,8 seconden gelden voor twee GB200’s, hardware buiten het bereik van een gewone gebruiker: bij het opgegeven minimum van 16 GB VRAM bestaan geen onafhankelijke metingen, en evenmin controles op het kwaliteitsverlies door int8/NVFP4‑kwantisatie, fp8‑cast en CPU‑offload. Ook de multishot‑consistentie, het voordeel van de diffusiedecoder boven de VAE en de duurvoorspeller blijven onbevestigd. Kleine kanttekening: één veld op de Hugging Face‑pagina toont 6 januari 2026, in strijd met de aankondiging van 11 augustus — waarschijnlijk een restant van de LTX‑2‑repository. Het cijfer van 33+ miljoen downloads betreft de hele LTX‑familie, niet dit model.
- Perché pubblicarla
- Het is het eerste video‑audiomodel van commercieel niveau met downloadbare gewichten en beweerde topprestaties, en het verschuift de vraag van «welke API is het goedkoopst» naar «wat kan ik thuis draaien» — een concreet onderwerp voor wie met video werkt zonder cloudbudget. Het nieuws leent zich ook voor eerlijk redactiewerk: alle cijfers komen van de fabrikant, de licentie wordt als open gepresenteerd maar is dat niet volgens de OSI‑definitie, en het robotica‑checkpoint laat zien waar de sector deze modellen heen wil brengen. Het geverifieerde scheiden van de marketing is precies de waarde die wij kunnen toevoegen.