14 de septiembre de 2026 · Por YasKad
Lightricks/LTX-2

LTX-2: el modelo audio-vídeo con pesos abiertos que corre en tu propia GPU

Lightricks/LTX-2 · 9.525★ · 1.503 forks

Lo esencial sobre Lightricks/LTX-2: el paquete oficial de inferencia en Python y de entrenamiento de LoRA para el modelo generativo audio-vídeo LTX-2, acompañado del modelo en Hugging Face, una familia de pipelines y un entrenador.

Una impactante imagen de héroe en modo oscuro cyberpunk que representa un modelo de generación audiovisual con pesos abiertos: un motor neuronal masivo translúcido suspendido en una catedral de datos negra, compuesto por dos flujos luminosos entrelazados, un flujo de vídeo cian hecho de fotogramas cinematográficos en movimiento, mapas de profundidad y vectores de movimiento, y un flujo de audio magenta hecho de cristales de forma de onda, conos de altavoz y barras espectrales, los flujos se fusionan en una escena sincronizada donde un personaje futurista habla mientras las ondas sonoras ondulan a través del entorno, produciendo diálogo sincronizado con los labios y efectos ambientales, racks de GPU circundantes brillan con módulos VRAM, ventiladores de refrigeración e indicadores de inferencia local, nodos de pipeline holográficos, una terminal de Python y una bóveda de licencias flotan cerca, incluye un monograma abstracto sutil que sugiere un modelo audiovisual de código abierto, modo oscuro, estética cyberpunk/tech, acentos neón, ultra-detallado, resolución 8K, iluminación volumétrica, profundidad de campo dramática, composición cinematográfica

Qué es LTX-2

LTX-2 es un modelo fundamental de generación de audio y vídeo basado en DiT (Diffusion Transformer). A diferencia de los modelos de vídeo «silenciosos», LTX-2 genera vídeo y audio sincronizados en un mismo modelo: la pista sonora acompaña a los personajes, al entorno y a los efectos, no se genera aparte. El README lo describe como «el primer modelo fundamental de audio-vídeo basado en DiT» que reúne en un solo modelo las capacidades centrales de la generación de vídeo moderna: audio y vídeo sincronizados, alta fidelidad, varios modos de rendimiento, salidas listas para producción, acceso por API y pesos abiertos.

El repositorio documentado aquí (Lightricks/LTX-2) no es el modelo en sí, sino su paquete oficial de software: es un monorepo con tres subpaquetes — ltx-core (implementación del modelo y pila de inferencia), ltx-pipelines (las rutas de generación de alto nivel) y ltx-trainer (entrenamiento y afinado de LoRA, ajuste completo e IC-LoRA) — además de una habilidad de agente para entrenamiento asistido. Los pesos del modelo viven en Hugging Face (Lightricks/LTX-2 y, en la versión actual recomendada, Lightricks/LTX-2.5).

La arquitectura, según el paper técnico, es un transformer de doble rama (dual-stream) asimétrico: una rama de vídeo de 14.000 millones de parámetros y una rama de audio de 5.000 millones, acoplados mediante capas de atención cruzada (cross-attention) bidireccional con embeddings posicionales temporales y un AdaLN de cross-modalidad para la condición de paso de tiempo compartida. Asignar más capacidad al vídeo que al audio es una decisión deliberada del diseño. El modelo usa un codificador de texto multilingüe (Gemma afinado para LTX) y introduce un mecanismo de modality-CFG (classifier-free guidance consciente de la modalidad) para mejorar el alineamiento y la controlabilidad audio-vídeo.

Un corte arquitectónico ultra-detallado de un Diffusion Transformer asimétrico de doble rama, estilo cyberpunk en modo oscuro, la torre izquierda es una rama de vídeo representada a escala de 14.000 millones de parámetros, densas redes de fotogramas cian, mapas de profundidad, mapas de normales, y cintas de vectores de movimiento, la torre derecha es una rama de audio representada a escala de 5.000 millones de parámetros, cristales de forma de onda magenta, fragmentos de espectrograma mel, y conos de altavoz, puentes de atención cruzada bidireccional conectan las torres con anillos brillantes de embeddings posicionales temporales y un dial de condición de tiempo AdaLN compartido, las etiquetas flotantes son abstractas, sin texto legible, modo oscuro, estética cyberpunk/tech, acentos neón, ultra-detallado, resolución 8K

Origen

El repositorio fue creado el 3 de enero de 2026 por Lightricks, la empresa israelí detrás de la familia LTX. El modelo LTX-2 se presentó formalmente en el paper «LTX-2: Efficient Joint Audio-Visual Foundation Model» (arXiv:2601.03233, publicado el 6 de enero de 2026), con Yoav HaCohen como primer autor y Zeev Farbman —cofundador y CEO de Lightricks— como último.

La anécdota de lanzamiento más reveladora está en el AMA del CEO en Reddit. El 8 de enero de 2026, Farbman respondió como u/ltx_model en el hilo r/StableDiffusion 1q7dzq2: «Soy el cofundador y CEO de Lightricks. Acabamos de abrir el código de LTX-2, un modelo audio-vídeo de producción. AMA». Aclaró que el lanzamiento completo incluyó pesos, código, un entrenador, benchmarks, LoRAs y documentación, y que el modelo «corre localmente en GPUs de consumo y alimenta productos reales en Lightricks». El hilo alcanzó 1554 votos y 460 comentarios, y el CEO lo cerró reconociendo que «el volumen de preguntas superó todas las expectativas».

El relato de fondo es la tesis de Lightricks: los modelos generativos «están evolucionando hacia motores de render completos», con entradas como profundidad, normales y vectores de movimiento, y salida hacia pipelines de compositing, VFX, herramientas de animación y motores de juego. Farbman argumenta que «las APIs estáticas no pueden cubrirlo» y que gran parte de ello debe ejecutarse en el borde. Por eso, según su frase repetida, «los pesos abiertos no son un lujo, son la única vía que funciona», y Lightricks se monetiza mediante licencias y un reparto de ingresos cuando quien construye encima supera el umbral de 10 millones de dólares de ingresos anuales.

Filosofía y principios

Abierto por arquitectura, no por caridad: Farbman lo enmarca explícitamente — «no pensamos en los pesos abiertos como caridad o buena voluntad; es el corazón de cómo creemos que deben construirse los motores de render». El objetivo es que el modelo se vuelva infraestructura integrada en pipelines, no una API que se consume.

Uso local y reproducible: «los lanzamientos abiertos de modelos multimodales son raros, y cuando ocurren suelen ser difíciles de ejecutar o reproducir. Construimos LTX-2 para que puedas usarlo de verdad: corre localmente en GPUs de consumo».

Un estudio de desarrollador oscuro donde una GPU de consumo ejecuta inferencia local para un modelo audiovisual, la GPU tiene un disipador de calor brillante, bucles de refrigeración líquida, e indicadores de VRAM neón, en el escritorio, una terminal de Python muestra código abstracto, una carpeta de dataset, un grafo de pipeline, y un registro de entrenamiento, un monitor muestra un vídeo cinematográfico generado con forma de onda de audio sincronizada, vista previa en tiempo real, e indicadores de renderizado en el borde en lugar de dependencia de la nube, la escena enfatiza ejecución local reproducible, privacidad, y baja latencia, modo oscuro, estética cyberpunk/tech, acentos neón, ultra-detallado, resolución 8K

Un modelo, capacidades compuestas: audio y vídeo juntos, no como dos modelos pegados; la sincronización es intrínseca al diseño. Entrenable por el usuario: el modelo base (dev) es totalmente entrenable, y se publica el entrenador para que cada uno lleve su propio dataset y afine para su caso; en muchos ajustes, afinar para movimiento, estilo o parecido «puede llevar menos de una hora». Eficiencia como prioridad: el transformer destilado (distilled) corre en muy pocos pasos, y la familia de pipelines separa explícitamente el modo rápido del modo de calidad de producción (DFR).

Cómo funciona

El repositorio se organiza en tres paquetes, cada uno con su propio README y documentación: ltx-core (implementación del modelo, pila de inferencia y utilidades), ltx-pipelines (las rutas de generación de alto nivel: texto-a-vídeo, imagen-a-vídeo y otros modos), y ltx-trainer (herramientas de entrenamiento y afinado — LoRA, ajuste completo e IC-LoRA).

Las pipelines disponibles son el corazón práctico:

  • DistilledPipeline — el punto de partida rápido: texto/imagen-a-vídeo más veloz (8 sigmas predefinidos: 8 pasos etapa 1, 4 pasos etapa 2).
  • DFRPipeline — calidad de producción (DFR, Diffusion Fidelity Rendering): usa el mismo transformer destilado más un IC-LoRA de detallado; genera fotogramas clave interiores y una pasada de detallado espacial, con opcionalmente 2×/4× en fps.
  • TI2VidTwoStagesPipeline / TI2VidTwoStagesHQPipeline — texto/imagen-a-vídeo guiado de dos etapas con CFG/STG y reescalado 2×.
  • TI2VidOneStagePipeline — generación de una sola etapa para prototipado rápido.
  • ICLoraPipeline — transformación vídeo-a-vídeo e imagen-a-vídeo.
  • KeyframeInterpolationPipeline — interpolación entre imágenes de fotograma clave.
  • A2VidPipelineTwoStage — generación vídeo-a-partir-de-audio condicionada por un archivo de audio de entrada.
  • RetakePipeline — regenera una región temporal concreta de un vídeo existente.
  • HDRICLoraPipeline — vídeo-a-vídeo con salida HDR por IC-LoRA.
  • DubItPipeline — reescritura del diálogo manteniendo la identidad del hablante y los movimientos de los labios.
  • HDR/EXR nativo — las pipelines estándar aceptan fotogramas EXR con --hdr {SRGB_LINEAR,ACESCG,ACESCCT} y escriben fotogramas EXR half más un máster BT.2020/HLG.

Una sala de control holográfica para pipelines de generación audiovisual, interfaz cyberpunk oscura, múltiples grafos de ruta brillantes se ramifican desde un núcleo de modelo central: una ruta destilada rápida con pasos mínimos, una ruta de producción de alta fidelidad con mejora de detalle y sobremuestreo espacial, rutas de dos etapas de texto-a-vídeo e imagen-a-vídeo, prototipado de una etapa, transformaciones vídeo-a-vídeo e imagen-a-vídeo, interpolación de fotogramas clave, regeneración temporal de retake, generación de vídeo condicionada por audio, reescritura de diálogo, y rutas de salida HDR/EXR, cada nodo está representado por iconos abstractos: fotogramas de película, formas de onda, deslizadores, flechas de sobremuestreo, diamantes de fotograma clave, bucles de retake, máscaras de altavoz, y ruedas de color, modo oscuro, estética cyberpunk/tech, acentos neón, ultra-detallado, resolución 8K

El entrenador soporta una amplia batería de modos condicionales: texto-a-vídeo, texto-a-audio, imagen-a-vídeo, extensión de vídeo, extensión de audio, inpainting de vídeo y de audio, outpainting de vídeo, IC-LoRA para vídeo/audio/audio-vídeo conjunto, audio-a-vídeo y vídeo-a-audio. Existe además una habilidad de agente (.claude/skills/train-model) que guía un entrenamiento extremo a extremo: explora datos y hardware, elige el modo, prepara/preprocesa el dataset, lanza el entrenamiento y lo supervisa.

Un laboratorio de entrenamiento de modelos futurista, estética cyberpunk en modo oscuro, una consola de afinado LoRA muestra chips adaptadores, curvas de aprendizaje, métricas de validación, y etapas de preparación de dataset, estantes sostienen clips de vídeo, carretes de audio, retratos de referencia, muestras de voz, y equipos de captura de movimiento, un asistente de agente digital guía el flujo de trabajo a través de etapas: explorar hardware, elegir modo de entrenamiento, preprocesar dataset, lanzar entrenamiento, monitorear convergencia, enfatiza afinado rápido para movimiento, estilo, parecido de voz, y apariencia, con un temporizador sutil que sugiere menos de una hora para muchos ajustes, modo oscuro, estética cyberpunk/tech, acentos neón, ultra-detallado, resolución 8K

El ecosistema

Repositorios de Lightricks (misma organización)

RepositorioStarsRol
Lightricks/LTX-Video10.950Repositorio oficial de LTX-Video (el modelo de vídeo en tiempo real anterior, de 2024).
Lightricks/LTX-29.411Este repositorio: paquete de inferencia y entrenador para LTX-2.
Lightricks/ComfyUI-LTXVideo4.129Soporte de LTX-Video/LTX-2 para ComfyUI.
Lightricks/LTX-Desktop1.988Aplicación de escritorio de código abierto para generar vídeos con los modelos LTX.
Lightricks/LTX-Video-Trainer468Entrenador comunitario para el modelo LTX Video.
Lightricks/LTX-Video-Q8-Kernels82Kernels Q8 para LTX-Video.

Modelos en Hugging Face

Lightricks/LTX-2 — el modelo original (19B: 14B vídeo + 5B audio). Al consultar: 333.852 descargas y 1.779 «me gusta». Pipeline image-to-video, integrado en diffusers como LTX2Pipeline. Lightricks/LTX-2.5 — la versión actual recomendada por el README (transformer 22B + Gemma 4 12B). Al consultar: 1.559.653 descargas y 3.821 «me gusta». Creada el 23 de julio de 2026. Lightricks/LTX-2.5-22b-IC-LoRA-Pixel-Spatial-Upscaler — el IC-LoRA de detallado que exige la pipeline DFR. Los pesos se publican «un archivo por componente», de modo que se descargan solo las piezas que cada pipeline necesita.

Integración con ComfyUI

El README y la ficha del modelo remiten a Lightricks/ComfyUI-LTXVideo y recomiendan usar los nodos LTXVideo integrados en el ComfyUI Manager. Hay también un proyecto de la comunidad, LTXMac (una aplicación nativa para Mac de generación de vídeo por texto, presentada en Show HN en enero de 2026), basada en la familia LTX.

Una bóveda de modelo con pesos abiertos en un centro de datos oscuro, estética tecnológica cyberpunk, contenedores transparentes sostienen fragmentos de componentes: pesos de transformer, codificador de texto multilingüe, VAE de vídeo, VAE de audio, sobremuestreadores espaciales, sobremuestreadores temporales, y adaptadores de mejora de detalle, flujos de descarga fluyen hacia nodos locales, conectores de integración estilo diffusers, grafos de nodos estilo ComfyUI, una ventana de aplicación de escritorio, y una puerta de enlace API, un pergamino de licencia brilla con un marcador de umbral de ingresos, simbolizando arquitectura abierta y licenciamiento comercial, sin texto legible, solo glifos e iconos abstractos, modo oscuro, estética cyberpunk/tech, acentos neón, ultra-detallado, resolución 8K

Estado oficial / semioficial

LTX-2 tiene un reconocimiento claro de estándar de facto en el ecosistema open-source de generación de vídeo: está integrado como LTX2Pipeline en la librería oficial diffusers, con documentación dedicada; los nodos LTXVideo están disponibles desde el ComfyUI Manager; Lightricks ofrece LTX-Studio (demo en línea) y una API de pago, y el CEO afirma que el modelo «alimenta productos reales en Lightricks»; y los pesos están en Hugging Face bajo la LTX Community License (no es una licencia OSI; las entidades con ingresos anuales de al menos 10.000.000 de dólares pasan a una rama de la licencia que exige condiciones comerciales).

En la práctica, esto significa que LTX-2 funciona como una referencia de los modelos audio-vídeo abiertos que corren localmente: está en diffusers, en ComfyUI, en una app de escritorio y con una API comercial, pero no hay una «designación formal de estándar» por parte de ningún organismo externo en las fuentes consultadas.

Guía rápida de uso

Instalación y primer arranque

Prerrequisitos: Python ≥ 3.12, CUDA (>12.7 recomendado), PyTorch ~= 2.7, y una GPU con bastante VRAM.

git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2

# El extra `natten` es el backend más rápido para el VAE de vídeo; es solo Linux+CUDA.
uv sync --extra natten

# Descargar el modelo (repositorio LTX-2.5, ~66 GiB)
hf auth login
hf download Lightricks/LTX-2.5 \
    diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
    text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
    vae/ltx-2.5-video-vae-bf16.safetensors \
    vae/ltx-2.5-audio-vae-bf16.safetensors \
    latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
    --local-dir models/ltx-2.5

En el primer arranque, si aparece un 401/403 de Hugging Face, hay que aceptar los términos del modelo e iniciar sesión con un token de lectura.

Flujos de trabajo habituales

1. Texto-a-vídeo rápido (DistilledPipeline). Para generar un clip de arranque:

uv run python -m ltx_pipelines.distilled \
    --transformer-path   models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
    --text-encoder-path  models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
    --video-vae-path     models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
    --audio-vae-path     models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
    --spatial-upsampler-path models/ltx-2.5/latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
    --num-frames 121 --seed 42 --output-path output.mp4 \
    --prompt "..."

El resultado queda en output.mp4. Por defecto son 1024×1536 a 24 fps.

2. Calidad de producción (DFRPipeline). Se reutiliza el mismo download y se añade el IC-LoRA de detallado, ejecutando ltx_pipelines.dfr_pipeline con el flag adicional --detailing-lora. Salida en output_dfr.mp4; la 4K UHD es --width 3840 --height 2176.

3. Vídeo a partir de audio (A2Vid). Se usa A2VidPipelineTwoStage para generar un vídeo condicionado por un archivo de audio de entrada.

4. Doblar/reescribir el diálogo (DubIt). DubItPipeline reescribe el diálogo manteniendo la identidad y los labios del hablante.

Una escena de primer plano de generación audiovisual sincronizada, estilo cyberpunk oscuro, el rostro fotorrealista de un personaje se genera junto a una forma de onda de audio, con movimientos de labios, respiración, y picos de diálogo alineados en una cuadrícula temporal, pistas holográficas muestran identidad del hablante, timbre de voz, sonido ambiental, efectos foley, y capas de música, una interfaz de reescritura de diálogo preserva la sincronización labial y la identidad del personaje mientras cambia el contenido del habla, acentos neón cian y magenta trazan la alineación entre eventos de audio y fotogramas de vídeo, modo oscuro, estética cyberpunk/tech, acentos neón, ultra-detallado, resolución 8K

Configuración esencial

  • --num-frames: divisible por 8 más 1; se puede omitir con --auto-duration.
  • --quantization: fp8-cast, fp8-scaled-mm (Hopper+), nvfp4-cast/nvfp4-prequant (Blackwell).
  • --offload {cpu,disk}: para GPUs con poca VRAM.
  • --hdr {SRGB_LINEAR,ACESCG,ACESCCT}: espacio de color para condicionamiento EXR y codificación HDR.
  • Guía de prompt: el README recomienda prompts cronológicos, literales y de hasta 200 palabras, «como un director de fotografía describiendo una lista de tomas».

Trampas frecuentes y soluciones

  • 401/403 al descargar de Hugging Face: aceptar los términos del modelo e iniciar sesión con un token de lectura.
  • Resolución y fotogramas: ancho/alto divisibles por 32 y fotogramas por 8+1; la 4K es 3840×2176, no 3840×2160.
  • natten es solo Linux+CUDA: en Windows/macOS se omite y se recurre a Triton/eager.
  • No sustituir el Gemma: el codificador de texto debe ser el Gemma 4 afinado para LTX; el Gemma 4 «stock» de Google no es sustituto.
  • OOM al decodificar el VAE: se recomienda pipe.vae.enable_tiling() en el camino diffusers.
  • Los pesos no son intercambiables entre LTX-2.3 y LTX-2.5: un LoRA solo funciona con el modelo en que se entrenó.
  • El download es ~66 GiB: se descarga por componentes para no tirar de todo.

Integraciones y migración

diffusers: LTX-2 está disponible como LTX2Pipeline y LTX2LatentUpsamplePipeline; migración directa con LTX2Pipeline.from_pretrained("Lightricks/LTX-2", torch_dtype=torch.bfloat16). ComfyUI: mediante Lightricks/ComfyUI-LTXVideo y los nodos LTXVideo del Manager. LTX-Studio/API: para uso en la nube sin gestionar hardware. HDR/EXR hacia VFX: las salidas EXR lineales y el máster BT.2020/HLG facilitan la migración desde flujos tradicionales de compositor.

Métricas actuales

Medición: 14 de septiembre de 2026, API de GitHub.

MétricaValor
Estrellas9.411
Bifurcaciones1.489
Suscriptores (subscribers_count)99
Incidencias abiertas41
Commits en main50 (aproximado)
Lenguaje principalPython
LicenciaLTX Community License (propia, no OSI)
Creación3 de enero de 2026
Última actividad (push)26 de agosto de 2026
Última publicaciónv1.3.0, 26 de agosto de 2026

Los principales contribuidores: michaellightricks (26), github-actions[bot] (10), AlexeyKravtsov1987 (1) y Bmantl (1). La API de GitHub usa open_issues_count, que puede incluir solicitudes de cambios abiertas. watchers_count de la respuesta general replica las estrellas; por eso se informa por separado el campo subscribers_count como suscriptores reales.

Cómo contribuir

El README del entrenador documenta un proceso abierto y sencillo: compartir resultados (LoRAs interesantes o buenos resultados con la comunidad), reportar incidencias (abrir un issue en GitHub ante un bug o sugerencia), enviar PRs (arreglos de bugs o mejoras generales), y solicitar funciones (mediante issues de GitHub). La comunidad se coordina principalmente en el Discord oficial, donde el equipo de desarrollo da soporte y se comparten resultados.

Cómo lo recibió la comunidad

En el AMA del CEO (r/StableDiffusion 1q7dzq2, 8 de enero de 2026, 1.554 votos y 460 comentarios), la respuesta más votada de Farbman fue la justificación de los pesos abiertos: «los modelos están evolucionando hacia motores de render completos… los pesos abiertos no son un lujo, son la única vía que funciona. Nos monetizamos mediante licencias y un reparto de ingresos cuando la gente construye productos exitosos encima (trazamos la línea en 10 M$ de ingresos)». Anunció también una versión incremental 2.1 y un salto arquitectónico 2.5.

u/Neex, que se identifica como Niko de Corridor Digital, participó en el hilo y dijo «estás clavando esta respuesta»; luego u/That_Buddy_2928 añadió que el vídeo de la remasterización de Bullet Time de Corridor «fue instrumental para convencer a algunos de mis amigos más escépticos de la validez de la IA en el pipeline». u/SvenVargHimmel planteó si el modelo puede forzarse a generar una sola imagen y si puede exportar mapas de normales o de profundidad como vídeo — señal de que los usuarios ya lo trataban como un motor de render.

En Hacker News, el Show HN más relevante es 47214472 «Show HN: Audio-to-Video with LTX-2» (de runshouse, 2 de marzo de 2026), con 23 puntos y 2 comentarios.

En el subreddit r/StableDiffusion de agosto de 2026, LTX 2.5 domina los hilos de uso local: por ejemplo, «MiniMax H3 Model Copied LTX 2.5’s Best Feature… And It’s CRAZY Fast!» (159 votos, 96 comentarios) y «I Found a way to reduce LTX 2.5’s horrible smearing. Custom node + Workflow» (158 votos, 24 comentarios). Estos hilos dan dos lecturas a la vez: entusiasmo por la calidad y una crítica concreta —el «smearing»/trazado en movimiento— que la comunidad intenta compensar con nodos propios.

La ficha del modelo declara limitaciones explícitas: no está pensado para dar información factual, puede amplificar sesgos, puede fallar en seguir el prompt (muy dependiente del estilo de prompt) y el audio sin voz puede ser de menor calidad.

Comparación con proyectos similares

ProyectoCoincidencia verificableDiferencia verificable
Lightricks/LTX-2.5 (mismo autor)Misma familia, misma infraestructura; el README la toma como punto de arranque.Transformer 22B + Gemma 4, nuevo espacio latente; más descargas (1,56 M) que LTX-2 (333 K). Es la evolución, no un competidor.
Runway Gen-4Generador de vídeo de producción, listado en la guía propia de Lightricks.Modelo cerrado y en la nube; LTX-2 ofrece pesos abiertos y ejecución local.
Google Veo 3.1Generador de vídeo con audio, listado en la misma guía.Cerrado, de Google; LTX-2 es abierto y local.
Kling 3.0Vídeo de alta calidad, listado en la guía propia.Cerrado; LTX-2 se integra en diffusers/ComfyUI.
Pika 2.2Generador de vídeo creativo, listado en la guía propia.Cerrado, consumo por API; LTX-2 es local y entrenable.
MiniMax H3Generador de pesos abiertos, comparado repetidamente con LTX 2.5 en r/StableDiffusion.Lightricks lo describe como el que «copió la mejor característica de LTX 2.5»; es un rival directo del campo abierto.

La comparación más útil no es por popularidad: LTX-2 destaca cuando se quiere un modelo audio-vídeo abierto y local que se integre en diffusers/ComfyUI y sea entrenable; un generador cerrado en la nube puede ser preferible cuando no se dispone de hardware propio.

Casos de uso

  • Creadores y productoras que quieren audio-vídeo local y controlado: el par vídeo+audio sincronizado (con A2VidPipelineTwoStage y DubItPipeline) sirve a quien hace contenido con diálogo sin un paso separado de doblaje ni de efectos.
  • Equipos de VFX y postproducción: las salidas HDR/EXR y RetakePipeline están pensadas para entrar en pipelines de color grading y compositor sin un intermediario con pérdida.

Un pipeline de vídeo HDR/EXR de grado de producción en una suite de postproducción oscura, estética tecnológica cyberpunk, fotogramas EXR holográficos muestran datos de color lineal, espacio de color BT.2020, másteres HLG, curvas de tonemapping, e histogramas de luminancia half-float, viewports laterales muestran mapas de profundidad, mapas de normales, vectores de movimiento, capas de compositing, y paneles de grado de color, modo oscuro, estética cyberpunk/tech, acentos neón, ultra-detallado, resolución 8K

  • Investigadores y equipos de ML que afinan modelos: el ltx-trainer y la habilidad de agente train-model permiten llevar un dataset propio y afinar estilo, movimiento o parecido, a veces «en menos de una hora».
  • Desarrolladores que integran modelos generativos en software: la integración en diffusers y ComfyUI permite embeber LTX-2 en aplicaciones y flujos existentes.
  • Personas con GPUs de consumo: la variante distilled y las opciones --quantization/--offload están orientadas a que el modelo corra localmente en GPUs de consumo.

Recursos


Nota: este artículo combina el README del repositorio, la ficha del modelo en Hugging Face, el paper arXiv:2601.03233, el AMA del CEO en Reddit, notas de versión (v1.2.0, v1.3.0), la API de GitHub y resultados de Hacker News y Reddit consultados el 14 de septiembre de 2026. Las cifras de estrellas, descargas y votos cambian con el tiempo.

Comentarios