Esta página se actualiza automáticamente con nuevas herramientas y modelos publicados por el pipeline diario de EligeIA.
Adaptador LoRA experimental para HunyuanVideo, ajustado para generar vídeo a partir de texto con una estética asociada a Coca-Cola. Se carga sobre el modelo base tencent/HunyuanVideo mediante la biblioteca Diffusers.
Modelo de generación de vídeo a partir de texto ajustado sobre Wan2.1-T2V-1.3B. Permite crear vídeos de forma nativa en resoluciones 1K y 4K mediante adaptadores LoRA entrenados con el conjunto de datos UltraVideo, especializado en vídeo UHD con descripciones estructuradas detalladas.
Modelo de 1.300 millones de parámetros para generar vídeo a partir de texto o imágenes. Fue entrenado con múltiples resoluciones, admite una imagen inicial y otra final para condicionar la secuencia y ocupa aproximadamente 19 GB. Esta página es un duplicado del modelo original de Alibaba PAI.
Adaptador LoRA de rango 64 para generación de vídeo a partir de texto, entrenado con AI Toolkit sobre Wan2.2-T2V-A14B. Utiliza «c0ldv» como palabra de activación y distribuye sus pesos en formato Safetensors.
Modelo de texto a vídeo para simular vidas y aventuras de anime potencialmente infinitas mediante la predicción del siguiente estado del juego. Combina modelos multimodales de lenguaje con difusión de vídeo para representar movimientos, acciones y cambios de estado de los personajes, manteniendo la coherencia con el contexto visual histórico.
Adaptador LoRA para Wan2.1 14B T2V, entrenado para generar vídeos de gatos a partir de descripciones textuales. Se entrenó durante 10 épocas con 27 clips de gatos —unos dos minutos de vídeo en total— y sus pesos se distribuyen en formato Safetensors bajo licencia Apache 2.0.
Adaptador LoRA para Wan2.1 14B T2V que genera vídeos de personas boxeando a partir de descripciones de texto. Fue entrenado durante 10 épocas con un minuto de metraje de boxeo dividido en 15 clips etiquetados individualmente.
Adaptador LoRA para Wan2.1 14B T2V que genera vídeos con la estética de un videojuego de disparos en primera persona inspirado en Doom de los años noventa. Fue entrenado durante 8 épocas con 2,5 minutos de vídeo distribuidos en 35 clips de partidas, cada uno subtitulado por separado.
Modelo acelerado de generación de texto a vídeo, destilado de HunyuanVideo. Produce vídeos de alta calidad en 6 pasos de difusión, con una aceleración aproximada de 8 veces frente a los 50 pasos del modelo original.
Pipeline de edición de vídeo zero-shot basada en difusión que fusiona tokens de autoatención entre fotogramas para mejorar la coherencia temporal y reducir el consumo de memoria. Permite transformar vídeos mediante instrucciones de texto sin ajustar previamente el modelo.
Modelo de 14.000 millones de parámetros para generar vídeos de avatares a partir de una imagen, una pista de audio y una descripción textual. Utiliza Wan2.1-T2V-14B como modelo base, Wav2Vec2 como codificador de audio y pesos LoRA para producir sincronización labial y animaciones corporales adaptadas al habla. Actualmente genera vídeo a 480p.
Modelo de generación conjunta de audio y vídeo personalizado por identidad. Conserva de forma coherente la apariencia facial y el timbre de voz en escenas con uno o varios sujetos. Se basa en Wan2.2-TI2V-5B y fue ajustado a partir de Ovi.