¿ComfyUI con MiniMax H3: ¿mejor que Kling AI, Seedance y otros generadores de vídeo en el plan gratuito?

Los generadores de vídeo basados en IA son considerablemente más difíciles de utilizar de forma gratuita que los modelos de lenguaje grande (LLM) habituales, como ChatGPT, ya que la mayoría de los proveedores son muy tacaños con los créditos gratuitos. Conseguir que creen exactamente lo que uno desea —manteniendo al mismo tiempo un aspecto adecuado y coherente— resulta aún más complicado. Por ello, decidí probar la alternativa: alojar un modelo local como MiniMax H3.
Mi hijo quiere utilizar la IA para generar su propio vídeo —bueno, un vídeo de construcción con ladrillos— sobre sables láser. Actualmente le fascina el tema. Pero como no quería gastar de inmediato una gran cantidad de dinero en una costosa suscripción a un servicio de IA de vídeo para sus experimentos, al principio intentó utilizar Kling AI y servicios similares de forma gratuita.
La mayoría de los generadores de vídeo con IA le atraen con una cuota inicial gratuita para que se cree una cuenta. Pero la trampa se hace evidente rápidamente: si desea crear más de uno o dos vídeos de tres segundos al día de forma continuada, enseguida se ve empujado hacia una suscripción costosa.
Sin embargo, incluso desde el punto de vista visual, los vídeos creados hasta ese momento no resultaban especialmente satisfactorios. Además, suele ser difícil mantener la coherencia en los entornos, los objetos y los personajes. La decepción del niño me llevó a probar una solución local.
Los modelos y soluciones locales requieren, naturalmente, un hardware potente. Estamos realizando la prueba en un Razer Blade 16 (2025) con una RTX 5090 y 24 GB de VRAM. En general, la generación de vídeos solo resulta razonablemente interesante a partir de los 8 GB de VRAM, y en este caso, más realmente significa más.
Existen numerosas interfaces disponibles para el modelo; nosotros nos decantamos por MiniMax H3. Se puede ejecutar en Ollama, por ejemplo, así como en Pinokio o Stability Matrix. Este último también incluye ComfyUI, una interfaz gráfica para flujos de trabajo de IA que no se limita a la generación de vídeo. Sin embargo, tuve problemas con esa combinación, por lo que opté por una versión independiente de ComfyUI (ComfyUI.org), que se puede descargar como aplicación para Windows y otras plataformas.

Top 10 Análisis
» Top 10 Portátiles Multimedia
» Top 10 Portátiles de Juego
» Top 10 Portátiles de Juego ligeros
» Top 10 Portátiles Asequibles de Oficina/Empresa
» Top 10 Portátiles de Juego Ligeros
» Top 10 Portátiles de Oficina/Empresa Premium
» Top 10 Estaciones de Trabajo
» Top 10 Subportátiles
» Top 10 Ultrabooks
» Top 10 Convertibles
» Top 10 Tablets
» Top 10 Tablets Windows
» Top 10 Tablets de menos de 250 Euros
» Top 10 Phablets (>5.5")
» Top 10 Smartphones
» Top 10 Smartphones (≤5")
» Top 10 Smartphones de menos de 300 Euros
» Top 10 Smartphones de menos de 120 Euros
» Top 10 Portátiles de menos de 1000 Euros
» Top 10 Portátiles de menos de 500 Euros
» Top 10 Portátiles de menos de 300 Euros
» Los Mejores Displays de Portátiles Analizados por Notebookcheck
ComfyUI requiere un cierto tiempo de adaptación para los principiantes, pero abre un amplio abanico de posibilidades para la generación de vídeos. Se crean flujos de trabajo a partir de nodos individuales; se trata, en esencia, de un conjunto de herramientas modular compuesto por múltiples herramientas o nodos. Cada nodo tiene una entrada y una salida, y puede conectarse a otros nodos.

Todas las herramientas se dividen en nodos individuales. Por ejemplo, hay un nodo para la indicación de texto, varios nodos de imagen que pueden servir como referencias o pasos intermedios antes de la generación del vídeo, así como otras herramientas. En teoría, se podría cargar un modelo de IA independiente en cada nodo: un modelo de lenguaje a gran escala (LLM) para la indicación de texto, un modelo de generación de imágenes para los nodos de imagen, y así sucesivamente. Como es lógico, los modelos de IA ocupan mucho espacio de almacenamiento. Al final, todos los nodos se incorporan al nodo de generación de vídeo, que produce el resultado.
Al principio, experimentamos con ajustes preestablecidos de «texto a vídeo», pero pronto nos decantamos más por la opción de «referencia a vídeo».

Lo que lo hace especialmente útil es que también permite crear entornos, objetos y personajes coherentes. En nuestro primer vídeo, por ejemplo, creamos un acorazado construido con ladrillos que surcaba la pantalla. Con una resolución de 480p, tardó unos 5,5 minutos en generarse, aunque es posible alcanzar resoluciones más altas con el hardware adecuado. Sin embargo, en una de las próximas escenas queríamos volver a utilizar exactamente el mismo acorazado. Así pues, tomamos capturas de pantalla de las vistas frontal y trasera de la nave espacial, importamos las imágenes, las vinculamos como referencias denominadas «Ship_front» y «Ship_rear» al nodo principal, e indicamos a la IA que utilizara exactamente esta nave en otra escena. De lo contrario, la IA habría generado un aspecto nuevo.
Tras un breve periodo de tiempo familiarizándonos con el sistema y con la ayuda del profesor YouTube, elaboramos rápidamente un primer flujo de trabajo para nuestras escenas de vídeo y generamos vídeos con los que ambos quedamos muy satisfechos. Un modelo de lenguaje grande (LLM) —en este caso, ChatGPT— nos ayudó a adaptar las indicaciones de texto específicamente para MiniMax H3, haciéndolas precisas y detalladas.
Mi flujo de trabajo: en ChatGPT, describí el aspecto que tenía en mente, especifiqué que ciertas marcas no debían aparecer, aunque el aspecto pudiera estar inspirado en ellas, expliqué que debía tener un aire cinematográfico y especifiqué qué referencias (como «Ship_front») debían incluirse. Solo entonces describí la escena. Pegué la indicación adaptada por ChatGPT en el nodo de texto de ComfyUI, añadí las imágenes de referencia necesarias, si las había, y ya estaba listo.

También puede pedirle a ChatGPT que genere una indicación universal basada en el aspecto deseado y otros parámetros, que podrá guardar para más adelante. Si vuelve a introducir esa indicación en un modelo de lenguaje grande (LLM), este dispondrá de toda la información necesaria y podrá describir inmediatamente la siguiente escena.
En cualquier caso, mi hijo y yo quedamos mucho más satisfechos con los resultados que con las versiones gratuitas de Kling AI, Seedance y servicios similares. La gran variedad de opciones disponibles también invita a la experimentación, y por fin se libra de las molestas limitaciones de créditos, las solicitudes de suscripción, los anuncios y las preocupaciones sobre la seguridad de los datos. Sin embargo, la resolución sigue siendo un problema. Ni siquiera está disponible como opción el Full HD o una resolución superior, presumiblemente porque los requisitos de hardware serían demasiado elevados. Es probable que los futuros modelos sean más eficientes en este sentido. Por ahora, también puede ampliar su flujo de trabajo con herramientas de mejora de resolución.
Cualquier persona que cuente con el hardware necesario y tenga interés en la generación de películas debería echar un vistazo a ComfyUI y a un buen modelo de IA local. ComfyUI, en particular, permite flujos de trabajo increíblemente complejos y con múltiples capas —si realmente los necesita—. No obstante, para empezar, lo esencial ya está ahí y se puede aprender rápidamente.









