Qué es ComfyUI y cómo empezar desde cero
ComfyUI es una interfaz visual para generar imágenes (y vídeo, audio o 3D) con modelos de IA como Stable Diffusion, SDXL o Flux. En lugar de escribir un prompt y rezar, construyes el proceso pieza a pieza conectando nodos: cargar el modelo, escribir el prompt, muestrear la imagen, decodificarla y guardarla.
Por qué ComfyUI y no otra herramienta La ventaja es el control total. Ves exactamente cada paso del proceso, puedes reutilizar flujos, y reproduces resultados al 100%. Lo que en otras apps es una caja negra, aquí es un diagrama que entiendes y modificas.
Lo que necesitas - Una GPU con VRAM suficiente (a partir de 6-8 GB ya haces cosas; para Flux o SDXL, cuanto más mejor). - ComfyUI instalado (versión de escritorio o portable) y al menos un *checkpoint* (el archivo del modelo). - Paciencia los primeros 20 minutos: cuando entiendes los nodos, ya no hay vuelta atrás.
La interfaz en 1 minuto El lienzo está lleno de nodos (cajas) conectados por cables. Cada nodo hace una cosa y pasa su resultado al siguiente. Arrastras desde un punto de salida hasta una entrada compatible y listo. Con la rueda haces zoom; arrastrando el fondo te mueves.
El flujo mínimo Todo workflow de texto a imagen tiene siempre estas piezas:
- Load Checkpoint: carga el modelo.
- CLIP Text Encode: convierte tu prompt (positivo y negativo) en algo que el modelo entiende.
- KSampler: el corazón, donde se genera la imagen a partir del ruido.
- VAE Decode: convierte el resultado a una imagen visible.
- Save Image: la guarda.
En el siguiente tutorial montamos este flujo paso a paso.
¿Quieres dominar ComfyUI a fondo, con flujos profesionales listos para usar? En la Academia tienes el recorrido completo.