TECNOLOGIAS DE INTELIGENCIA ARTIFICIAL QUE ENCONTRAMOS EN COMFYUI

ComfyUI es un entorno de trabajo basado en flujos de trabajo con nodos que permite combinar prácticamente cualquier arquitectura de Inteligencia Artificial generativa.

Cuando comencé a estudiar Comfyui me encontré con un sin fin de nombres o siglas que hacían referencia a tecnologías o herramientas que no conocía y que me resultó difícil integrar conceptualmente. Así que comencé a construir un mapa de conceptos que tras un tiempo se convirtió en una clasificación y una asignación entre conceptos y tecnología.

El objetivo de este documento es intentar poner un poco de orden o de lógica e intentar de alguna manera hacer una clasificación de las diferentes tecnologías de IA que se pueden integrar y utilizar dentro de ComfyUI, organizadas por su función y/o arquitectura principal.

Seguramente no alcanzaré a integrar en esta clasificación todas las tecnologías que hoy conviven, pero espero poner un poco de luz en esta maraña que es la Inteligencia Artificial generativa, centrándome fundamentalmente en la generación de imágenes o de otros elementos a partir de imágenes, dejando para otra ocasión la generación de vídeo o sonido.

En este documento me referiré únicamente a las tecnologías de IA que pueden desplegarse, integrarse o ejecutarse mediante ComfyUI. Podría hacer una clasificación por diferentes criterios, pero he pensado que lo mejor es utilizar un criterio funcional, es decir, clasificar las tecnologías por lo que hacen. Así que tenemos en una primera instancia:
  1. Modelos de Difusión Base/Generación de Imagen
  2. Modelos de Lenguaje y Procesamiento de Texto
  3. Modelos de Condicionamiento y Espacio Latente
  4. Tecnologías de Control y Condicionamiento
  5. Modelos de Escalado y Restauración
  6. Herramientas de Visión por Computadora y Segmentación
  7. Intercambio de Caras y Modificación Corporal Ya solo con este primer intento de clasificación podemos intuir la densidad del tema en el que nos estamos metiendo. Comencemos.


Modelos de Difusión Base/ Generación de Imagen

Son el motor principal para crear imágenes a partir de texto (Text-to-Image) o de otras imágenes (Image-to-Image). Se trata de los primeros modelos de IA generativa que aparecieron y que permitían obtener una imagen a partir de una indicación de texto, el famoso “prompt”. Aquello de:

  • ..un perro vestido de astronauta en la luna.
  • ..un hombre con maletín en un calle de New York 
Si bien los comienzos de la IA podrían establecerse en los años 60, la IA generativa tal y como la conocemos hoy en día comienza en 2017 con la aparición de la arquitectura Transformer, un mecanismo que permitió a las IAs entender el contexto de las palabras y su relación en una oración completa sentando las bases para los Modelos de Lenguaje Grande (LLMs) como BERT (enfocado en comprensión) y la familia GPT de OpenAI, que culmina a finales de 2022, con ChatGPT.

Poco después, en internet aparecen los primeros generadores de imágenes, como Dall-E, pero no es hasta 2022 que aparece el primer modelo libre ejecutable en un ordenador doméstico, de la mano de la empresa Stable AI
  • Stable Diffusion 1.5 (SD15): se convirtió en el estándar absoluto de la comunidad. Cualquiera podía entrenar al modelo para aprender caras, estilos o personajes mediante extensiones creadas por usuarios (como LORAs) y generar imágenes a partir de un texto, eso sí, 512x512 en forma nativa. Su gran problema, la dificultad para renderizar fotorrealismo puro, texto escrito y las manos humanas.
  • Stable Diffusion XL (SDXL): En julio de 2023, supone un importante, pudiendo generar imágenes nativas de 1024x1024 píxeles, mejorando sustancialmente el entendimiento del lenguaje (prompts) y la calidad visual cde los resultados.
Stable Diffusion 3 (SD3.5) : Arquitectura MMDiT optimizada para seguir instrucciones complejas y renderizar texto de forma precisa. Problemas en la empresa Stable AI hace que un grupo de los más importantes creadores de SD marchen de la empresa y se integren en un nuevo proyecto, de la mano de la empresa Black Forest Labs (BFL). Aquí intentan solventar los problemas de Stable Diffusion y para ello utilizan una nueva tecnología, Transformers de Flujo Rectificado (Rectified Flow Transformers) o más conocida como la tecnología Flux.
  • FLUX.1: En Agosto de 2024, se presenta la familia FLUX.1 (en versiones Schnell, Dev y Pro).
Flux comienza una segunda fase de maduración. Si la primera versión de FLUX.1 demostró que la IA podía generar texto e imágenes hiperrealistas desde cero, BFL transforma su tecnología de "un simple generador de fotos" en una suite de herramientas profesionales para el control, la edición y el diseño de producción y aparecen tres modelos muy relevantes:
  1. Flux Kontext: En Junio de 2025 surge FLUX.1 Kontext, que introduce la generación de imágenes "en contexto" (in-context image generation). Ahora, el modelo entiende de manera nativa tanto las instrucciones de texto como las imágenes de referencia. Se le puede subir una foto y pedirle en el prompt un cambio, por ejemplo, "cambia el fondo por una playa” o “haz que la camiseta sea azul" o "pon a este mismo personaje en un entorno cyberpunk", todo ello sin desconfigurar el resto de la imagen, es decir, manteniendo la identidad del personaje.
  2. Flux Krea (Kreate): En Julio de 2025, en colaboración con la empresa Krea AI, surge Flux.1 Kreate, que soluciona algunos de los problemas de Flux1, como son texturas demasiado perfectas, rostros ligeramente plásticos y colores sobresaturados, convirtiéndose en el modelo preferido por la comunidad artística de código abierto para generar texturas de piel, ambiente de cámara reales y composiciones de alta gama
  3. Flux Fill: A principios de 2026, sale Flux1 Fill perfeccionando el concepto de Relleno Generativo, es decir, la manera en que se produce la adición, eliminación y expansión (outpainting) de objetos. Por ejemplo, si borras un reloj en la muñeca de alguien y usas Fill, el modelo no solo dibuja la piel que falta, sino que calcula cómo debe incidir la luz exacta de la escena sobre el brazo de forma hiperrealista, algo que con SD1.5 y SDXL requería una técnica llamada Inpainting (pintar una máscara negra sobre la zona a cambiar) obteniendo resultados de baja calidad. 
Qwen es una familia de modelos de inteligencia artificial de código abierto creada por Alibaba Group que ha evolucionado hacia la generación de imágenes y su integración nativa en ComfyUI. Algunos de sus hitos temporales:
  • Lanzamiento inicial (2023): Alibaba presentó Tongyi Qianwen, un modelo grande de lenguaje enfocado en texto y razonamiento multilingüe. Versiones posteriores mejoraron la visión, el código y el procesamiento de contextos extensos.
  • Llegada a la imagen (2025): El equipo de Alibaba lanzó variantes especializadas en infografías y generación visual, destacando por su arquitectura MMDiT de 20 mil millones de parámetros.
  • Soporte nativo para Comfyui (mediados de 2025): ComfyUI incorpora soporte oficial para los modelos visuales de Qwen. Se convierte en una alternativa avanzada frente a otros sistemas de difusión por su excelente fidelidad a las instrucciones complejas (prompt adherence) y su capacidad para renderizar texto legible de manera integrada.


Modelos de Lenguaje y Procesamiento de Texto

Son los "traductores" fundamentales de texto a matemáticas que todo modelo generativo necesita. Aunque no generan respuestas conversacionales, procesan y vectorizan el lenguaje:

  • CLIPTextEncode: Es el nodo básico que utiliza modelos CLIP (de OpenAI o variantes abiertas). Tokeniza las palabras y les asigna pesos matemáticos para que la IA comprenda el significado del prompt.
  • T5-XXL (Text Encoder): Integrado en flujos avanzados (como SD3 o Flux), es técnicamente el codificador de un LLM puro de Google (T5). Permite que el sistema comprenda descripciones largas, gramática compleja y relaciones conceptuales mucho mejor que los CLIP tradicionales.


Modelos de Espacio Latente


El espacio latente es la representación comprimida y matemática de una imagen en una dimensión inferior a los píxeles reales. Es el nivel en el que operan los modelos de difusión.

Los Modelos VAE (Variational AutoEncoder) son las tecnologías fundamentales detrás del espacio latente.
  • El VAE Encoder comprime una imagen de píxeles al espacio latente, es decir, convierte una imagen que nosostros vemos a una imagen que ve la IA.
  • El VAE Decoder revierte el proceso del espacio latente que gestiona la IA a una imagen en píxeles, visible por nosotros.


Tecnologías de Control y Condicionamiento


En ComfyUI, las tecnologías de "control y condicionamiento" son aquellas que permiten guiar, limitar o estructurar la generación de imágenes generadas por los modelos de difusión (como Stable Diffusion) para que el resultado se ajuste a intenciones específicas, en lugar de depender únicamente del azar o aleatoriedad de las indicaciones de texto, que podemos considerar el "condicionamiento primigenio".

Son las tecnologías de control estructural más potentes. Modifican el proceso de generación de la imagen a partir de las indicaciones de texto inyectando información visual de una imagen de referencia. Básicamente “estudian” la imagen de referencia, extraen información de la misma e incorporan esta información a la información textual del prompt que se envía para genera la imagen.

A continuación presentamos las principales tecnologías clasificadas bajo este concepto: 
  • Modelos de Guía Secundaria (LoRAs): Aunque a veces se consideran "modelos", su función principal en un flujo de trabajo es la modificación (el condicionamiento) de las características del modelo base. Modifican los pesos del modelo de texto (CLIP) o del modelo de difusión para forzar la aparición de ciertos conceptos artísticos, personajes o poses predecibles. Los Loras se obtienen mediante entrenamiento a partir de una partida de imágenes similares que se estudian y de las que se extraen los condicionamientos.
  • ControlNet: que dispone de diferentes modelos internos que aunque trabajan de forma similar, obtienen “mapas de referencia” diferentes, como son:
    • OpenPose: Controla la postura exacta de cuerpos y rostros mediante un esqueleto de puntos clave.
    • Canny / Lineart / SoftEdge: Utilizan la detección de bordes y líneas para replicar dibujos arquitectónicos, contornos o bocetos en el resultado final.
    • Depth / ZoeDepth: Controlan la geometría 3D y la profundidad de la escena, manteniendo la disposición de objetos cercanos y lejanos.
    • M-LSD: Especializado en detectar y mantener líneas rectas, ideal para diseño de interiores y perspectivas urbanas.
    • Scribble: Permite condicionar la IA a partir de un garabato o dibujo a mano alzada muy básico.
  • IP-Adapter (Image Prompt Adapter): actúa como un condicionamiento de estilo e identidad. Permite usar una o varias imágenes como "prompts visuales", pudiendo transferir a la nueva imagen
    • el estilo artístico
    • la paleta de colores
    • la composición espacial de la imagen
    • la estructura del rostro de un personaje
  • Técnicas de Atención y Máscaras (Inpainting / Outpainting): Realizan el condicionamiento de la nueva imagen por zonas, lo que permite controlar exactamente en qué parte de la imagen ha de producirse la modificación. Tenemos como más relevantes:
    • Condicionamiento por máscara o Conditioning (Set Mask): permite aplicar un prompt de texto específico únicamente a una sección seleccionada (enmascarada) de la imagen.
    • Attention Masking: Modifica los mapas de atención del modelo para obligar a la IA a enfocar ciertos elementos en coordenadas exactas de la composición.
    • GLIGEN (Grounded-Language-to-Image Generation): tecnología de condicionamiento basada en cajas de delimitación (bounding boxes) que seleccionan rectángulos sobre el lienzo a los que se les asigna un prompt de texto específico. Permiten modificar la imagen en zonas rectangulares específica.


Modelos de Escalado y Restauración.


Son tecnologías orientadas a la manipulación de las imágenes en lo referente a tamaño y calidad de imagen. En muchas ocasiones estas tecnología son trasparentes para nosotros ya que están embebidas dentro de los nodos funcionales de Comfyui. Podemos dividir las tecnologías de escalado y restauración de imágenes en tres grupos:
  • Modelos tradicionales: se fundamentan en técnicas de modificación de la resolución de la imagen procesando directamente sus píxeles mediante el uso de las llamadas “redes neuronales rápidas”, de manera que aumentan el tamaño de la imagen y añaden nitidez a la misma. Existen varios modelos como son:
    • ESRGAN y RealESRGAN: Ideales para uso general, ilustraciones y fotografía. Destacan variantes como 4x-UltraSharp y 4x_NMKD-Siax.
    • SwinIR: Excelente para preservar texturas naturales, detalles finos y paisajes.
    • BSRGAN: Especializado en manejar bordes afilados y reducir artefactos de compresión.
  • Modelos Avanzados de Difusión Generativa (Restauración profunda): son herramientas que utilizan la arquitectura de Stable Diffusion para re-renderizar la imagen y reconstruir los detalles perdidos a partir del contexto visual. Entre las más utilizadas tenemos:
    • SUPIR (Scaling-UP Image Restoration): Un modelo de vanguardia que logra resultados fotorrealistas extremos, corrigiendo desenfoques severos e introduciendo texturas complejas guiándose por prompts de texto.
    • CCSR (Content Consistent Super-Resolution): Alternativa basada en difusión que prioriza la fidelidad estricta al contenido original de la imagen dañada.
    • SeedVR2 y Recraft: Tecnologías modernas integradas para optimizar y restaurar tanto imágenes fijas como secuencias de video con alta fidelidad.
  • Modelos de Restauración Específica de Rostros: se aplican en combinación con los flujos de escalado para corregir deformaciones anatómicas en caras pequeñas o lejanas.
    • CodeFormer: Reconstruye rostros degradados con un buen balance entre realismo y parecido con la cara original.
    • GFPGAN: Una solución clásica muy rápida para corregir caras borrosas o de baja resolución.
  • Modelos matemáticos: usan algoritmos matemáticos para realizar su función, sin intervención de IA
    • Escalado por interpolación (Lanczos, Bicubic): Son instantáneos pero no añaden definición real.
    • Latent Upscale: Amplía la imagen en el espacio latente y aplica una pasada adicional con un KSampler, permitiendo inventar nuevos detalles con ayuda de un prompt, aunque puede alterar la estructura original.

Herramientas de Visión por Computadora y Segmentación

Las herramientas de visión por computadora y segmentación están orientadas al análisis de imágenes y posterior segmentación según criterios preestablecidos. Las más destacadas en ComfyUI combinan la detección de objetos guiada por texto con modelos de enmascaramiento de alta precisión píxel a píxel. Podemos hablar de las siguientes, algunas de las cuales comparten clasificación en otras apartados anteriores.
  • SAM (Segment Anything Model / SAM 2 / SAM 3): modelos que generan máscaras de segmentación exactas a partir de puntos de referencia, cajas delimitadoras o texto (han sido desarrollados por la empresa META)
  • Grounding DINO: Un detector de objetos basado en lenguaje natural (open-set) que identifica la posición de cualquier elemento descrito con palabras y dibuja sus coordenadas (bounding boxes). Su unión con SAM mediante extensiones como comfyui_segment_anything permite aislar objetos específicos sin reentrenar modelos.
  • YOLO (Ultralytics): Sistemas de detección en tiempo real muy rápidos, ideales para localizar y segmentar categorías supervisadas comunes (personas, rostros, manos o vehículos).
  • Florence-2 / OWLv2: Modelos alternativos de visión-lenguaje que sirven como paso previo (grounding) para extraer coordenadas que alimentan los nodos de segmentación.
  • ControlNet (Canny, Depth y Mapas Semánticos): Herramientas tradicionales de visión artificial para extraer mapas de contornos, profundidad y segmentación estructural de una imagen.
  • RMBG / Inspyrenet: Paquetes optimizados específicamente para la eliminación automática de fondos y la creación de canales alfa.


Intercambio de Caras y Modificación Corporal


Son tecnologías o herramientas que permiten las modificaciones sobre un personaje para modificar su identidad o para dotarle de las características de otro personaje diferente.

Las tecnologías principales en ComfyUI para el intercambio de caras y la modificación corporal se dividen en:
  • herramientas directas de sustitución: trabajan sobre una imagen previa que modifican
  • sistemas generativos basados en incrustación y control estructural: intervienen en el proceso de generación de la imagen 
Sin aplicar esta distinción técnica, algunas ya han sido mencionadas anteriormente en esta clasificación, las más importantes son:
  • Intercambio de Caras (Face Swap)
    • ReActor (ComfyUI-ReActor): extensión popular, rápida y sencilla para sustituir rostros de forma directa en imágenes y vídeos. Utiliza modelos basados en ONNX (como inswapper_128) y herramientas de detección como RetinaFace o YOLO. Permite integrar restauradores faciales como CodeFormer o GFPGAN para pulir el realismo.
    • InstantID: tecnología avanzada de transferencia de identidad facial. Actúa directamente en el proceso de generación mediante un ControlNet dedicado lo que permite mantener expresiones naturales y conservar el estilo de la imagen generada.
    • PuLID: introduce la consistencia de identidad facial en el espacio latente sin degradar la calidad estética ni alterar la iluminación general de la escena.
    • FaceFusion / SimSwap: actúan dentro de un proceso en el que localizan los puntos claves de la imagen, trasladan esta información a un modelo matemático que contiene la “identidad” del personaje, intercambia esta identidad con la del otro personaje y la fusiona con el resto de la imagen.
  • Control del cuerpo
    • ControlNet (OpenPose / DensePose): tecnología estándar para controlar la postura, la estructura esquelética y las extremidades del cuerpo. Permite definir cómo se posicionan los brazos, piernas y el torso de un personaje utilizando una imagen de referencia o un esqueleto editable.
    • IP-Adapter (más Clip Vision): Permite transferir características visuales completas (como la complexión corporal, la ropa o el estilo estético) utilizando una imagen de referencia conectada al modelo de atención cruzada. Combinando IP-Adapter con UnClipConditioning o máscaras de atención (Attention Masking), es posible mantener la consistencia del cuerpo y la vestimenta en sucesivas generaciones.
    • Inpainting (SAM2 / Florence2 / Masking): herramientas de segmentación inteligente que detectan y aíslan partes específicas del cuerpo (como el torso, las extremidades o la ropa) para modificarlas de manera local mediante un prompt o una segunda pasada de generación, preservando el resto de la composición intacta.

En una segunda parte podríamos hablar, y es posible que lo hagamos más adelante, de las tecnología relacionadas con la creación de vídeos.


Espero que este documento resulte útil a quien lo lea o lo use de referencia.


Novato 3D

Comentarios

Entradas populares de este blog

GENERAR MODELOS 3D COMO COPIA DE MODELOS FÍSICOS (I)

COMO ES LA ESTRUCTURA DE UN OBJETO 3D y TIPOS DE FICHEROS DONDE GUARDARLA

LA SELVA DE LA IA GENERATIVA DE SOFTWARE LIBRE