Volver al blog
Kouzee · Revista de diseño18 Ago 2025
Artículos

Cómo funciona la generación de imágenes con IA

Guía para diseñadores: qué hay detrás de los modelos que generan imágenes —GANs, difusión, ControlNet— y cómo pedirles mejores resultados.

Guía para diseñadores: qué hay detrás de los modelos que generan imágenes —GANs, difusión, ControlNet— y cómo pedirles mejores resultados.

La generación de imágenes con IA funciona con unos pocos principios que no cambian aunque cada semana salga un modelo nuevo: redes que aprenden a transformar ruido en imágenes, parámetros que controlan qué tan literal es el resultado, y modelos auxiliares que cuidan la geometría. Entenderlos no es un lujo técnico: es lo que separa pedirle "hazme un render bonito" a una IA y frustrarse, de saber exactamente qué pedir, con qué herramienta y por qué falló cuando falla.

Esta guía resume una capacitación que dimos a más de 130 arquitectos y diseñadores. Va de menos a más: tipos de modelos, los tres parámetros que explican la mayoría de los resultados "raros", los métodos que usarás a diario y por qué un chat generalista no sirve para trabajar con productos reales.

¿Para qué entenderlo si todo cambia cada semana?

Porque la tecnología cambia, pero las bases permanecen. Los modelos nuevos se montan sobre los mismos principios que verás aquí, igual que el BIM se montó sobre la lógica de los planos sin reemplazar al arquitecto. En cada salto tecnológico del oficio, del tablero de dibujo al CAD y del CAD al BIM, lo importante no fue la herramienta en sí, sino cómo se utilizó.

Y hay una razón más práctica: el vocabulario. Cuando todos manejamos qué es una planta, un corte y una elevación, pedir cambios es fácil. Con la IA pasa lo mismo: saber qué es una seed, un modelo de difusión o un ControlNet te permite pedir lo que quieres en vez de describir "el cosito que hace la cosa", como en la ferretería.

¿Qué tipos de modelos generan imágenes?

GANs: un pintor y un juez

Evolución de un rostro generado por una GAN: de una imagen difusa a un retrato cada vez más definido

Las GANs (2014) fueron los primeros modelos que inventaron imágenes nuevas y coherentes. Funcionan con dos redes que compiten: una "pinta" a partir de ruido aleatorio y otra critica —"esa imagen es falsa"— hasta que la primera logra engañarla. Así nacieron los primeros rostros generados, pequeños y borrosos al principio, hiperrealistas después con modelos como StyleGAN. El paper original de las GANs (2014) es el punto de partida de todo lo que vino después.

Transformers: construir con LEGO

Rostro generado por parches: de bloques de píxeles gruesos a la imagen completa, como piezas de un puzzle

Usan la misma arquitectura que los modelos de texto como GPT, pero aplicada a imágenes: dividen la imagen en parches (tokens visuales) y la construyen pieza a pieza, prediciendo el siguiente parche como un puzzle. Son menos comunes que la difusión para imágenes fijas, pero dominan en video y en modelos multimodales.

Difusión: sintonizar la TV

Un retrato emergiendo del ruido: el proceso de un modelo de difusión de la estática a la imagen nítida

Los modelos de difusión —Stable Diffusion, Midjourney, DALL·E— son los más usados hoy. Se entrenan al revés: toman fotos reales y les agregan ruido hasta destruirlas; luego aprenden el proceso inverso. Al generar, parten de puro ruido y lo "limpian" paso a paso hasta que aparece la imagen, como mover la antena hasta que se sintoniza el canal. Su versión de código abierto democratizó el acceso y explica la explosión creativa desde 2021.

Controladores: el libro para colorear

Seis mapas de control de ControlNet: profundidad, bordes, pose humana, segmentación, normales y líneas de perspectiva

ControlNet y LoRA no generan por sí solos: guían a los modelos grandes para que no se salgan de las líneas, como un libro para colorear. Son la razón de que una IA pueda respetar tu proyecto en vez de inventarse otro. Los mapas de control más útiles en interiorismo:

  • Profundidad: qué va adelante y qué va atrás, clave para luz y sombras correctas.
  • Contornos y bordes: preservan geometría y escala; nada se deforma.
  • Pose humana: un esqueleto de referencia para generar personas en la postura exacta.
  • Segmentación: aísla zonas para cambiar un material sin tocar el resto.
  • Normales: simulan cómo llega la luz según si la superficie es rugosa, lisa o brillante.
  • Líneas de perspectiva (MLSD): el más importante para arquitectura interior — mantiene el layout y la perspectiva del espacio.

Los LoRA, por su parte, se entrenan para volverse expertos en un objeto específico —tu silla, tu botella, tu luminaria— y cuidan que ese producto salga fiel mientras el modelo general resuelve la escena. El paper de ControlNet (2023) explica la técnica en detalle.

Seed, CFG y pasos: los tres parámetros que explican los resultados "raros"

Seed: pedir que te atienda Pedro

Dos retratos generados con el mismo prompt pero distinta seed: misma descripción, persona distinta

La seed es el número que define el punto de partida del ruido. Mismo prompt + misma seed = la misma imagen; cambias la seed y la "mujer de pelo castaño, retrato 50 mm" sigue cumpliendo la descripción, pero es otra persona. Si alguna vez pediste "la misma casa nórdica pero en otro paisaje" y te llegó una casa completamente distinta, fue esto: nadie controló la seed. Es como volver a una oficina y preguntar si está Pedro, porque Pedro ya sabe cómo atenderte.

CFG: el GPS de la creatividad

El mismo retrato con CFG 12 y CFG 3: a menor guidance, más libertad creativa del modelo

Controla qué tan literal es la IA con tu prompt. Bajo: más libertad creativa. Alto: obediencia total, con el riesgo del "genio de los deseos" — pides "un cuadro sobre la mesa" y te lo pone literalmente encima de la mesa en vez de colgarlo en la pared. El sentido común de la IA vive en este parámetro.

Pasos: manos de pintura

El mismo retrato con 50 y 15 pasos de refinamiento: menos pasos, menos detalle y definición

Cuántas iteraciones hace el modelo para refinar la imagen desde el ruido. Pocos pasos: rápido pero borroso —la oreja mal definida, la uña que falta—. Muchos: más detalle, más tiempo de espera. Como pasar varias manos de pintura.

¿Qué métodos usarás a diario?

Sofá capitoné de cuero café generado desde texto sobre fondo blanco
  1. Text-to-image: escribes y la IA genera. "Haz un sofá capitoné de cuero café en un fondo blanco" produce exactamente eso.
  2. Image-to-image: subes una imagen y pides modificarla. Es el método central del flujo de diseño.
  3. Inpainting / outpainting: con una máscara de recorte modificas solo un pedacito (cambiar la cortina sin que aparezca un sofá de la nada) o extiendes la imagen más allá de sus bordes.
  4. Imágenes de referencia y transferencia de estilo: "quiero mi render con este estilo" — acuarela, croquis, una pintura.
  5. Multimodal: los modelos más nuevos entienden texto e imagen de forma nativa, sin traducir entre herramientas — se sienten más como un colaborador que como una herramienta aislada.

El salto de calidad en interiorismo está en combinar estos métodos con los controladores. Un ejemplo real de la charla: un fotomontaje 2D hecho con productos del catálogo se convierte en fotografía con profundidad, luces y sombras — sin perder un solo producto ni un centímetro de geometría:

Comparación entre un fotomontaje 2D de un dormitorio y la fotografía realista generada preservando todos los productos

¿Por qué un chat generalista te cambia los productos?

Porque genera una imagen completamente nueva, píxel por píxel, interpretando la anterior. En la charla hicimos la prueba: el mismo fotomontaje procesado por un chat generalista volvió con otra lámpara, un velador flotante convertido en mueble de piso y un espejo distinto. Para un diseñador eso es fatal: si le pasaste al cliente el link de compra, la imagen ya no corresponde al producto. Un flujo especializado —modelo + segmentación + profundidad + perspectiva— preserva cada pieza, porque hay controladores dedicados a que nada se salga de los límites.

Esa es exactamente la diferencia que revisamos en IA para diseño de interiores: más que un render, y el problema que ataca Kou, nuestro asistente de IA: cada botón de Kouzee lleva preconfigurados el modelo, los controladores y los parámetros correctos para cada tarea, para que no tengas que ajustar seeds ni CFG a mano.

Preguntas frecuentes

¿Necesito un computador potente para generar imágenes?

No necesariamente. Los modelos pueden descargarse y correr localmente, pero exigen tarjetas gráficas grandes; por eso casi todos los servicios generan en servidores externos y tú solo envías la petición. Para el uso profesional típico, basta cualquier computador con navegador.

¿Por qué la IA a veces "inventa" cosas que no pedí?

Casi siempre es una combinación de CFG (qué tan literal es), falta de máscara de recorte (modificó más de lo que querías) o una seed sin controlar (cambió el punto de partida). Los agentes además interpretan de forma literal: si pones un banco flotando en el fotomontaje, saldrá un banco flotando.

¿Qué modelo debería usar?

Depende de la tarea, no de la moda: difusión para imágenes desde texto o referencia, controladores cuando la geometría importa, multimodales para flujos conversacionales. La estrategia sana es probar y comparar — y usar herramientas que ya traigan los ajustes correctos para tu caso.

Por dónde empezar

Toma una foto o un render de tu último proyecto y prueba tres cosas: cambiar un material con una máscara, borrar un objeto y pedir una variación controlando la referencia. Con esos tres ejercicios vas a entender más que con horas de tutoriales. Y si prefieres verlo en vivo con el equipo, súmate a un taller gratuito en la agenda de Kouzee.

Gonzalo Navarro
Gonzalo NavarroFounder & CEO