KitanaFotos y videos con IA
Creador de fotos · 4 min de lectura

Texto a imagen con IA: qué es y cómo funciona

La difusión explicada sin matemáticas: qué aprendió el modelo, por qué la misma indicación nunca da la misma imagen y qué significa eso a la hora de escribir prompts.

Por el equipo de Kitana
TACREADOR DE FOTOS

La IA de texto a imagen es la parte de este campo donde la idea popular está más equivocada, y esa idea equivocada lleva directamente a malas indicaciones. Por eso merece la pena entenderla bien.

No está buscando nada

La suposición más común es que el modelo tiene una biblioteca inmensa de imágenes y cose las que coinciden con tus palabras. No es así. No hay biblioteca.

Lo que tiene es un conjunto de asociaciones aprendidas entre el lenguaje y la estructura visual, construido a partir de enormes cantidades de pares de imagen y descripción. Aprendió que "golden retriever" suele aparecer junto a cierta disposición de formas, una textura de pelo y un color; que "al atardecer" suele aparecer junto a sombras largas y una luz cálida y baja.

Cuando le das una indicación, no está recuperando nada. Está generando píxeles que satisfacen esas asociaciones aprendidas. Por eso puede dibujar algo que nunca se ha fotografiado, y por eso no puedes pedirle que encuentre una imagen que recuerdas.

Cómo aparece de verdad la imagen

La técnica se llama difusión, y la intuición es más sencilla de lo que sugiere el nombre.

Durante el entrenamiento, al modelo se le mostraba una y otra vez una imagen con un poco de ruido aleatorio añadido, luego más, luego más, hasta que la imagen era pura estática. Aprendió a recorrer ese camino al revés: dada una imagen con ruido, predecir cómo era la versión con un poco menos de ruido.

Para generar, parte de ruido aleatorio puro y aplica ese paso aprendido una y otra vez, veinte, treinta, cincuenta veces, quitando cada vez un poco de ruido y acercándose a algo coherente. Tu indicación guía cada paso, empujando el resultado hacia las asociaciones que evocan tus palabras.

La imagen surge como una forma surge de la niebla: no se dibuja trazo a trazo, sino que se resuelve entera, poco a poco.

De ahí se siguen dos cosas inmediatamente.

La misma indicación da imágenes distintas. Ruido inicial distinto, camino distinto, destino distinto. No es un fallo, y no hay ninguna imagen "correcta" a la que se esté aproximando.

No se recupera nada, así que nada está garantizado. El modelo produce algo plausible para tus palabras. Plausible no es exacto, y por eso el texto generado es un sinsentido y las manos generadas son poco fiables.

Qué significa para tus indicaciones

Si el modelo empareja asociaciones aprendidas entre palabras y estructura visual, una buena indicación es la que está hecha de palabras con asociaciones visuales fuertes.

Funciona: cosas concretas y visibles.

  • "Un invernadero de cristal junto a un lago, niebla de primera hora, luz suave"
  • "Vista cenital de un escritorio de madera, instrumentos de latón dispersos, lámpara cálida"
  • "Primer plano de una cuerda desgastada sobre un muro de piedra, poca profundidad de campo"

No funciona: juicios sin referente visual.

  • "Obra maestra impresionante, 8k, premiada, máxima calidad"
  • "Bonito y profesional"

El segundo grupo parece que debería ayudar, y es por donde empieza casi todo el mundo. Pero "premiada" no tiene una forma visual constante: apareció en descripciones de todos los géneros y estilos, así que no orienta nada. Peor aún, ocupa atención que podría haber usado un detalle descriptible.

La edición más útil para una indicación floja es borrar todos los adjetivos que no describan algo que podrías señalar en la imagen.

Lo que todavía no es fiable

  • El texto. Para el modelo las letras son patrones visuales, no lenguaje. Las palabras cortas a veces salen; las frases, no.
  • Manos y dedos. Mejoran, pero siguen siendo la señal más común.
  • Contar. "Cinco pájaros" produce de forma fiable entre tres y ocho.
  • Relaciones espaciales. "La taza a la izquierda del libro" se sigue de forma aproximada.
  • Cualquier cosa factual. No tiene hechos, solo asociaciones.

No son ajustes que hayas puesto mal. Son consecuencias de cómo funciona el modelo, y ninguna ingeniería de indicaciones las resuelve del todo.

Dónde encaja junto a las herramientas de edición

El texto a imagen crea algo de la nada. Las demás herramientas toman una foto que ya tienes y la cambian. Son trabajos distintos, y conviene tener claro cuál necesitas: convertir una foto en anime conserva a tu sujeto, mientras que generar a partir de texto no.

Si quieres una imagen tuya en otro estilo, eso es un cambio de estilo o un avatar, no texto a imagen. Una indicación no puede producir tu cara, porque tu cara no es una de las asociaciones que aprendió. Para saber cuándo tiene sentido un avatar y cuándo no, mira avatar con IA o foto profesional.

Texto a imagen es una de las cuatro herramientas del estudio del navegador de Kitana, la única que no necesita ninguna foto, lo que la convierte en el sitio más fácil para ver cómo se comportan las indicaciones. Las otras trece herramientas de foto están en las apps.

Preguntas frecuentes

¿El modelo busca imágenes y las combina?
No. No hay ninguna base de datos de imágenes que consultar. El modelo contiene patrones aprendidos, relaciones estadísticas entre palabras y estructura visual, y genera píxeles nuevos cada vez. Por eso no puedes pedirle que encuentre una foto concreta, y por eso puede producir cosas que nunca han existido.
¿Por qué obtengo una imagen distinta con la misma indicación?
La generación parte de ruido aleatorio y lo va refinando. Un ruido inicial distinto toma un camino distinto hacia una imagen plausible distinta. La mayoría de las herramientas lo exponen como una semilla; si fijas la semilla y la indicación, obtienes un resultado repetible.
¿Por qué el texto de las imágenes generadas siempre sale mal?
El modelo aprendió cómo se ve el texto, no lo que dice. Para él las letras son patrones visuales, y reproduce la textura de la escritura sin sus reglas. Los modelos más nuevos aciertan mejor con palabras cortas y siguen siendo poco fiables con frases.
¿Funcionan mejor las indicaciones largas?
Hasta cierto punto. El detalle visual concreto ayuda; amontonar adjetivos no. Una indicación compite por una cantidad fija de atención, así que cada palabra que no describe algo visible diluye a las que sí lo hacen.
¿De quién es lo que genero?
No está resuelto y depende de cada país. La Oficina de Derechos de Autor de Estados Unidos ha sostenido que las obras sin autoría humana no son protegibles, lo que deja las imágenes generadas solo con una indicación en terreno incierto. Revisa las condiciones de la herramienta que uses y no des por hecha la exclusividad.
¿Puede copiar el estilo de un artista concreto?
Puede aproximarse a estilos que vio durante el entrenamiento, y muchas herramientas restringen ya nombrar a artistas vivos. Si eso es aceptable está en debate y varía según el país; el consejo práctico es describir las cualidades visuales que buscas en lugar de tomar prestado el nombre de una persona.

¿Listo para ponerlo en práctica?

Crea con Kitana usando la herramienta que encaja con esta guía.

Genera una imagen a partir de texto

¿Listo para probarlo tú mismo?

Descarga Kitana y crea tu primera foto con IA en menos de un minuto.