¿Por qué la IA «alucina»? ¡Y cómo podemos evitarlo!

porqué alucinan las ias

Seguro que te has encontrado con ello: le preguntas algo a un modelo de lenguaje (un LLM como ChatGPT o Gemini) y te da una respuesta que, aunque suena convincente, ¡es completamente falsa! Estas «alucinaciones» son uno de los temas más candentes en el mundo de la IA. No solo nos hacen desconfiar, sino que limitan mucho el uso de la IA en campos tan importantes como la medicina, el derecho o la educación.

Pero, ¿por qué pasa esto? Un informe reciente, «Why Language Models Hallucinate» (de OpenAI y Georgia Tech), nos da una visión muy clara: no son fallos misteriosos, sino errores estadísticos inevitables que nacen desde el «preentrenamiento» de la IA y que, curiosamente, se refuerzan por cómo los evaluamos.

En este artículo, vamos a desgranar los puntos clave de este informe y, lo más importante, ¡veremos cómo podemos reducir este fenómeno para conseguir LLMs mucho más fiables!

Primero, ¿qué son las alucinaciones en un LLM?

Los autores del estudio lo definen de forma sencilla: son respuestas falsas, pero que el modelo expresa con una confianza excesiva. A diferencia de cuando una persona «alucina» (que es una experiencia perceptiva), en la IA son simplemente errores de predicción estadística. ¡Como si la IA estuviera haciendo una mala apuesta!

Imagina esto:

  • Le pides datos sobre un investigador y el modelo se inventa varias fechas de cumpleaños porque no tiene la respuesta real.

  • Sistemas como GPT-4o, DeepSeek o Llama proporcionan títulos de tesis que no existen para un mismo autor.

  • Errores más «tontos» pero reveladores: el modelo cuenta mal las letras de una palabra, como si dijera «DEEPSEEK» y afirmara que tiene 7 letras en lugar de 8.

👉 Y ojo, estas alucinaciones pueden ser de dos tipos:

  • Intrínsecas: contradicen directamente lo que tú le has pedido en tu prompt.

  • Extrínsecas: contradicen la realidad o los datos con los que el modelo fue entrenado.

El «pecado original»: todo empieza en el preentrenamiento

El estudio es claro: las alucinaciones no aparecen de la nada. Surgen en la fase de preentrenamiento, incluso si los datos usados para entrenar a la IA fueran perfectos.

Los investigadores lo conectan con una tarea simple: la clasificación binaria (saber si algo es «válido» o «no válido»). Si un modelo falla al distinguir entre afirmaciones correctas e incorrectas durante esta fase inicial, inevitablemente generará falsedades.

Como dicen los expertos: «Si las declaraciones incorrectas no se pueden distinguir de los hechos, entonces las alucinaciones surgirán de forma natural durante el preentrenamiento.»

¿Qué factores estadísticos lo explican?

  • Hechos arbitrarios: Datos sin un patrón claro (ej. fechas de cumpleaños aleatorias).

  • Limitaciones del modelo: Fallos en cómo el modelo representa o «procesa» la información.

  • GIGO (Garbage In, Garbage Out): Si hay errores en los datos con los que se entrenó, la IA los replicará.

  • Complejidad computacional: Si la pregunta es demasiado difícil de resolver.

  • Cambio de distribución (OOD): Cuando le preguntas algo muy alejado de los datos con los que fue entrenada.

¿Por qué persisten? ¡Nosotros tenemos parte de culpa!

Aunque el problema nace en el preentrenamiento, las alucinaciones no solo persisten, sino que ¡se amplifican por cómo evaluamos a los modelos!

Piensa en un examen humano:

Imagina que eres un estudiante y en un examen, adivinar te da 1 punto, pero dejar la pregunta en blanco te da 0. ¿Qué harías? Pues adivinar, ¡claro! Los LLMs funcionan de forma similar. La mayoría de las evaluaciones (los famosos benchmarks) les dan 1 punto por respuestas correctas y 0 por abstenerse.

Esto crea una «epidemia de penalizar la incertidumbre». Un modelo que dice «No lo sé» parece «peor» que uno que se arriesga con una respuesta falsa.

Los benchmarks actuales tienen limitaciones:

La mayoría de las evaluaciones populares (MMLU, GPQA, SWE-bench, etc.) usan puntuaciones binarias (0-1). Incluso las que permiten decir «no sé» (como WildBench) suelen premiar más una respuesta incorrecta que una honesta. ¡Así que la IA está incentivada a «mentir» para sacar mejor nota!

La solución: ¡Cambiemos las reglas del juego! (Y cómo puedes empezar a hacerlo)

Los investigadores proponen una solución «sociotécnica»: rediseñar las evaluaciones para que incentiven la honestidad, no la conjetura.

Medidas que recomiendan (y cómo puedes aplicarlas en tus prompts):

  1. Incorporar objetivos de confianza explícitos: Indicarle a la IA el coste de equivocarse frente a decir “No lo sé”.

    • Cómo pedirlo tú: «Responde a mi pregunta. Si no estás completamente seguro de la respuesta, indícalo claramente diciendo ‘No lo sé’ o ‘Mi conocimiento es limitado en este punto’.«

    • Ejemplo práctico: «Cuál fue la fecha de la batalla de Hastings? Si hay algún margen de error o incertidumbre, por favor, menciónalo.«

  2. Penalizar las conjeturas falsas: Dejar claro que una respuesta incorrecta tiene un «castigo».

    • Cómo pedirlo tú: «Necesito la respuesta exacta a esta pregunta. Considera que una respuesta incorrecta es peor que no responder.«

    • Ejemplo práctico: «¿Quién ganó el Premio Nobel de Literatura en 1992? Si no tienes el dato verificable, simplemente di ‘No tengo esa información precisa’. No intentes adivinar.«

  3. Premiar la calibración: Incentivar que los modelos solo respondan cuando superen un umbral de confianza.

    • Cómo pedirlo tú: «Responde a esta pregunta solo si tu confianza en la exactitud de la respuesta supera el 90%. Si no es así, di ‘No puedo responder con suficiente certeza’.»

    • Ejemplo práctico: «Quiero saber las principales diferencias entre el derecho civil y el common law. Si alguna de las diferencias que vas a mencionar no está completamente contrastada, no la incluyas.«

Los investigadores proponen una instrucción clara para las evaluaciones: «Responda solo si está >t seguro. Una respuesta incorrecta se penaliza con t/(1-t) puntos negativos, mientras que ‘No lo sé’ vale 0 y una respuesta correcta otorga 1.»

¡Ojo! No es la panacea, pero es un gran paso

Aunque este enfoque es muy prometedor, tiene sus límites:

  • Se enfoca en «mentiras plausibles», no en respuestas totalmente absurdas.

  • Es difícil de aplicar en prompts abiertos y creativos.

  • Ni siquiera técnicas como RAG (Generación Aumentada por Recuperación) resuelven el problema si los benchmarks siguen premiando las conjeturas.

Hacia una IA más honesta y de fiar

Este informe nos da una conclusión clave: las alucinaciones no son un misterio esotérico, sino una consecuencia lógica de cómo construimos y evaluamos la IA.

Para reducirlas, no basta con más datos o arquitecturas más complejas. Necesitamos un cambio de mentalidad en los sistemas de evaluación. Solo así podremos incentivar a los modelos a admitir su incertidumbre en lugar de inventar respuestas con descaro.

👉 La clave está en modificar las evaluaciones principales, premiando la honestidad sobre la apariencia de certeza. Esto allanará el camino hacia modelos de lenguaje mucho más confiables, útiles y, por supuesto, ¡más seguros para todos!

¿Te interesa profundizar más?

Descárgate el informe completo aquí.

¡No te quedes atrás! Suscríbete a nuestra newsletter para estar al día de las últimas novedades en IA y descubre todos nuestros cursos para dominar esta tecnología.