¿Alguna vez has notado que el modelo de IA «se olvida» de lo que dijiste al principio de una conversación larga? ¿O que subir un PDF consume mucho más de lo que esperabas? Tiene una explicación técnica muy concreta, y entenderla cambia cómo trabajas con cualquier herramienta de IA.
Se llaman tokens. Y aunque suena a jerga de desarrollador, es uno de esos conceptos que, una vez que lo entiendes, te hace más eficiente de inmediato. No necesitas saber programación para comprender esto. Solo necesitas saber que cada vez que usas una IA, hay un contador corriendo por debajo.
Ir directo a lo que me interesa
ToggleQué es un token, exactamente
Un token no es una palabra. Tampoco es un carácter. Es algo intermedio: un fragmento de texto que el modelo usa como unidad mínima de procesamiento.
Para hacerlo concreto:
- «casa» → 1 token
- «inteligencia artificial» → 3 tokens aproximadamente
- «ChatGPT» → 2 tokens
- Un espacio también puede ser un token
Como referencia rápida: 100 palabras en español equivalen a unos 130-150 tokens aproximadamente. El español tiende a necesitar más tokens que el inglés para decir lo mismo, porque las palabras son más largas y la morfología es más compleja.
Los modelos de IA procesan todo en tokens: lo que tú escribes (el input), lo que el modelo genera como respuesta (el output), y también las instrucciones internas que configuran cómo se comporta el modelo.
Por qué los tokens importan en la práctica
Cada modelo tiene un límite de contexto: la cantidad máxima de tokens que puede procesar a la vez. Es como la memoria de trabajo del modelo. Todo lo que esté dentro de ese límite, el modelo lo «ve». Lo que quede fuera, no existe para él.
Algunos ejemplos de límites actuales (pueden variar según versión y plan):
| Modelo | Contexto aproximado |
|---|---|
| GPT-4o | 128.000 tokens |
| Claude Sonnet | 200.000 tokens |
| Gemini 1.5 Pro | hasta 1 millón de tokens |
Estos números parecen enormes, pero en cuanto empiezas a subir documentos, mantener conversaciones largas o usar el modelo con instrucciones detalladas, el límite se acerca más rápido de lo que parece.
Lo que ocurre cuando te acercas al límite: el modelo empieza a «olvidar» el principio de la conversación. No porque tenga amnesia, sino porque técnicamente ya no cabe en su ventana de contexto. Esto explica por qué en conversaciones muy largas las respuestas empiezan a perder coherencia o ignoran cosas que dijiste hace rato.
PDF vs texto plano: una diferencia que no es trivial
Esta es la pregunta práctica que muchos profesionales no se hacen hasta que tienen un problema.
Cuando subes un PDF a Claude o ChatGPT, el modelo tiene que procesarlo. Y no todos los PDFs son iguales:
PDF con texto seleccionable (el «bueno»)
Es un PDF donde puedes marcar el texto con el cursor. El modelo puede extraer el contenido directamente. Aun así, el archivo tiene estructura, metadatos y formato que añaden ruido. El consumo de tokens es mayor que si pegaras el mismo texto en el chat.
PDF escaneado (el «caro»)
Es básicamente una fotografía de un documento. El modelo tiene que procesarlo como imagen primero, y luego interpretar el texto. Este proceso, que se llama OCR combinado con visión computacional, consume muchos más tokens. El mismo contenido puede costar entre 2 y 4 veces más tokens que en texto plano.
Texto plano o Markdown
Es lo más eficiente. Sin capas, sin estructura visual que procesar. El modelo recibe exactamente el contenido, nada más. Un documento en .txt o .md puede consumir entre un 30% y un 60% menos tokens que el mismo contenido en PDF.
Ejemplo real: Un contrato de 10 páginas en PDF seleccionable puede ocupar unos 4.000-5.000 tokens. El mismo contrato pegado como texto plano: 2.500-3.500 tokens. Si es un PDF escaneado, podemos llegar a 8.000-10.000 tokens o más.
Cómo afecta esto al coste real
Si usas la API de un modelo (lo que hacen las empresas que integran IA en sus sistemas), el coste se paga directamente en tokens. El precio varía por modelo, pero el principio es siempre el mismo: más tokens = más coste.
Si usas la versión de suscripción (ChatGPT Plus, Claude Pro, etc.), no pagas por token directamente, pero sí existen límites de uso. Cuando consumes más tokens de los necesarios, llegas antes al límite de mensajes por hora o por día.
En cualquiera de los dos casos, usar tokens de forma ineficiente tiene un coste, ya sea económico o en forma de restricciones de uso.
Estrategias prácticas para usar menos tokens sin perder calidad
No se trata de escribir menos. Se trata de escribir mejor.
1. Pasa el texto en lugar del PDF cuando puedas
Si tienes el documento en Word o Google Docs, copia el contenido directamente en el chat. O guárdalo como .txt. El resultado para el modelo es idéntico, pero el consumo es significativamente menor.
2. No repitas contexto que ya está en la conversación
Si lleváis diez mensajes hablando del mismo contrato, no hace falta que en cada mensaje digas «como te dije antes, el contrato es de Fripozo y vence en diciembre». El modelo ya lo tiene en contexto.
3. Empieza conversaciones nuevas para temas nuevos
Muchos usuarios mantienen una sola conversación enorme para todo. Esto tiene un coste real: cuanto más larga es la conversación, más tokens ocupa el historial, y menos «espacio» queda para el razonamiento. Para tareas sin relación entre sí, abre un chat nuevo.
4. Sé preciso en las instrucciones
Una instrucción bien escrita de 50 palabras funciona mejor que una mal escrita de 200. El modelo no procesa mejor porque le des más texto, procesa mejor porque el texto es más claro.
5. Para documentos largos, considera resumir antes de analizar
Si tienes un informe de 80 páginas y solo necesitas analizar la sección de riesgos, extrae esa sección y pásala sola. No hace falta que el modelo tenga todo el documento en contexto si la pregunta solo afecta a una parte.
Una última cosa que vale la pena entender
Los tokens no son solo una cuestión de coste o de límites técnicos. Son, en cierta medida, un indicador de complejidad de tarea.
Cuando una empresa decide usar IA para automatizar procesos, analizar contratos o generar informes, el consumo de tokens en producción es un dato crítico para dimensionar el proyecto. No es lo mismo procesar 10 documentos al mes que 10.000. Y no es lo mismo un documento de una página que uno de cien.
Entender cómo funcionan los tokens ayuda a diseñar mejor los procesos de IA: qué documentos preprocesar, cómo estructurar los prompts, cuándo tiene sentido usar el modelo completo y cuándo basta con uno más pequeño.
En las formaciones que imparto para empresas, este es uno de los primeros conceptos que trabajo. No porque sea el más emocionante, sino porque es la base para tomar decisiones informadas. Y en IA, tomar decisiones sin entender los fundamentos sale caro.
Resumen
- Un token es la unidad mínima que procesa un modelo de IA: ni una palabra ni un carácter, algo intermedio.
- Cada modelo tiene un límite de contexto (su «memoria de trabajo»). Cuando lo superas, el modelo empieza a olvidar.
- Los PDFs escaneados consumen muchos más tokens que el texto plano. Los PDFs seleccionables, también más que el texto directo.
- Usar tokens de forma eficiente no significa escribir menos, sino escribir con más criterio.
- Para empresas que integran IA, el consumo de tokens tiene impacto directo en el coste operativo.
¿Sabías cómo funcionaban los tokens antes de leer esto? ¿O es uno de esos conceptos que nadie te explicó cuando empezaste a usar IA?
¿Quieres que tu equipo sepa realmente cómo usar la IA? En Academia de IA diseñamos formaciones a medida para empresas: desde talleres de iniciación hasta programas avanzados de automatización y cumplimiento normativo. 👉 Solicita información sobre formación para tu empresa.

Abogada especializada en Inteligencia Artificial. Profesora externa de IA en ENAE. Speaker. CEO Fundadora de academiadeia.es, legalprompt.es, fenixcomunicación.es, murciaunica.com y la revista digital para «Nostálgicos de mentes inquietas» generacionfenix.com.
