Un token es la unidad que los modelos leen y la unidad que tu proveedor cobra: alrededor de cuatro caracteres de inglés, o tres cuartos de una palabra. No te cobran por pregunta ni por respuesta, sino por token, en las dos direcciones y en cada request.
Esa distinción es la razón por la que una factura te puede sorprender. Dos preguntas de la misma extensión pueden costar cantidades muy distintas, y una conversación se encarece a medida que avanza aunque tus preguntas sigan siendo cortas.
Por Devy · Categoría: AI Dev Tools
¿Qué es un token en la IA?
Un token es la unidad mínima en la que un modelo procesa el texto. El glosario de Anthropic los define como “las unidades individuales más pequeñas de un modelo de lenguaje, y pueden corresponder a palabras, subpalabras, caracteres o incluso bytes”. OpenAI lo dice de forma más directa: “Un token puede representar un carácter, parte de una palabra, una palabra completa o un signo de puntuación. Los espacios también afectan cómo se divide el texto en tokens”.
El modelo nunca ve tu texto como texto. Antes de que ocurra nada, tu entrada se codifica en una secuencia de tokens, el modelo procesa esa secuencia, y su salida se decodifica de vuelta. Los tokens son la unidad nativa; los caracteres son la interfaz.
¿Por qué te cobran por token y no por pregunta?
Porque el token es lo que el modelo realmente procesa, y el costo escala con cuántos haya.
La consecuencia práctica es la que casi todos pasan por alto: pagas la conversación entera en cada turno. Los modelos no tienen estado. Para responder tu décimo mensaje, el modelo recibe los nueve intercambios anteriores más el system prompt más cualquier archivo adjunto, reenviados como entrada. Tu décima pregunta puede tener seis palabras, y el request que la transporta veinte mil tokens.
Por eso un agente que trabaja en una tarea larga cuesta más por paso a medida que avanza, y por eso “la conversación se encareció y yo no hice nada distinto” no es un error de facturación.
La entrada y la salida se cobran a precios distintos —la salida suele costar varias veces más por token—, así que un prompt corto que pide un documento largo tiene una forma económica muy diferente a la de un prompt largo que pide un sí o un no.
¿Cuántos tokens tiene tu texto?
Las reglas prácticas publicadas, para inglés:
| Fuente | Regla |
|---|---|
| OpenAI | ~4 caracteres por token; ~¾ de palabra; 100 tokens ≈ 75 palabras |
| Anthropic | ~3,5 caracteres de inglés por token |
OpenAI es explícito en que son aproximaciones: “Son estimaciones, no conteos exactos. La longitud de oraciones y párrafos varía, y otros idiomas pueden tener relaciones distintas entre caracteres, palabras y tokens”.
Fíjate en que los dos números no coinciden —4 frente a 3,5— y que ninguno está mal. Cada familia de modelos tiene su propio tokenizador. El mismo texto no tiene un único conteo de tokens.
Si quieres el número de tu propio texto sin escribir código, la calculadora de tokens de yoDEV lo cuenta y estima el costo en los modelos actuales de OpenAI y Anthropic. El conteo se hace en tu navegador: lo que pegues no sale de tu equipo.
¿Qué es un tokenizador y por qué cambia la cuenta?
El tokenizador es el componente que decide dónde se corta tu texto, y cada familia de modelos usa el suyo.
Su lógica es económica. Anthropic explica el compromiso sin rodeos: “Los tokens más grandes permiten eficiencia de datos durante la inferencia y el preentrenamiento (y se usan cuando es posible), mientras que los tokens más pequeños permiten al modelo manejar palabras poco comunes o nunca vistas”. Es decir: divide las secuencias frecuentes en trozos grandes y las raras en pedazos pequeños.
De ahí sale la regla que más te conviene interiorizar. Una palabra común suele ser un token. Un nombre propio inusual, un identificador largo de tu código o un blob en base64 pueden ser muchos. El texto predecible es barato; el texto raro es caro.
¿El español gasta más tokens que el inglés?
Menos de lo que imaginas, y vale la pena corregir esta idea.
Existe un fenómeno real por el cual los idiomas mal servidos por un tokenizador se parten en muchos más tokens para decir lo mismo, y pagan más por ello. Pero la tabla por idioma que publicó OpenAI ubica al español en el extremo eficiente. Al introducir el tokenizador de la familia GPT-4o, el español pasó de 29 tokens a 26 en su oración de muestra: una mejora de 1,1×. El gujarati mejoró 4,4× y el telugu 3,5×.
Conviene leer eso al derecho. Una mejora pequeña significa que el español tenía poco que ganar, porque ya se tokenizaba razonablemente bien. Los idiomas que ganaron muchísimo son los que venían siendo penalizados de forma severa. El español comparte alfabeto y buena parte de su estructura de subpalabras con el inglés, así que nunca estuvo en esa categoría.
Lo que sí te cuesta de más es todo aquello que el tokenizador encuentra inusual: identificadores de código, cadenas técnicas, y texto que mezcla idiomas a mitad de una frase.
¿Por qué el mismo texto cuesta más que antes?
Porque los tokenizadores cambian entre generaciones de modelos, y el tuyo pudo haber cambiado sin que te enteraras.
La documentación de Anthropic describe el tokenizador que estrenó Claude Opus 4.7 como uno que “produce aproximadamente un 30 por ciento más de tokens que los modelos anteriores para el mismo texto de entrada”. Ese mismo tokenizador lo comparten Opus 4.8 y la familia Fable 5. El aumento real depende del texto: es un rango que llega a cerca de 1,35 veces el conteo anterior, no una cifra fija.
Conviene leer el alcance con cuidado, porque “de 4.7 en adelante” no equivale a “todos los modelos recientes”. Sonnet 5 y Haiku 4.5 siguen usando el tokenizador anterior. Si tu carga corre sobre alguno de esos dos, no hay nada que recalcular.
Si presupuestaste una carga de trabajo sobre Opus 4.6 o un modelo anterior y después migraste a Opus 4.7, a Opus 4.8 o a Fable 5, tu estimación puede quedarse corta hasta en un tercio antes de que entre ninguna otra variable. Vuelve a medir después de cualquier cambio de modelo. Este es exactamente el tipo de dato que conviene verificar contra la documentación del proveedor en el momento de planificar, en vez de arrastrar un número del año pasado.
¿Cómo contar tokens antes de pagarlos?
Anthropic expone un endpoint de conteo de tokens y su uso es gratuito, sujeto solo a límites de peticiones por minuto: desde 5.000 por minuto en el nivel Start hasta 20.000 en Scale. Devuelve la cuenta y nada más:
{ "input_tokens": 14 }
Cuenta el request real, no una aproximación: los mensajes con herramientas adjuntas devuelven una cifra mayor —el ejemplo de su documentación devuelve 403— y los mensajes con una imagen, más todavía: 1.028 en su ejemplo. Su documentación aclara además que “no se te cobra por los tokens que agrega el sistema. La facturación refleja solo tu contenido”.
Si estás dimensionando una carga de trabajo, medir le gana a estimar. Una regla práctica no tiene idea de lo que contienen tus prompts.
¿Qué es la ventana de contexto?
La ventana de contexto es el techo de cuántos tokens puede considerar el modelo a la vez. Anthropic la describe como “una ‘memoria de trabajo’ para el modelo”, distinta del corpus con el que fue entrenado.
Costo y contexto son dos restricciones distintas sobre el mismo número. La ventana te dice cuándo un request va a fallar; el precio te dice cuánto cuesta cuando funciona. Una conversación larga se topa con el segundo problema mucho antes que con el primero.
¿Dónde se va realmente el gasto?
Casi nunca donde uno mira primero. El prompt que escribiste rara vez es la parte cara.
Las partes caras son las que no redactaste tú: el historial de la conversación reenviado en cada turno, el system prompt y las definiciones de herramientas adjuntas a cada request, los archivos que un agente cargó al contexto, los reintentos. En yoDEV cubrimos cada una por separado:
- Headroom: cómo cortar hasta 95% de tus tokens sin cambiar las respuestas
- Tu caché de 5 minutos no dura 5 minutos: qué arregla realmente promptCacheTtl
- Cursor ahora rutea cada request automáticamente
- 3,5× menos tokens y el mismo score: Toast 1 se queda con todo el loop de búsqueda de tu agente
- Agentmemory: memoria persistente para Claude Code — 92% menos tokens
- Cómo usar Headroom con LiteLLM para gastar menos tokens — el caso del router que te cobra dos llamadas por request
Todas se reducen a la misma aritmética. Mide primero, con el endpoint gratuito, sobre tu tráfico real. Después decide cuál de esas palancas vale la pena mover.