Tokenizador

Un tokenizador divide el texto en los tokens que lee y factura un modelo; por eso un mismo texto puede producir recuentos distintos en dos modelos.

La mayoría de tokenizadores modernos se construyen a partir de datos. Las secuencias frecuentes pueden ser un solo token; los identificadores raros, formatos poco habituales y muchas escrituras no latinas se dividen en varios. El vocabulario se fija durante el entrenamiento, de modo que un recuento solo tiene sentido junto al modelo que lo produjo.

Los tokenizadores cambian entre generaciones. Según Anthropic, a septiembre de 2026 los modelos Claude 4.7 y posteriores producen aproximadamente un 30 % más de tokens para el mismo texto que Sonnet 4.6 y anteriores, según el contenido. Opus 4.6 y Opus 4.7 tienen el mismo precio por token, pero el mismo prompt puede costar más en el segundo solo por esa diferencia.

Los recuentos de un modelo no se trasladan sin más a otro: hay que recalcular presupuestos, ocupación de la ventana y previsiones de coste tras un cambio. Tampoco se pueden comparar precios por token sin considerar cuánto texto cubre cada uno. La regla de cuatro caracteres por token es una media de prosa inglesa, no un método para contar código.

El recuento exacto lo ofrece el proveedor. El endpoint de Anthropic para contar tokens estima la entrada de una petición con el tokenizador del modelo indicado, sin coste pero con límite de frecuencia. La documentación advierte de pequeñas diferencias respecto a la cifra facturada.

← Todos los términos