Claude Sonnet 5 admite 1M de tokens, pero el mismo texto cuesta más espacio

Migrar de Claude Sonnet 4.6 a Claude Sonnet 5 no consiste únicamente en cambiar el identificador a claude-sonnet-5. Antes del despliegue hay que contar de nuevo las solicitudes, recalcular el coste, revisar max_tokens y retirar configuraciones que el modelo nuevo rechaza.
Sonnet 5 admite un millón de tokens de contexto y hasta 128.000 de salida, pero el mismo texto genera aproximadamente un 30% más de tokens que en Sonnet 4.6. La guía oficial de migración también precisa que no ofrece Priority Tier, activa el pensamiento adaptativo de forma predeterminada y devuelve errores 400 con el pensamiento manual o parámetros de muestreo no predeterminados.
La ventana crece, pero cada texto ocupa más
El millón de tokens es tanto el contexto predeterminado como el máximo de Sonnet 5. Sin embargo, el cambio de tokenizador significa que cada token representa menos texto en promedio: la capacidad nominal aumenta, pero no puede compararse directamente con un millón de tokens medidos por Sonnet 4.6.
Como ejemplo condicional, una entrada que ocupaba 500.000 tokens podría acercarse a 650.000 si registra exactamente el incremento aproximado del 30%. Bajo esa misma hipótesis, el nuevo límite alojaría un volumen de texto equivalente a unos 769.000 tokens del recuento anterior. Son conversiones útiles para dimensionar el riesgo, no constantes que deban incorporarse al código, porque la diferencia depende del contenido.
El efecto puede aparecer sin llegar al máximo. El historial, el prompt de sistema, las definiciones de herramientas y los documentos comparten el presupuesto de entrada; además, la aplicación necesita reservar capacidad para la salida. Un flujo que truncaba o enrutaba solicitudes según recuentos de Sonnet 4.6 puede tomar decisiones incorrectas aunque su contenido no haya cambiado.
Cuente la solicitud completa con ambos modelos
No aplique automáticamente un multiplicador de 1,3 a todo el tráfico. La API de recuento de tokens acepta la estructura de una solicitud de Messages, incluidos el prompt de sistema, los mensajes, las herramientas, las imágenes y los PDF; el resultado es una estimación previa que puede diferir ligeramente del uso final.
- Seleccione una muestra que incluya conversaciones cortas, documentos extensos, llamadas con herramientas y los idiomas habituales de producción.
- Cuente cada solicitud sin modificar su contenido, primero con claude-sonnet-4-6 y después con claude-sonnet-5.
- Registre la variación por tipo de carga. Los casos cercanos al límite importan más que el promedio global.
- Vuelva a ejecutar las reglas de truncamiento, compactación y selección de modelo con los recuentos de Sonnet 5.
- Durante el piloto, compare la estimación previa con usage.input_tokens y supervise las respuestas cuyo stop_reason sea max_tokens.
La muestra debe conservar código, JSON, nombres propios, texto multilingüe y definiciones de herramientas reales. Si solo contiene preguntas breves, puede ocultar el impacto sobre los agentes y las cargas documentales que concentran el mayor consumo.
Calcule el coste antes y después de la promoción
Anthropic lanzó Sonnet 5 el 30 de junio de 2026 con un precio introductorio de 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida hasta el 31 de agosto. A partir del 1 de septiembre, las tarifas serán de 3 y 15 dólares, respectivamente; el anuncio de Anthropic añade que una misma entrada puede ocupar entre aproximadamente 1 y 1,35 veces más tokens, según el contenido.
El cálculo debe usar los tokens medidos con Sonnet 5, no el tamaño del texto ni los registros históricos del modelo anterior. Separe entrada y salida, y aplique también las condiciones de caché o procesamiento por lotes que correspondan a su plataforma.
En el ejemplo condicional anterior, 650.000 tokens de entrada costarían 1,30 dólares durante la promoción y 1,95 dólares con la tarifa posterior. Los 500.000 tokens de Sonnet 4.6 costaban 1,50 dólares con la tarifa estándar de 3 dólares. La promoción puede compensar temporalmente el recuento mayor, pero después el mismo contenido puede resultar más caro aunque la tarifa estándar por token sea igual para ambos modelos.
Repita el presupuesto con la distribución real de las salidas. max_tokens limita el total formado por el razonamiento y la respuesta, de modo que un valor ajustado para Sonnet 4.6 sin pensamiento puede truncar el texto final cuando Sonnet 5 use pensamiento adaptativo.
Retire las configuraciones que provocan errores 400
El pensamiento extendido manual con thinking: enabled y budget_tokens ya no es compatible. Sustitúyalo por thinking: adaptive y, si necesita regular la intensidad, use output_config.effort. Cuando la carga no requiera razonamiento, puede enviar thinking: disabled.
También debe eliminar los valores no predeterminados de temperature, top_p y top_k. Omitir esos campos o conservar sus valores predeterminados es aceptado; trasladar una configuración personalizada desde Sonnet 4.6 produce un error 400. Si el comportamiento dependía de esos controles, exprese los requisitos de tono, formato o extensión en el prompt de sistema y vuelva a evaluarlos.
Revise además max_tokens aunque la solicitud no falle. Si aparece stop_reason: max_tokens, determine si el razonamiento consumió el margen reservado para la respuesta antes de aumentar el límite o reducir el nivel de esfuerzo.
Lista de comprobación para el despliegue
- Cambie el identificador a claude-sonnet-5 primero en un entorno de prueba.
- Confirme que la arquitectura no dependa de Priority Tier.
- Cuente las entradas completas con ambos modelos y actualice los umbrales de contexto, compactación y enrutamiento.
- Recalcule entrada y salida con la tarifa introductoria y con la estándar.
- Retire budget_tokens y el pensamiento manual; configure pensamiento adaptativo o desactívelo explícitamente.
- Elimine los valores no predeterminados de temperature, top_p y top_k.
- Pruebe errores 400, truncamientos, latencia, calidad y consumo facturable con tráfico representativo.
La forma general de las solicitudes, las respuestas y los eventos de streaming se conserva, por lo que el cambio puede parecer directo. La migración solo es equivalente en la práctica después de medir el nuevo recuento y validar los parámetros: esos ajustes determinan cuánto contexto útil queda, cuánto cuesta cada carga y si la API acepta la solicitud.
Lee también:
Suscríbete a nuestro boletín
Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.