Saltar al contenido

Claude Haiku 5.5 y el umbral de precio de 100k tokens

Actualizado October 8, 2026 · publicado originalmente October 8, 2026

Respuesta rápida: El precio de referencia de Claude Haiku 5.5 depende de la longitud del prompt. Anthropic lanzó el modelo el 7 de octubre de 2026 para trabajo de alto volumen, como clasificación, resúmenes y tareas de...

El precio de referencia de Claude Haiku 5.5 depende de la longitud del prompt. Anthropic lanzó el modelo el 7 de octubre de 2026 para trabajo de alto volumen, como clasificación, resúmenes y tareas de subagentes. Su ventana de contexto de 1 millón de tokens no garantiza que todos esos tokens cuesten la tarifa de los prompts cortos: un prompt de más de 100,000 tokens usa un nivel de precio más alto. Por eso el tamaño de cada solicitud es una decisión presupuestaria, sobre todo en agentes que acumulan documentos y resultados de herramientas.

La tarifa tiene dos caras

Los siguientes son los precios estándar publicados por Anthropic para la API de Claude, en dólares estadounidenses por millón de tokens, consultados el 8 de octubre. El límite es hasta 100,000 tokens de prompt frente a más de 100,000; no es un precio que se aplique solo a los tokens que exceden el umbral. Consulte la documentación de precios vigente antes de usar las cifras en una previsión.

Categoría de tokenPrompt de hasta 100kPrompt de más de 100k
Entrada sin caché$0.10$0.50
Salida$0.50$2.50
Escritura en caché de 5 minutos$0.125$0.625
Escritura en caché de 1 hora$0.20$1.00
Lectura de caché$0.01$0.05

Cada tarifa por token indicada es cinco veces mayor por encima del límite. Eso no significa que toda la factura de una aplicación se multiplique por cinco: muchas llamadas pueden seguir siendo cortas, y el volumen de salida, el uso de caché, las herramientas, el procesamiento por lotes, los reintentos y el éxito de las tareas afectan al gasto total. El contexto en caché sigue ocupando el prompt; un acierto de caché no convierte una solicitud de 120k tokens en un prompt corto.

Cómo se ve el límite en una sola solicitud

Considere dos llamadas ilustrativas sin caché ni herramientas facturadas por separado, cada una con 1,000 tokens de salida. Un prompt de 99,000 tokens cuesta aproximadamente $0.0104 en entrada más salida con las tarifas de prompt corto. Un prompt de 101,000 tokens cuesta aproximadamente $0.0530 con las tarifas de prompt largo. Es casi cinco veces más por una solicitud que solo tiene 2,000 tokens de entrada adicionales. El ejemplo mantiene fija la salida para aislar el límite de precios; no es un ahorro medido en producción. Los prompts reales también incluyen instrucciones de sistema, historial de conversación, esquemas de herramientas y resultados de herramientas.

Recuente antes de migrar

Las notas de migración de Anthropic indican que el mismo texto produce aproximadamente un 30% más de tokens en Haiku 5.5 que en Haiku 4.5, con variaciones según el contenido. Un prompt que parecía holgadamente por debajo de 100k con los recuentos antiguos puede cruzar el nuevo límite. No multiplique todos los recuentos antiguos por 1.3 para usarlo como previsión de factura; recuente solicitudes representativas con claude-haiku-5-5.

El endpoint de conteo de tokens de Anthropic acepta el mensaje estructurado, el prompt de sistema y las herramientas de cliente compatibles antes de enviar la solicitud de generación. Cuente con el modelo de destino y luego registre el uso real tras la respuesta. El recuento previo es una estimación y puede diferir ligeramente de la entrada facturada; el contador no admite algunas herramientas de servidor ni bloques de URL o archivo. En esos casos, apóyese en el uso observado de las solicitudes y deje un margen de seguridad cerca del umbral.

Una regla de presupuesto de prompts para subagentes

  1. Mida la distribución. Registre los recuentos de tokens de prompt de Haiku 5.5 por carga de trabajo, ID de modelo y resultado de la tarea. Observe cuántas llamadas se agrupan cerca de 100k o lo superan, en lugar de mirar solo el promedio.
  2. Avise antes del límite. Marque las solicitudes cercanas al umbral en el orquestador de agentes. Trate el nivel de aviso como su propio margen operativo, no como una regla de precios de Anthropic.
  3. Recorte la causa. Elimine fragmentos de recuperación duplicados, limite el tamaño de los resultados de herramientas o compacte el historial obsoleto donde las pruebas de calidad lo permitan. No descarte evidencia que un agente necesite solo para ahorrar tokens.
  4. Compare la cola larga. Para los prompts largos inevitables, pruebe Haiku en su nivel más alto frente a otra ruta con las mismas tareas. Compare el coste por resultado aceptado, la latencia y la frecuencia de respaldo, no solo los precios de lista.
  5. Concilie con la factura. Calcule el precio de la entrada, la salida y las lecturas y escrituras de caché reales en el nivel que corresponda, e incluya después las herramientas y los reintentos. Revise las tarifas del proveedor o de la plataforma en la nube y los descuentos contractuales.

Haiku 5.5 puede seguir siendo la mejor opción por encima de 100k, pero debe ser una decisión de enrutamiento medida. El control importante es saber qué solicitudes cruzan la línea y por qué.

Preguntas que se hacen los equipos

¿El precio más alto se aplica solo a los tokens por encima de 100k?

No. Anthropic describe Haiku 5.5 como un modelo con precio según la longitud del prompt: un prompt de más de 100,000 tokens paga las tarifas publicadas más altas por esa solicitud.

¿Puede el almacenamiento en caché mantener una solicitud larga en el nivel más barato?

No. Los tokens reutilizados pueden recibir una tarifa de lectura de caché, pero el contexto en caché sigue ocupando la longitud del prompt. Cuente el prompt completo al comprobar el umbral.

¿Está garantizado un aumento del 30% por el tokenizador?

No. Anthropic indica aproximadamente un 30% más de tokens para el mismo texto que en Haiku 4.5, según el contenido. Cuente sus propios prompts en el modelo de destino.

Relacionado


¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →

Volver a finopsllm.com