Saltar al contenido

Downgrades silenciosos de modelo y modelos de costes

Actualizado September 27, 2026 · publicado originalmente September 27, 2026

El 23 de septiembre de 2026, un hilo de r/GroundTruthAINews señaló una nota al pie enterrada en las notas de lanzamiento de Opus 5.5 de Anthropic: una solicitud a Opus 5.5 puede ser atendida por Opus 4.8. Anthropic y OpenAI publicaron recortes de precio la misma tarde. Ambos laboratorios vendieron la misma idea: mantener la capacidad y gastar mucho menos. La nota al pie es lo que importa a FinOps.

Qué pasó en realidad

Claude Opus 5.5 se lanzó a $4/$20 por millón de tokens, aproximadamente un 20% por debajo de Opus 5, con las lecturas de caché reducidas un 60% hasta $0.20. Anthropic dice que menos tokens por tarea y una salida un 30% más rápida hacen que las cargas típicas cuesten alrededor de un 40% menos. Unos 90 minutos después, OpenAI lanzó GPT-6 Sol a $2/$10 y Luna a $0.10/$0.50, ambos a la mitad de los precios de GPT-5.6.

Todas las entradas de lanzamiento de este periodo llevan el mismo tipo de nota al pie: el endpoint que llamas es un alias, y el alias se reparte la carga entre versiones del modelo durante una ventana de transición. Es una práctica normal de capacidad. También es un problema para el modelado de costes.

Por qué rompe los números

Cómo detectar el cambio

Todos los grandes proveedores devuelven el modelo resuelto en el cuerpo de la respuesta. Regístralo. Un campo, cuatro líneas de código:

resolved = response.model  # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS

Después divide cada métrica de coste por modelo resuelto, no por el modelo que pediste. En cuanto un grupo empiece a desviarse, tendrás la respuesta: el alias está mezclando versiones y tu coste por tarea es un promedio ponderado de dos productos distintos.

La implicación presupuestaria

Durante una transición, planifica con el coste combinado, no con el titular. Si el 20% de las llamadas pasa a un modelo anterior, tu tarifa efectiva de entrada no es $4.00 por millón — es la que resulte de la mezcla. La misma lógica vale para el ahorro anunciado: lo de «un 40% más barato» es un promedio de carga típica que ya asume una reducción del número de tokens, algo que puede no cumplirse si el modelo más barato pero más antiguo es el que genera las respuestas más largas.

Reglas a mantener

  1. Nunca modeles sobre un alias. Fija un ID de modelo con fecha para todo lo que presupuestes o evalúes.
  2. Registra el modelo resuelto en cada solicitud. Es innegociable si alguna vez vuelves a ejecutar una evaluación.
  3. Vuelve a fijar la línea base tras la ventana de transición. Lo habitual son semanas, no trimestres, pero compruébalo.
  4. Valora una transición como una mezcla. Pide a tu proveedor el reparto esperado, o mídelo.

Conclusión

Un recorte de precio y un downgrade silencioso pueden llegar la misma tarde. El recorte es el titular; el downgrade es la nota al pie que invalida en silencio la previsión del mes pasado. Registra el modelo resuelto, fija IDs con fecha y valora la mezcla.

Relacionado


¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →

Volver a finopsllm.com