Downgrades silenciosos de modelo y modelos de costes
Actualizado September 27, 2026 · publicado originalmente September 27, 2026
El 23 de septiembre de 2026, un hilo de r/GroundTruthAINews señaló una nota al pie enterrada en las notas de lanzamiento de Opus 5.5 de Anthropic: una solicitud a Opus 5.5 puede ser atendida por Opus 4.8. Anthropic y OpenAI publicaron recortes de precio la misma tarde. Ambos laboratorios vendieron la misma idea: mantener la capacidad y gastar mucho menos. La nota al pie es lo que importa a FinOps.
Qué pasó en realidad
Claude Opus 5.5 se lanzó a $4/$20 por millón de tokens, aproximadamente un 20% por debajo de Opus 5, con las lecturas de caché reducidas un 60% hasta $0.20. Anthropic dice que menos tokens por tarea y una salida un 30% más rápida hacen que las cargas típicas cuesten alrededor de un 40% menos. Unos 90 minutos después, OpenAI lanzó GPT-6 Sol a $2/$10 y Luna a $0.10/$0.50, ambos a la mitad de los precios de GPT-5.6.
Todas las entradas de lanzamiento de este periodo llevan el mismo tipo de nota al pie: el endpoint que llamas es un alias, y el alias se reparte la carga entre versiones del modelo durante una ventana de transición. Es una práctica normal de capacidad. También es un problema para el modelado de costes.
Por qué rompe los números
- El coste por tarea se desvía. Tu previsión asumía el precio de salida de Opus 5.5. Si una parte de las llamadas cae en 4.8, cambian tanto el precio unitario como el número de tokens, en sentidos opuestos.
- Las evaluaciones miden una mezcla. Una suite de evaluación ejecutada durante una ventana de transición puntúa una combinación de versiones. La puntuación no se puede reproducir más adelante.
- Los recortes de precio se atribuyen mal. Si un ahorro del 40% aparece como un 15%, la diferencia suele deberse a la mezcla de versiones, no a una optimización rota.
- Las referencias de latencia quedan obsoletas. 4.8 no es tan rápido como 5.5. Cualquier p50 que midieras a mitad de transición no es tu p50 en régimen estable.
Cómo detectar el cambio
Todos los grandes proveedores devuelven el modelo resuelto en el cuerpo de la respuesta. Regístralo. Un campo, cuatro líneas de código:
resolved = response.model # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKSDespués divide cada métrica de coste por modelo resuelto, no por el modelo que pediste. En cuanto un grupo empiece a desviarse, tendrás la respuesta: el alias está mezclando versiones y tu coste por tarea es un promedio ponderado de dos productos distintos.
La implicación presupuestaria
Durante una transición, planifica con el coste combinado, no con el titular. Si el 20% de las llamadas pasa a un modelo anterior, tu tarifa efectiva de entrada no es $4.00 por millón — es la que resulte de la mezcla. La misma lógica vale para el ahorro anunciado: lo de «un 40% más barato» es un promedio de carga típica que ya asume una reducción del número de tokens, algo que puede no cumplirse si el modelo más barato pero más antiguo es el que genera las respuestas más largas.
Reglas a mantener
- Nunca modeles sobre un alias. Fija un ID de modelo con fecha para todo lo que presupuestes o evalúes.
- Registra el modelo resuelto en cada solicitud. Es innegociable si alguna vez vuelves a ejecutar una evaluación.
- Vuelve a fijar la línea base tras la ventana de transición. Lo habitual son semanas, no trimestres, pero compruébalo.
- Valora una transición como una mezcla. Pide a tu proveedor el reparto esperado, o mídelo.
Conclusión
Un recorte de precio y un downgrade silencioso pueden llegar la misma tarde. El recorte es el titular; el downgrade es la nota al pie que invalida en silencio la previsión del mes pasado. Registra el modelo resuelto, fija IDs con fecha y valora la mezcla.
Relacionado
- Modelo de costes de Claude Opus 5.5
- Precios de GPT-6: Sol, Luna, Astra
- Recortes de precio de modelos y presupuestos de enrutamiento
- Los precios de los proveedores no son comparables
- Control de costes de las evaluaciones
¿Quieres aplicar esto a tu plataforma? Comparte las facturas, los registros de la pasarela y los flujos principales; identificaremos los costes y las oportunidades de ahorro. Solicitar auditoría gratuita →