Economía de Opus 5.5 fast mode
Updated September 22, 2026 · first published September 22, 2026
Claude Opus 5.5 tiene dos listas de precios. La estándar es $4 por millón de tokens de entrada y $20 por millón de salida. Fast mode es $8 y $40, exactamente el doble, para hasta 2,5× la velocidad de salida. El modelo es el mismo. El dinero extra compra tiempo y nada más, así que la única pregunta es de quién.
Qué compra el premium
Toma un paso que produce 5.000 tokens de salida. A tasas estándar el coste es $0,10. En fast mode cuesta $0,20. Si el paso tarda 60 segundos a velocidad estándar, una aceleración de 2,5× lo trae a unos 24 segundos. Pagas $0,10 extra para ahorrar 36 segundos.
Eso resulta en unos $10 por cada hora de espera eliminada. La longitud del paso no cambia el ratio, porque el coste extra y el tiempo ahorrado crecen con los tokens de salida. Depende de tu velocidad en modo estándar: este ejemplo asume unos 83 tokens de salida por segundo, así que calcula la tuya. La entrada también se duplica, así que los pasos con mucho prefijo pagan un poco más por segundo ahorrado.
Cuándo es barato
- Un desarrollador esperando a un agente de codificación interactivo. A $10 por hora de espera eliminada, fast mode cuesta mucho menos que el tiempo de cualquiera pagado.
- Una respuesta cara al cliente donde la latencia afecta la conversión. Compara la aceleración contra el abandono, no contra la factura de tokens.
- Un incidente, donde cada minuto tiene un coste.
Cuándo es puro desperdicio
- Agentes en background, trabajos nocturnos y tuberías batch. Nadie espera, así que el gasto extra no compra nada.
- Evals y replays. Son exactamente las cargas de trabajo que multiplican recuentos de tokens y se ejecutan en un cronograma.
- Subagentes que se ejecutan en paralelo. El tiempo de reloj se establece por la rama más lenta y el orquestador, no por cada llamada.
Opus 5.5 estándar ya es aproximadamente 30% más rápido que Opus 5, según Anthropic. Algunas quejas de latencia que habrían justificado fast mode en Opus 5 pueden resolverse solo con la actualización. Mide la velocidad estándar antes de pagar por más.
Controles a poner en su lugar
- Haz que fast mode sea una decisión explícita y por ruta. Nunca debe ser un valor global por defecto o una bandera que un ingeniero activó una vez y olvidó.
- Etiqueta el gasto por modo. Una solicitud de fast mode a doble precio por unidad se ve como una solicitud normal en un panel que agrupa solo por modelo.
- Alerta sobre la fracción de fast mode de tokens de salida. Si sube en rutas donde ningún usuario espera, algo fue activado que no debería haber sido.
- Presupuesta esfuerzo y velocidad juntos. Max effort multiplica el recuento de tokens, y fast mode duplica el precio de cada token. La combinación es la forma más cara de ejecutar el modelo.
Related
- Modelo de coste de Claude Opus 5.5
- Los niveles de esfuerzo de Opus 5.5 son el precio real
- Límites de fan-out y concurrencia de subagentes
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →