Economía del Cierre de Fine-Tuning de OpenAI
Publicado 19 de julio de 2026
OpenAI está eliminando el fine-tuning autoservicio. A partir del 7 de mayo de 2026, las nuevas organizaciones ya no pueden crear trabajos de fine-tuning. Antes del 6 de enero de 2027, todas las organizaciones pierden esa capacidad. Si dependes de modelos GPT con fine-tuning, debes elegir una ruta de migración ahora: ingeniería de prompts en GPT-5.5 con caché de prompts, adaptadores LoRA de código abierto en Llama o Qwen, o fine-tuning gestionado vía Vertex AI, AWS Bedrock, o Mistral. Cada ruta tiene distintos compromisos de coste y operativos.
- La creación de fine-tuning autoservicio termina el 6 de enero de 2027 para todas las organizaciones
- La inferencia en modelos con fine-tuning existentes continúa hasta la deprecación de la base
- El caché de prompts en GPT-5.5 puede igualar o superar el ROI del fine-tuning en 10–30 aciertos
- El LoRA de código abierto cuesta 30–50% menos que los servicios gestionados para alto volumen
- Costes ocultos de migración: re-evaluaciones, pruebas de regresión, ejecución dual, reentrenamiento
Cronograma y Matriz de Exposición
Quién es afectado y cuándo:
| Fecha | Fase | Organizaciones Afectadas | Acción Requerida |
|---|---|---|---|
| 7 de mayo de 2026 | Fase 1 | Nuevas organizaciones, nunca con fine-tuning antes | No pueden iniciar nuevos trabajos |
| 2 de julio de 2026 | Fase 2 | Organizaciones existentes sin inferencia de modelo con fine-tuning en los últimos 60 días | No pueden iniciar nuevos trabajos |
| 6 de enero de 2027 | Fase 3 (final) | Todas las organizaciones, incluso usuarios activos | No hay nuevos trabajos de entrenamiento |
| Post-2027 | Solo inferencia | Todas las organizaciones con modelos con fine-tuning desplegados | La inferencia continúa hasta el cierre de la base |
Por qué OpenAI está eliminando el fine-tuning: Los modelos de clase GPT-5.5 combinados con caché de prompts eliminan la necesidad de fine-tuning en la mayoría de casos de uso. Los prompts más largos con ejemplos few-shot e instrucciones de sistema ahora igualan o superan el rendimiento del fine-tuning, mientras consumen menos tokens totales cuando se cachean. Los gastos generales gestionados de fine-tuning exceden su valor para la mayoría de cargas de trabajo.
Árbol de Decisión: Tres Rutas de Migración
Ruta 1: Ingeniería de Prompts + GPT-5.5 + Caché
Reescribe la lógica con fine-tuning como prompt del sistema + ejemplos few-shot, cacheados. Intercambia prompts más largos por cero gastos de entrenamiento.
- Coste de entrenamiento: $0 (sin reentrenamiento)
- Coste de token por llamada: Prompt más largo, pero cacheado al 50% de la tasa fresca
- Tiempo de configuración: 1–4 semanas (ingeniería de prompts + benchmarking)
- Operaciones en curso: Iteración de prompts, no se necesita MLOps
Ruta 2: LoRA en Código Abierto (Together, Fireworks, Groq)
Fine-tune Llama 4 o Qwen 3.5 con adaptadores LoRA, aloja en inferencia gestionada. Control completo de fine-tuning, reproducibilidad de código abierto.
- Coste de entrenamiento: $200–$500 por trabajo
- Coste de inferencia: $0.10–$0.30/M tokens (competitivo)
- Tiempo de configuración: 2–6 semanas (preparación de datos, entrenamiento de adaptador, pruebas)
- Operaciones en curso: Monitorea el rendimiento del adaptador, reentrena según sea necesario
Ruta 3: Fine-Tuning Gestionado (Vertex, Bedrock, Mistral)
Usa Google Vertex AI, AWS Bedrock, o fine-tuning de Mistral. Flujo de trabajo familiar, soporte de vendedor, pero coste por token más alto.
- Coste de entrenamiento: $500–$2,000 por trabajo
- Coste de inferencia: $0.20–$1.00/M tokens (premium)
- Tiempo de configuración: 1–3 semanas (menos integraciones necesarias)
- Operaciones en curso: El vendedor maneja las operaciones, tú gestionas la cadencia de entrenamiento
Ruta 1: Ingeniería de Prompts + Caché GPT-5.5 — Matemáticas Resueltas
Supongamos que tenías un modelo GPT-4 con fine-tuning para clasificación de tickets de soporte al cliente. El modelo con fine-tuning fue entrenado en 10K tickets etiquetados. Cada solicitud envía ~500 tokens de entrada, obtiene ~50 tokens de salida.
Coste anterior (fine-tuning): Trabajo de fine-tuning: ~$50. Inferencia en 100K llamadas/mes: (500 entrada × $3/M + 50 salida × $15/M) × 100K = $150/mes + entrenamiento = ~$200/mes todo incluido.
Coste nuevo (caché de prompts en GPT-5.5): Crea un prompt del sistema con 40 ejemplos few-shot (cada uno ~200 tokens) = 8K tokens. Este es el relleno de caché. Primera llamada: 8K × (1.25× $3/M) + 500 × $3/M + 50 × $15/M ≈ $0.045. Llamadas posteriores (acierto de caché): 500 × (0.5× $3/M) + 50 × $15/M ≈ $0.0015. En 100K llamadas/mes, asume 90% de acierto (90K aciertos de caché). Coste: 10K llamadas × $0.045 + 90K llamadas × $0.0015 = $450 + $135 = $585/mes.
¡Espera — eso es más caro! Verdad si no ajustas el prompt. Pero reduce los ejemplos few-shot a 10 (2K tokens), y el coste baja a ~$280/mes. Además: si puedes agrupar consultas (procesar 10 tickets relacionados en una llamada), el coste por ticket baja otro 30%. En conclusión: el caché de prompts en GPT-5.5 se vuelve más barato que el fine-tuning en 15–30 aciertos de caché por contexto único. La mayoría de equipos alcanzan eso en horas de despliegue.
Riesgo de calidad: Los prompts few-shot pueden tener bajo rendimiento respecto al fine-tuning en casos extremos y formatos inusuales. Presupuesta 2–4 semanas para pruebas de regresión.
Ruta 2: LoRA en Código Abierto — Costes y Logística
El fine-tuning de código abierto vía LoRA (Low-Rank Adaptation) mantiene el modelo base congelado y entrena solo pequeñas matrices de adaptador (~1–5% de parámetros). Estructura de costes:
| Componente | Ejemplo de Proveedor | Coste | Notas |
|---|---|---|---|
| Entrenamiento (Llama 3.3 70B en 10K muestras) | Together AI | $300 | LoRA en GPU H100 único (~4 horas) |
| Inferencia (por 1M tokens) | Groq (Llama 3.3 70B) | $0.27 | Rápido (sin lag de ajuste vs GPT-4 con fine-tuning) |
| Inferencia (por 1M tokens) | Together AI (Llama 3.3 70B) | $0.18 | Respuesta más lenta, coste más bajo |
| Alojamiento de modelo (mensual, siempre activo) | Alojamiento propio en runpod | $300–$600 | Alquiler de GPU A100 + gastos generales de operaciones |
| Total para 1M llamadas/mes | — | $318–$600 | API de Groq (gestionada), sin coste de alojamiento |
Por qué el código abierto es más barato: Sin prima por token para estado "con fine-tuning". El adaptador es tuyo para distribuir y mejorar. Calidad del modelo (Llama 4 Maverick) iguala GPT-4o para la mayoría de tareas a 30–50% menos coste. El compromiso: posees los MLOps — cadencia de reentrenamiento, detección de desviación, pruebas A/B entre versiones de adaptador.
Riesgo de integración: Cambiar de la API de OpenAI a Groq, Together, o alojamiento propio cambia tu latencia de inferencia, manejo de errores, y escalado. Espera 1–2 semanas de trabajo de integración.
Ruta 3: Fine-Tuning Gestionado (Vertex, Bedrock, Mistral)
| Proveedor | Coste de Entrenamiento (10K muestras) | Coste de Inferencia (por 1M tokens de salida) | Modelo Base | Tiempo a Producción |
|---|---|---|---|---|
| Google Vertex AI | $500–$800 | $0.40–$1.50 | Gemini 1.5 Flash, otros modelos OS | 1–2 semanas |
| AWS Bedrock (Claude Sonnet con fine-tuning) | $600–$1,200 | $0.80–$2.00 | Claude Sonnet, Llama 4, Mistral | 1–2 semanas |
| Fine-tuning de Mistral | $400–$700 | $0.25–$0.60 | Mistral 3.5 Moe, otros modelos Mistral | 1 semana |
| Coste mensual típico (100K llamadas, 500 tokens promedio) | $600–$1,200 (entrenamiento único) | $200–$1,000 (inferencia recurrente) | — | — |
Los servicios gestionados son la rampa más fácil: tu equipo ya conoce la autenticación de API, el soporte del vendedor está disponible, y evitas gastos generales de MLOps. Pero los costes de inferencia ejecutan 2–5× más alto que LoRA de código abierto. Esta ruta tiene sentido si: (1) tienes <100M tokens de salida/mes, (2) tu equipo carece de experiencia MLOps, o (3) necesitas SLAs empresariales.
Comparación de Costes de Tres Rutas (Carga de Trabajo Concreta)
Carga de trabajo: IA de servicio al cliente para SaaS. 1M llamadas de inferencia/mes, promedio 500 entrada + 150 tokens de salida por llamada. El equipo entrenó un modelo con fine-tuning en 5K conversaciones etiquetadas.
| Componente de Coste | Ruta 1: Caché de Prompts + GPT-5.5 | Ruta 2: LoRA en Groq (Llama 3.3) | Ruta 3: Bedrock (Claude Sonnet FT) |
|---|---|---|---|
| Configuración inicial / entrenamiento | $0 (solo ing. de prompts) | $300 | $1,000 |
| Coste de inferencia mensual (1M llamadas) | $450–$600 | $270 | $900–$1,200 |
| Total mensual (Año 1) | $450–$600 | $600 (incluye entrenamiento amortizado) | $1,900–$2,200 |
| Total Año 1 | $5,400–$7,200 | $3,600–$4,800 | $12,000–$15,000 |
Ruta 2 (LoRA) gana en coste puro, pero requiere tiempo de MLOps para configurar y mantener.** Ruta 1 (caché de prompts) es fricción más baja si aceptas costes continuos ligeramente más altos. Ruta 3 (gestionada) se elige solo si SLAs empresariales u operaciones sin intervención son obligatorios.
Costes Ocultos de Migración — No los Pases por Alto
La tabla anterior omite la fricción operativa. Planifica:
1. Re-evaluación y Benchmarking
Mide la precisión, latencia y coste del nuevo modelo en tu conjunto de prueba de retención. Presupuesta: 2–3 semanas, $1K–$3K en tiempo de ingeniería.
2. Pruebas de Regresión
Ejecuta el modelo antiguo con fine-tuning y la nueva ruta en las mismas 100–1K consultas de producción. Mide brechas de calidad. Para sistemas orientados al cliente, considera pruebas A/B (ejecución dual) durante 2–4 semanas. Coste de operaciones: $2K–$5K.
3. Período de Ejecución Dual
Ejecuta ambas rutas antiguas y nuevas en paralelo para detectar regresiones en producción. Esto duplica el coste de inferencia durante 2–4 semanas. Añade $500–$2,000 a tu factura de migración.
4. Cambios en el Flujo de Entrenamiento
Si reentrenas regularmente (mensual, trimestral), factoriza cambios de scripting. Los scripts de reentrenamiento de LoRA difieren de la API de OpenAI. Mistral, Vertex, y Bedrock cada uno tienen diferentes APIs de entrenamiento. Presupuesta: 1–2 semanas, $500–$1,500.
5. Desviación de Adaptador y Monitoreo
Los adaptadores de código abierto pueden desviarse si cambian los datos de entrenamiento. Configura monitoreo de rendimiento e triggers de reentrenamiento. Para servicios gestionados, el proveedor maneja esto pero cobra gastos generales de monitoreo. Presupuesta: recurrente +$200–$500/mes.
Coste oculto total: $4K–$12K en tiempo de ingeniería + $500–$2,000 en operaciones de ejecución dual. La mayoría de equipos subestiman esto en 50%. Cuécelo en tu plan de proyecto.
Marco de Decisión
Elige Ruta 1 (Caché de Prompts + GPT-5.5) si:
- El volumen de inferencia mensual está por debajo de 100M tokens
- Tu carga de trabajo actual tiene contextos repetidos (RAG, multi-turno) — alto potencial de acierto de caché
- Tu equipo no tiene experiencia MLOps y quiere gastos generales mínimos
- Puedes aceptar un compromiso de calidad por simplicidad (la mayoría de tareas ven ≤5% regresión)
- Los requisitos de latencia son flexibles (>500ms TTFT aceptable)
Elige Ruta 2 (LoRA en Código Abierto) si:
- El volumen de inferencia mensual excede 200M tokens — ventaja de coste de 30–50%
- Tu equipo tiene ancho de banda MLOps para entrenamiento, monitoreo, y reentrenamiento
- Necesitas reproducibilidad y quieres control total sobre el adaptador (ventaja de código abierto)
- La privacidad de datos requiere sin llamadas a APIs patentadas de OpenAI, Google, o AWS
- La latencia es crítica (<200ms) — Groq ofrece respuestas sub-100ms
Elige Ruta 3 (Fine-Tuning Gestionado) si:
- Necesitas SLAs empresariales, soporte de vendedor, o cumplimiento HIPAA/SOC 2
- Tu equipo carece de experiencia en infraestructura y quiere cero MLOps
- El volumen mensual está por debajo de 50M tokens (la prima de coste es aceptable a escala baja)
- Ya estás invertido en el ecosistema del vendedor (AWS, Google Cloud, Mistral)
- La frecuencia de entrenamiento es mensual o menos (el coste de operaciones se amortiza mejor con poco cambio)
Lectura Relacionada
Para más contexto sobre el panorama de costes más amplio, ver Comparación de Costes de LLM de Código Abierto vs Cerrado, que compara volúmenes de punto de equilibrio entre opciones autoalojadas y API.
¿Ya rastreando tus costes de migración de fine-tuning? FinOps LLM audita tu gasto LLM e identifica cuál ruta de migración te ahorra más. Reserva una auditoría gratuita.