Economía del Cierre de Fine-Tuning de OpenAI

Publicado 19 de julio de 2026

OpenAI está eliminando el fine-tuning autoservicio. A partir del 7 de mayo de 2026, las nuevas organizaciones ya no pueden crear trabajos de fine-tuning. Antes del 6 de enero de 2027, todas las organizaciones pierden esa capacidad. Si dependes de modelos GPT con fine-tuning, debes elegir una ruta de migración ahora: ingeniería de prompts en GPT-5.5 con caché de prompts, adaptadores LoRA de código abierto en Llama o Qwen, o fine-tuning gestionado vía Vertex AI, AWS Bedrock, o Mistral. Cada ruta tiene distintos compromisos de coste y operativos.

Plazo: Las organizaciones deben comprometerse con una ruta de migración antes del 6 de enero de 2027. Los modelos con fine-tuning existentes continuarán sirviendo solicitudes de inferencia hasta que su modelo base sea deprecado, pero no puedes crear nuevos trabajos de entrenamiento después de esa fecha.

Cronograma y Matriz de Exposición

Quién es afectado y cuándo:

Fecha Fase Organizaciones Afectadas Acción Requerida
7 de mayo de 2026 Fase 1 Nuevas organizaciones, nunca con fine-tuning antes No pueden iniciar nuevos trabajos
2 de julio de 2026 Fase 2 Organizaciones existentes sin inferencia de modelo con fine-tuning en los últimos 60 días No pueden iniciar nuevos trabajos
6 de enero de 2027 Fase 3 (final) Todas las organizaciones, incluso usuarios activos No hay nuevos trabajos de entrenamiento
Post-2027 Solo inferencia Todas las organizaciones con modelos con fine-tuning desplegados La inferencia continúa hasta el cierre de la base

Por qué OpenAI está eliminando el fine-tuning: Los modelos de clase GPT-5.5 combinados con caché de prompts eliminan la necesidad de fine-tuning en la mayoría de casos de uso. Los prompts más largos con ejemplos few-shot e instrucciones de sistema ahora igualan o superan el rendimiento del fine-tuning, mientras consumen menos tokens totales cuando se cachean. Los gastos generales gestionados de fine-tuning exceden su valor para la mayoría de cargas de trabajo.

Árbol de Decisión: Tres Rutas de Migración

Ruta 1: Ingeniería de Prompts + GPT-5.5 + Caché

Reescribe la lógica con fine-tuning como prompt del sistema + ejemplos few-shot, cacheados. Intercambia prompts más largos por cero gastos de entrenamiento.

  • Coste de entrenamiento: $0 (sin reentrenamiento)
  • Coste de token por llamada: Prompt más largo, pero cacheado al 50% de la tasa fresca
  • Tiempo de configuración: 1–4 semanas (ingeniería de prompts + benchmarking)
  • Operaciones en curso: Iteración de prompts, no se necesita MLOps

Ruta 2: LoRA en Código Abierto (Together, Fireworks, Groq)

Fine-tune Llama 4 o Qwen 3.5 con adaptadores LoRA, aloja en inferencia gestionada. Control completo de fine-tuning, reproducibilidad de código abierto.

  • Coste de entrenamiento: $200–$500 por trabajo
  • Coste de inferencia: $0.10–$0.30/M tokens (competitivo)
  • Tiempo de configuración: 2–6 semanas (preparación de datos, entrenamiento de adaptador, pruebas)
  • Operaciones en curso: Monitorea el rendimiento del adaptador, reentrena según sea necesario

Ruta 3: Fine-Tuning Gestionado (Vertex, Bedrock, Mistral)

Usa Google Vertex AI, AWS Bedrock, o fine-tuning de Mistral. Flujo de trabajo familiar, soporte de vendedor, pero coste por token más alto.

  • Coste de entrenamiento: $500–$2,000 por trabajo
  • Coste de inferencia: $0.20–$1.00/M tokens (premium)
  • Tiempo de configuración: 1–3 semanas (menos integraciones necesarias)
  • Operaciones en curso: El vendedor maneja las operaciones, tú gestionas la cadencia de entrenamiento

Ruta 1: Ingeniería de Prompts + Caché GPT-5.5 — Matemáticas Resueltas

Supongamos que tenías un modelo GPT-4 con fine-tuning para clasificación de tickets de soporte al cliente. El modelo con fine-tuning fue entrenado en 10K tickets etiquetados. Cada solicitud envía ~500 tokens de entrada, obtiene ~50 tokens de salida.

Coste anterior (fine-tuning): Trabajo de fine-tuning: ~$50. Inferencia en 100K llamadas/mes: (500 entrada × $3/M + 50 salida × $15/M) × 100K = $150/mes + entrenamiento = ~$200/mes todo incluido.

Coste nuevo (caché de prompts en GPT-5.5): Crea un prompt del sistema con 40 ejemplos few-shot (cada uno ~200 tokens) = 8K tokens. Este es el relleno de caché. Primera llamada: 8K × (1.25× $3/M) + 500 × $3/M + 50 × $15/M ≈ $0.045. Llamadas posteriores (acierto de caché): 500 × (0.5× $3/M) + 50 × $15/M ≈ $0.0015. En 100K llamadas/mes, asume 90% de acierto (90K aciertos de caché). Coste: 10K llamadas × $0.045 + 90K llamadas × $0.0015 = $450 + $135 = $585/mes.

¡Espera — eso es más caro! Verdad si no ajustas el prompt. Pero reduce los ejemplos few-shot a 10 (2K tokens), y el coste baja a ~$280/mes. Además: si puedes agrupar consultas (procesar 10 tickets relacionados en una llamada), el coste por ticket baja otro 30%. En conclusión: el caché de prompts en GPT-5.5 se vuelve más barato que el fine-tuning en 15–30 aciertos de caché por contexto único. La mayoría de equipos alcanzan eso en horas de despliegue.

Riesgo de calidad: Los prompts few-shot pueden tener bajo rendimiento respecto al fine-tuning en casos extremos y formatos inusuales. Presupuesta 2–4 semanas para pruebas de regresión.

Ruta 2: LoRA en Código Abierto — Costes y Logística

El fine-tuning de código abierto vía LoRA (Low-Rank Adaptation) mantiene el modelo base congelado y entrena solo pequeñas matrices de adaptador (~1–5% de parámetros). Estructura de costes:

Componente Ejemplo de Proveedor Coste Notas
Entrenamiento (Llama 3.3 70B en 10K muestras) Together AI $300 LoRA en GPU H100 único (~4 horas)
Inferencia (por 1M tokens) Groq (Llama 3.3 70B) $0.27 Rápido (sin lag de ajuste vs GPT-4 con fine-tuning)
Inferencia (por 1M tokens) Together AI (Llama 3.3 70B) $0.18 Respuesta más lenta, coste más bajo
Alojamiento de modelo (mensual, siempre activo) Alojamiento propio en runpod $300–$600 Alquiler de GPU A100 + gastos generales de operaciones
Total para 1M llamadas/mes $318–$600 API de Groq (gestionada), sin coste de alojamiento

Por qué el código abierto es más barato: Sin prima por token para estado "con fine-tuning". El adaptador es tuyo para distribuir y mejorar. Calidad del modelo (Llama 4 Maverick) iguala GPT-4o para la mayoría de tareas a 30–50% menos coste. El compromiso: posees los MLOps — cadencia de reentrenamiento, detección de desviación, pruebas A/B entre versiones de adaptador.

Riesgo de integración: Cambiar de la API de OpenAI a Groq, Together, o alojamiento propio cambia tu latencia de inferencia, manejo de errores, y escalado. Espera 1–2 semanas de trabajo de integración.

Ruta 3: Fine-Tuning Gestionado (Vertex, Bedrock, Mistral)

Proveedor Coste de Entrenamiento (10K muestras) Coste de Inferencia (por 1M tokens de salida) Modelo Base Tiempo a Producción
Google Vertex AI $500–$800 $0.40–$1.50 Gemini 1.5 Flash, otros modelos OS 1–2 semanas
AWS Bedrock (Claude Sonnet con fine-tuning) $600–$1,200 $0.80–$2.00 Claude Sonnet, Llama 4, Mistral 1–2 semanas
Fine-tuning de Mistral $400–$700 $0.25–$0.60 Mistral 3.5 Moe, otros modelos Mistral 1 semana
Coste mensual típico (100K llamadas, 500 tokens promedio) $600–$1,200 (entrenamiento único) $200–$1,000 (inferencia recurrente)

Los servicios gestionados son la rampa más fácil: tu equipo ya conoce la autenticación de API, el soporte del vendedor está disponible, y evitas gastos generales de MLOps. Pero los costes de inferencia ejecutan 2–5× más alto que LoRA de código abierto. Esta ruta tiene sentido si: (1) tienes <100M tokens de salida/mes, (2) tu equipo carece de experiencia MLOps, o (3) necesitas SLAs empresariales.

Comparación de Costes de Tres Rutas (Carga de Trabajo Concreta)

Carga de trabajo: IA de servicio al cliente para SaaS. 1M llamadas de inferencia/mes, promedio 500 entrada + 150 tokens de salida por llamada. El equipo entrenó un modelo con fine-tuning en 5K conversaciones etiquetadas.

Componente de Coste Ruta 1: Caché de Prompts + GPT-5.5 Ruta 2: LoRA en Groq (Llama 3.3) Ruta 3: Bedrock (Claude Sonnet FT)
Configuración inicial / entrenamiento $0 (solo ing. de prompts) $300 $1,000
Coste de inferencia mensual (1M llamadas) $450–$600 $270 $900–$1,200
Total mensual (Año 1) $450–$600 $600 (incluye entrenamiento amortizado) $1,900–$2,200
Total Año 1 $5,400–$7,200 $3,600–$4,800 $12,000–$15,000

Ruta 2 (LoRA) gana en coste puro, pero requiere tiempo de MLOps para configurar y mantener.** Ruta 1 (caché de prompts) es fricción más baja si aceptas costes continuos ligeramente más altos. Ruta 3 (gestionada) se elige solo si SLAs empresariales u operaciones sin intervención son obligatorios.

Costes Ocultos de Migración — No los Pases por Alto

La tabla anterior omite la fricción operativa. Planifica:

1. Re-evaluación y Benchmarking

Mide la precisión, latencia y coste del nuevo modelo en tu conjunto de prueba de retención. Presupuesta: 2–3 semanas, $1K–$3K en tiempo de ingeniería.

2. Pruebas de Regresión

Ejecuta el modelo antiguo con fine-tuning y la nueva ruta en las mismas 100–1K consultas de producción. Mide brechas de calidad. Para sistemas orientados al cliente, considera pruebas A/B (ejecución dual) durante 2–4 semanas. Coste de operaciones: $2K–$5K.

3. Período de Ejecución Dual

Ejecuta ambas rutas antiguas y nuevas en paralelo para detectar regresiones en producción. Esto duplica el coste de inferencia durante 2–4 semanas. Añade $500–$2,000 a tu factura de migración.

4. Cambios en el Flujo de Entrenamiento

Si reentrenas regularmente (mensual, trimestral), factoriza cambios de scripting. Los scripts de reentrenamiento de LoRA difieren de la API de OpenAI. Mistral, Vertex, y Bedrock cada uno tienen diferentes APIs de entrenamiento. Presupuesta: 1–2 semanas, $500–$1,500.

5. Desviación de Adaptador y Monitoreo

Los adaptadores de código abierto pueden desviarse si cambian los datos de entrenamiento. Configura monitoreo de rendimiento e triggers de reentrenamiento. Para servicios gestionados, el proveedor maneja esto pero cobra gastos generales de monitoreo. Presupuesta: recurrente +$200–$500/mes.

Coste oculto total: $4K–$12K en tiempo de ingeniería + $500–$2,000 en operaciones de ejecución dual. La mayoría de equipos subestiman esto en 50%. Cuécelo en tu plan de proyecto.

Marco de Decisión

Elige Ruta 1 (Caché de Prompts + GPT-5.5) si:

  • El volumen de inferencia mensual está por debajo de 100M tokens
  • Tu carga de trabajo actual tiene contextos repetidos (RAG, multi-turno) — alto potencial de acierto de caché
  • Tu equipo no tiene experiencia MLOps y quiere gastos generales mínimos
  • Puedes aceptar un compromiso de calidad por simplicidad (la mayoría de tareas ven ≤5% regresión)
  • Los requisitos de latencia son flexibles (>500ms TTFT aceptable)

Elige Ruta 2 (LoRA en Código Abierto) si:

  • El volumen de inferencia mensual excede 200M tokens — ventaja de coste de 30–50%
  • Tu equipo tiene ancho de banda MLOps para entrenamiento, monitoreo, y reentrenamiento
  • Necesitas reproducibilidad y quieres control total sobre el adaptador (ventaja de código abierto)
  • La privacidad de datos requiere sin llamadas a APIs patentadas de OpenAI, Google, o AWS
  • La latencia es crítica (<200ms) — Groq ofrece respuestas sub-100ms

Elige Ruta 3 (Fine-Tuning Gestionado) si:

  • Necesitas SLAs empresariales, soporte de vendedor, o cumplimiento HIPAA/SOC 2
  • Tu equipo carece de experiencia en infraestructura y quiere cero MLOps
  • El volumen mensual está por debajo de 50M tokens (la prima de coste es aceptable a escala baja)
  • Ya estás invertido en el ecosistema del vendedor (AWS, Google Cloud, Mistral)
  • La frecuencia de entrenamiento es mensual o menos (el coste de operaciones se amortiza mejor con poco cambio)

Lectura Relacionada

Para más contexto sobre el panorama de costes más amplio, ver Comparación de Costes de LLM de Código Abierto vs Cerrado, que compara volúmenes de punto de equilibrio entre opciones autoalojadas y API.


¿Ya rastreando tus costes de migración de fine-tuning? FinOps LLM audita tu gasto LLM e identifica cuál ruta de migración te ahorra más. Reserva una auditoría gratuita.

Volver a investigación