Modelos, agentes y costes9 min de lectura

GPT-6 Sol y Luna cambian la economía de los agentes: el coste ya depende de la arquitectura

OpenAI reduce a la mitad el precio de sus modelos intermedios y económicos, mientras convierte la caché de contexto en una pieza medible y configurable. Para las empresas, elegir el modelo más potente deja de ser la decisión principal.

OpenAI presentó el 22 de septiembre GPT-6 Sol y GPT-6 Luna, dos modelos orientados a llevar las capacidades de GPT-6 a cargas de trabajo más frecuentes y de mayor volumen. La reducción de precios es directa: un 50 % frente a la tarifa promocional de sus equivalentes GPT-5.6.

La novedad importante no es únicamente que haya dos modelos nuevos. El lanzamiento dibuja una arquitectura de tres niveles: Astra para los problemas más exigentes, Sol para flujos complejos y Luna para tareas enfocadas y masivas. La eficiencia aparece, por tanto, al asignar cada trabajo al nivel adecuado.

01

Dos escalones nuevos en precio y capacidad

En la API, GPT-6 Sol cuesta 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida. GPT-6 Luna baja hasta 0,10 dólares de entrada y 0,50 dólares de salida. Ambos admiten texto e imágenes como entrada, herramientas, MCP, uso de ordenador y una ventana de contexto de 1,05 millones de tokens.

Según las evaluaciones publicadas por OpenAI, Sol mejora frente a GPT-5.6 Sol en trabajo profesional, factualidad, programación y uso de aplicaciones. Luna se acerca en algunas pruebas a modelos mucho más caros. Son resultados del proveedor y deben validarse con tareas reales antes de convertirlos en promesas de negocio.

Una diferencia de cien a uno

La entrada de Luna cuesta veinte veces menos que la de Sol y cien veces menos que la de Astra. Esa distancia convierte el enrutamiento por tipo de tarea en una decisión económica de primer orden.

02

El modelo más potente no debería ejecutar cada paso

Un agente empresarial raramente realiza una sola operación. Puede leer una solicitud, clasificarla, recuperar datos, comprobar permisos, decidir una acción, redactar una respuesta y registrar el resultado. Utilizar el modelo más caro en todos los pasos confunde capacidad máxima con eficiencia operativa.

Las tareas repetitivas y bien acotadas —clasificación, extracción estructurada, comprobaciones simples o generación de variantes— pueden utilizar un modelo económico. Las decisiones ambiguas, los casos excepcionales y las acciones con mayor impacto pueden escalar a un modelo superior o a revisión humana.

Este patrón permite aumentar el volumen sin renunciar al control. También obliga a medir el coste por tarea completa, incluyendo llamadas a herramientas, reintentos, búsquedas y revisiones, en lugar de comparar únicamente el precio por token.

03

La caché deja de ser un descuento invisible

Los agentes persistentes reutilizan instrucciones, definiciones de herramientas, documentación y fragmentos de conversaciones durante muchas llamadas. OpenAI aplica ahora descuentos del 90 % a las lecturas de entrada almacenadas en caché: 0,20 dólares por millón de tokens en Sol y 0,01 dólares en Luna.

La compañía también incorpora un panel para observar la tasa de aciertos, diagnósticos para localizar fallos y puntos de corte explícitos para decidir qué prefijos se almacenan. Cambiar el nivel de razonamiento o limitar temporalmente las herramientas disponibles ya no tiene por qué invalidar el contexto reutilizable.

Esto convierte la organización del prompt en arquitectura de producto. Las instrucciones estables, los esquemas de herramientas y la documentación común deben permanecer al principio; la información variable se añade después. Una mala disposición puede multiplicar el coste sin mejorar la respuesta.

04

Qué cambia para pymes y equipos de operaciones

La bajada de precios hace viables procesos que antes resultaban difíciles de justificar por volumen: clasificación continua de solicitudes, normalización de inventarios, preparación de documentación, control de incidencias o asistentes internos que consultan varias fuentes.

Sin embargo, una automatización económica no es automáticamente rentable. El valor depende de la tasa de resolución, el tiempo humano ahorrado, los errores introducidos y el coste de mantener integraciones y permisos. Un modelo barato que necesita múltiples reintentos puede resultar más caro que otro más capaz que resuelve el caso a la primera.

Los equipos deberían probar una muestra representativa, separar casos normales y excepciones, y comparar calidad, latencia y coste final. La selección del modelo puede ser dinámica, pero los criterios de escalado necesitan ser explícitos y auditables.

05

Disponibilidad, residencia de datos y costes ocultos

GPT-6 Sol y Luna están disponibles en ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu, con un despliegue gradual. Luna también llega a la aplicación de escritorio para cuentas Free y Go. En la API se publican como gpt-6-sol y gpt-6-luna.

La residencia de datos en la Unión Europea solo está disponible con procesamiento Standard y añade un recargo regional del 10 %. Además, las solicitudes que superan 272.000 tokens aplican multiplicadores sobre entrada, caché y salida. Una ventana de contexto grande no significa que llenarla siempre sea eficiente.

También deben considerarse los costes de herramientas, búsquedas, almacenamiento, observabilidad y supervisión humana. El precio del modelo es el comienzo de la cuenta, no el total.

Conclusión

La ventaja ya no consiste en elegir un modelo, sino en diseñar un sistema que sepa cuándo cambiar de modelo.

Sol, Luna y la nueva caché reducen el coste de mantener agentes activos durante más tiempo. Pero la eficiencia real aparece al combinar enrutamiento, contexto estable, métricas de calidad y escalado humano. El modelo más barato no siempre gana; gana la arquitectura que utiliza la inteligencia adecuada en cada momento.

Cinco métricas para evaluar un agente

  • Coste por tarea resuelta. Incluye todas las llamadas, herramientas y reintentos.
  • Tasa de escalado. Mide cuántos casos necesitan un modelo superior o revisión humana.
  • Aciertos de caché. Revelan cuánto contexto estable se está reutilizando de verdad.
  • Latencia completa. Importa el tiempo hasta un resultado utilizable, no solo el primer token.
  • Errores con impacto. Distingue fallos menores de decisiones que afectan a datos, dinero o personas.

Fuentes

Los precios, prestaciones y resultados de evaluación proceden de OpenAI. Las comparaciones de rendimiento son afirmaciones del proveedor y deben comprobarse sobre cada flujo de trabajo antes de tomar decisiones de producción.