DevExpert

¡Hola DevExpert!

Ayer viernes, OpenAI anunció GPT-5.6. Como era de esperar, la comunidad se llenó de benchmarks espectaculares. Sin embargo, hay un detalle crucial: de momento, no lo podemos probar.

Por orden del gobierno de EE.UU., el despliegue inicial de la familia GPT-5.6 —dividida en Sol (el más potente), Terra (equilibrado) y Luna (rápido y barato)— está restringido a una preview muy limitada para unos pocos socios seleccionados en Codex y API. Aunque prometen disponibilidad general en semanas, hoy no hay forma real de verificar esos números.

Esta es la gran lección de la semana. Mientras la frontera teórica avanza, la utilidad real está en cómo integramos los modelos actuales en flujos de trabajo reales y controlados. No se trata de esperar al "modelo definitivo", sino de construir una infraestructura sólida que nos permita trabajar con lo que ya tenemos. Por eso, esta semana he puesto a prueba dos modelos de bajo coste en tareas reales y analizaremos cómo estructurar el entorno para que los agentes aporten valor sin romper nuestro código.


TL;DR: Lo esencial de la semana


El tema de la semana: GPT-5.6, benchmarks y el valor de la realidad

La presentación de GPT-5.6 ha seguido el guion clásico de OpenAI. Según sus comunicaciones oficiales, el modelo llega en tres variantes adaptadas a diferentes presupuestos y tareas:

El matiz importante es el método de entrega. OpenAI ha confirmado que, por peticiones gubernamentales, el acceso se limita por ahora a un grupo de partners. Como comentaba en mi hilo de X, esto nos deja en una posición delicada: nos toca fiarnos de sus gráficas de rendimiento sin posibilidad de contrastarlas en nuestros entornos de desarrollo.

La llegada de Terra y Luna confirma que la tendencia es buscar viabilidad económica y rapidez, no solo inteligencia bruta. Un modelo no sirve en producción si cada llamada tarda 10 segundos en responder o cuesta demasiado.

La ventaja real está en estructurar el flujo de trabajo (el "harness") para exprimir los modelos disponibles. Como comentaba sobre herramientas tipo Lovable, si el entorno es solo un wrapper que pasa texto al modelo y espera magia, fallará. Necesitas planificación, subagentes, verificación, tests y seguridad. El ecosistema lo es todo.


Los vídeos de la semana: MiniMax M3 vs. Kimi K2.7 Code

Esta semana he publicado dos vídeos donde pongo a prueba dos modelos de código muy comentados en escenarios de desarrollo reales utilizando OpenCode Desktop.

1. MiniMax M3: Inteligencia brutal a bajo coste ¿Merece la pena?

En este primer vídeo, pongo a MiniMax M3 a trabajar en tareas reales sobre un repositorio local.

2. Kimi K2.7 Code: Resolviendo 15 issues en paralelo

En el segundo vídeo, pongo a prueba Kimi K2.7 Code, un modelo que destaca por su paridad con Opus en tareas de desarrollo.


Práctica y buenas prácticas: Cómo domar a tus agentes

Cuando pasas de usar la IA como un simple autocompletado a integrarla en agentes autónomos que modifican tu disco duro, la seguridad y el control son prioridades absolutas. Aquí tienes algunas prácticas que he implementado esta semana:


Lecturas y recursos recomendados


¿Quieres dominar estas arquitecturas y flujos de trabajo?

Todo lo que hemos comentado en esta newsletter —desde la estructuración de agentes, la inyección segura de secretos, la conexión con herramientas locales hasta la gestión avanzada de contexto y subagentes— es precisamente lo que enseñamos a implementar desde cero en la quinta edición de AI Expert.

Las clases comienzan en septiembre y están diseñadas para desarrolladores que quieren dejar de jugar con prompts básicos y empezar a construir sistemas de IA de producción que funcionen de verdad. Si quieres asegurar tu plaza o ver el temario completo, tienes toda la información en la web oficial:

👉 AI Expert - Edición Septiembre


Nos leemos la semana que viene. ¡Buen fin de semana y a programar!

Un abrazo,

Antonio.