¡Hola DevExpert!
Ayer viernes, OpenAI anunció GPT-5.6. Como era de esperar, la comunidad se llenó de benchmarks espectaculares. Sin embargo, hay un detalle crucial: de momento, no lo podemos probar.
Por orden del gobierno de EE.UU., el despliegue inicial de la familia GPT-5.6 —dividida en Sol (el más potente), Terra (equilibrado) y Luna (rápido y barato)— está restringido a una preview muy limitada para unos pocos socios seleccionados en Codex y API. Aunque prometen disponibilidad general en semanas, hoy no hay forma real de verificar esos números.
Esta es la gran lección de la semana. Mientras la frontera teórica avanza, la utilidad real está en cómo integramos los modelos actuales en flujos de trabajo reales y controlados. No se trata de esperar al "modelo definitivo", sino de construir una infraestructura sólida que nos permita trabajar con lo que ya tenemos. Por eso, esta semana he puesto a prueba dos modelos de bajo coste en tareas reales y analizaremos cómo estructurar el entorno para que los agentes aporten valor sin romper nuestro código.
TL;DR: Lo esencial de la semana
- GPT-5.6 anunciado a medias: OpenAI presenta Sol, Terra y Luna en preview muy limitada por petición de EE.UU. He analizado sus implicaciones en mi hilo de X.
- Vídeo 1: MiniMax M3 a prueba: Analizo si este modelo de bajo coste rinde frente a retos de arquitectura en OpenCode Desktop. Ver vídeo en YouTube.
- Vídeo 2: Kimi K2.7 Code en acción: Lo pongo a resolver 15 issues en paralelo sobre PostFlow. Su velocidad sorprende, pero también destapo sus limitaciones. Ver vídeo en YouTube.
- Agentes bajo control: Claves sobre la implementación de SDD por partes, inyección segura de secretos con 1Password y por qué el "harness" de desarrollo importa mucho más que el modelo aislado.
El tema de la semana: GPT-5.6, benchmarks y el valor de la realidad
La presentación de GPT-5.6 ha seguido el guion clásico de OpenAI. Según sus comunicaciones oficiales, el modelo llega en tres variantes adaptadas a diferentes presupuestos y tareas:
- GPT-5.6 Sol: El buque insignia de la familia, diseñado para tareas complejas de razonamiento y codificación avanzada.
- GPT-5.6 Terra: La opción equilibrada. Promete rendimiento similar a GPT-5.5 pero a mitad de precio, ideal para el trabajo diario.
- GPT-5.6 Luna: El modelo ligero, optimizado para tareas de alto volumen de tokens que requieren respuestas rápidas a coste mínimo.
El matiz importante es el método de entrega. OpenAI ha confirmado que, por peticiones gubernamentales, el acceso se limita por ahora a un grupo de partners. Como comentaba en mi hilo de X, esto nos deja en una posición delicada: nos toca fiarnos de sus gráficas de rendimiento sin posibilidad de contrastarlas en nuestros entornos de desarrollo.
La llegada de Terra y Luna confirma que la tendencia es buscar viabilidad económica y rapidez, no solo inteligencia bruta. Un modelo no sirve en producción si cada llamada tarda 10 segundos en responder o cuesta demasiado.
La ventaja real está en estructurar el flujo de trabajo (el "harness") para exprimir los modelos disponibles. Como comentaba sobre herramientas tipo Lovable, si el entorno es solo un wrapper que pasa texto al modelo y espera magia, fallará. Necesitas planificación, subagentes, verificación, tests y seguridad. El ecosistema lo es todo.
Los vídeos de la semana: MiniMax M3 vs. Kimi K2.7 Code
Esta semana he publicado dos vídeos donde pongo a prueba dos modelos de código muy comentados en escenarios de desarrollo reales utilizando OpenCode Desktop.
1. MiniMax M3: Inteligencia brutal a bajo coste ¿Merece la pena?
En este primer vídeo, pongo a MiniMax M3 a trabajar en tareas reales sobre un repositorio local.
- Pruebas: Configuración del entorno, app full-stack SQLite, revisiones de código, issues de GitHub con subagentes y una feature real en PostFlow.
- Conclusión: Lo importante es evaluar si el modelo entiende la arquitectura existente y decide coherentemente. MiniMax M3 ofrece una comprensión contextual sólida por un coste mínimo. Detalles en este post de X.
2. Kimi K2.7 Code: Resolviendo 15 issues en paralelo
En el segundo vídeo, pongo a prueba Kimi K2.7 Code, un modelo que destaca por su paridad con Opus en tareas de desarrollo.
- Pruebas: Crear app full-stack, gestionar repos con la CLI de GitHub (
gh), resolver 15 issues en paralelo con subagentes y modificar la densidad del calendario de PostFlow. - Puntos fuertes: Velocidad brutal (HighSpeed), excelente planificación (plan mode), cambios quirúrgicos limpios e integración para corregir tests.
- Limitaciones: Tiende a simplificar la arquitectura si no se le guía, y la UI/drag-and-drop requirió ajustes manuales. Análisis de costes e integración en este hilo técnico.
Práctica y buenas prácticas: Cómo domar a tus agentes
Cuando pasas de usar la IA como un simple autocompletado a integrarla en agentes autónomos que modifican tu disco duro, la seguridad y el control son prioridades absolutas. Aquí tienes algunas prácticas que he implementado esta semana:
- SDD por partes: Pedirle a un agente que implemente un diseño completo de golpe suele generar un diff gigantesco que rompe el sistema. Como comentaba en este post, la especificación de diseño de software (SDD) no te obliga a tirar todo el código a la vez. Lo ideal es dividir el trabajo en tareas atómicas, implementar una a una, pasar tests y ajustar. Diffs pequeños equivalen a un control real.
- Inyección segura de secretos con 1Password y
oprun: Tener claves en ficheros.enven texto plano es peligroso: los agentes locales pueden leerlos y filtrarlos en llamadas externas. Para solucionarlo, inyecto los secretos en runtime usando 1Password y su CLIoprun. De este modo, los secretos nunca se escriben en disco en claro y el agente no puede filtrarlos accidentalmente. Explico la configuración en este post de X. - Agentes con contexto de navegador via Chrome MCP: En lugar de copiar e integrar documentación o issues manualmente, utilizo Chrome MCP para permitir que el agente lea directamente las pestañas activas, la documentación abierta o el estado de los issues de GitHub en el navegador. Así consume solo el contexto que yo he seleccionado de forma controlada. Más detalles en mi explicación técnica.
- Automatización supervisada (Human in the Loop): He montado una automatización que revisa tres bandejas de correo, categoriza los mensajes, sugiere bajas de newsletters y redacta borradores de respuesta. La clave es que el agente no envía nada sin mi aprobación. Yo reviso los borradores, edito y apruebo. Un ahorro de tiempo enorme sin perder control. Comento el flujo detallado en este post.
- Inferencia local: Si prefieres mantener todo el flujo en local por privacidad, esta semana se ha presentado Ornith-1.0, una nueva familia de modelos de código abiertos con tamaños desde 9B hasta 397B MoE. De todos ellos, el modelo de 35B MoE se posiciona como una opción interesantísima para ejecutar en hardware de desarrollo local sin sacrificar demasiada capacidad de razonamiento. Puedes seguirle la pista en este enlace.
Lecturas y recursos recomendados
- Voxtral: Proyecto de modelos de voz open-source que implementa tokenización de audio y streaming TTS de baja latencia. Ver en X.
- Codex Handoff Local/Remoto: Cómo estructurar flujos para mover hilos de ejecución de agentes de forma fluida entre tu portátil local y servidores remotos en la nube. Leer hilo.
- Skills en sistemas multi-agente: Matt Pocock comparte su visión sobre cómo diseñar skills que pueden ser invocadas tanto directamente por el usuario como delegadas dinámicamente por el propio modelo. Ver post.
- OpenMontage: Un pipeline completo que demuestra cómo automatizar la edición y montaje de vídeo mediante la coordinación de diferentes agentes especializados. Ver en X.
¿Quieres dominar estas arquitecturas y flujos de trabajo?
Todo lo que hemos comentado en esta newsletter —desde la estructuración de agentes, la inyección segura de secretos, la conexión con herramientas locales hasta la gestión avanzada de contexto y subagentes— es precisamente lo que enseñamos a implementar desde cero en la quinta edición de AI Expert.
Las clases comienzan en septiembre y están diseñadas para desarrolladores que quieren dejar de jugar con prompts básicos y empezar a construir sistemas de IA de producción que funcionen de verdad. Si quieres asegurar tu plaza o ver el temario completo, tienes toda la información en la web oficial:
👉 AI Expert - Edición Septiembre
Nos leemos la semana que viene. ¡Buen fin de semana y a programar!
Un abrazo,
Antonio.
