¡Hola DevExpert!
Esta semana nos hemos levantado con la noticia de que el gobierno estadounidense ha exigido suspender el acceso a Fable 5 y Mythos 5 para todo el mundo. Más allá de si la medida es exagerada o de la tensión política con Anthropic, la realidad es que depender ciegamente de proveedores cerrados de un solo país nos deja muy expuestos.
TL;DR de esta semana:
- Vídeo: MiniMax Code: ¿el primer entorno diseñado para agentes? - Pongo a prueba este entorno orquestando agentes en paralelo, programando tareas y conectándolo con Telegram.
- Tema de la semana: Dependencia de modelos y alternativas baratas - El bloqueo de Fable 5 reabre el debate de depender de terceros y cómo solucionarlo con contexto, harness y modelos locales.
- Nuevos modelos: MiniMax M3 (MoE ejecutable en local) · Kimi K2.7 Code (modelo local optimizado por Unsloth)
El tema de la semana: Dependencia, costes y la alternativa local
El bloqueo de Fable 5 y Mythos 5 es una advertencia de lo rápido que nos pueden cortar el grifo. Por eso creo que es el momento de acelerar una línea de trabajo clara: ver cuánto podemos conseguir usando modelos mucho más baratos o locales. Al final, si una tarea sale mal, subir al modelo más caro no siempre es la solución. Muchas veces lo que toca es iterar sobre el contexto y mejorar el harness que rodea al agente. Los modelos frontera reducen esa fricción a base de billetera, pero a costa de depender de gigantes extranjeros.
Una opción muy interesante para reducir esa dependencia es MiniMax M3. Se acerca bastante al rendimiento de los frontera y tiene una particularidad: es un MoE de 428B con solo 23B activos. Con unos 250-350GB de RAM se puede correr en local, algo perfectamente razonable para cualquier empresa que busque soberanía e inferencia propia.
Además, este modelo viene acompañado de MiniMax Code, un entorno de desarrollo para agentes de los más curiosos que he probado. Aquí la clave no es solo que te autocomplete código, sino cómo gestiona la infraestructura de agentes en paralelo. En mis pruebas, puse al entorno a automatizar arquitectura, backend y UI a la vez, superando 146 tests. Su verifier añade una capa de evidencia sobre la calidad del código, aunque lógicamente siempre requiere supervisión. En general, los agentes autónomos coordinados funcionan bastante mejor que la media. De hecho, el entorno permite programar tareas recurrentes en segundo plano e interactuar con ellas directamente desde canales como Telegram, que por cierto acaba de anunciar formato enriquecido para chatbots.
El truco para conectar modelos baratos a Codex
Siguiendo con la idea de bajar costes, he estado probando si podíamos usar subagentes en Codex con modelos externos más económicos. El problema al intentarlo es que Codex envía en sus peticiones ciertas tools que no cumplen el estándar clásico de OpenAI, lo que hace que las APIs de terceros rompan.
Para solucionarlo, he montado un proxy intermedio (un shim) que traduce esos formatos y los hace compatibles. Con esto, podemos usar un orquestador potente y caro (como GPT 5.5) que se encargue de coordinar, y delegar la ejecución pesada en modelos mucho más baratos. Tenéis el repositorio abierto y listo para probar en el propio hilo.
Y un último consejo práctico de desarrollo: antes de lanzar a un agente a escribir código de golpe, dedicar tokens a especificar bien la tarea ahorra mucho retrabajo. Para esto uso la skill /grill-me de Matt Pocock. Le planteas tu idea de partida y te interroga con preguntas concisas hasta que las especificaciones están totalmente claras. Una vez definidas las specs en modo plan y diseñado el UI, dejas que Codex ejecute el objetivo completo. El resultado es infinitamente más limpio.
El vídeo de la semana: MiniMax Code a prueba
He grabado un vídeo analizando a fondo este entorno y cómo se comporta. Explico el funcionamiento del modelo M3, cómo crear equipos de agentes personalizados, la demo real automatizando el scaffolding, backend y UI, y cómo configurar tareas programadas con integración en Telegram.
Lecturas recomendadas
Kimi K2.7 Code en local con Unsloth El equipo de Unsloth ha conseguido comprimir este modelo de 1T a 325GB mediante Dynamic 2-bit. En máquinas con unos 330GB de RAM/VRAM corre a más de 40 tokens por segundo, lo que abre una vía muy real para tener inferencia local potente en servidores propios.
Traducción de respuestas para vLLM y Codex Erdal Toprak ha publicado una capa de traducción que resuelve los problemas de compatibilidad de formato entre las respuestas de vLLM y el servidor de Codex. Si os estáis pegando con la integración de modelos externos, este recurso os va a ahorrar bastantes cabezazos.
Codex, Chrome y Computer Use en Europa Un repaso práctico a la llegada de Chrome, Computer Use y memoria en Codex para la UE. Desde rellenar formularios en bucle hasta actualizar el contexto del agente usando directamente capturas de pantalla de la app en desarrollo.
Próxima edición de AI Expert
Si quieres aprender a orquestar tus propios agentes, diseñar contextos y flujos de trabajo robustos con IA sin depender de recetas mágicas, apúntate a la lista para la próxima edición.
Un abrazo,
Antonio.
