Hola,
He estado probando a fondo esta semana los nuevos modelos de código ultra baratos, concretamente DeepSeek V4 Pro y MiMo 2.5 Pro, y la verdad es que el rendimiento en tareas del mundo real me ha sorprendido bastante, aunque todavía hay que vigilar de cerca cómo toman ciertas decisiones de autonomía.
TL;DR
- DeepSeek V4 Pro a prueba: Lo puse a trabajar en una app full stack, automatizando Git y refactorizando código. Por 0,32$ de coste total de las pruebas, cuesta mucho quejarse. Ver vídeo.
- MiMo 2.5 Pro de Xiaomi: Un modelo open-weights MoE que compite cara a cara en coste y destaca por su velocidad y coherencia gracias a su caché de contexto. Ver vídeo.
- Fable y Claude para la landing de AI Expert: Increíbles a nivel de diseño y creatividad para hacer el trazo gordo, pero se atascan en el detalle fino de maquetación que Codex resuelve a la primera. Ver landing.
- Novedades y lecturas: Fable 5 vuelve con límites en tareas de código, Codex se autoprograma en Stream Deck y el ecosistema de agentes con Letta Code mods y wikis personales gestionadas por IA.
Poniendo a prueba los modelos "low cost" en la trinchera
En las últimas semanas hemos visto una carrera brutal por bajar los costes de las APIs de código, pero a mí lo que me interesa es ver qué pasa cuando los pones a trabajar con tareas de verdad. Así que me he remangado y he metido a DeepSeek V4 Pro y a MiMo 2.5 Pro (el modelo MoE de 1T de Xiaomi) en escenarios reales: crear una app full stack con su base de datos, lidiar con Git/GitHub, gestionar subagentes en paralelo y refactorizar código en PostFlow.
Con DeepSeek V4 Pro, la primera sorpresa viene por el bolsillo. La API está a unos absurdos 0,87$ por millón de tokens y tiene un almacenamiento en caché muy agresivo (cercano al 95%). Todas las pruebas de desarrollo real que hice me costaron apenas 0,32$. En la práctica, el modelo se desenvuelve muy bien estructurando la app y montando interfaces drag-and-drop. Sin embargo, hay que vigilar su autonomía: cuando entra en modo "planificar", se lanza a escribir código sin preguntar ni validar lo suficiente en el navegador, lo que a veces te obliga a intervenir para corregir el rumbo.
Por su parte, MiMo 2.5 Pro de Xiaomi no se queda atrás. Es un MoE enorme (1T de parámetros con 42B activos) y el impacto de su Context Caching se nota muchísimo en la velocidad y el coste final. Lo puse a crear un tablero Kanban con React y Express, y a resolver issues en PostFlow usando subagentes en paralelo. Coherencia y velocidad brutales. No lo cuento como un veredicto definitivo, pero es una señal muy fuerte de que los modelos abiertos de bajo coste ya no son solo para jugar, sino para integrarlos en tus flujos diarios.
Aquí tienes los análisis detallados en vídeo de ambos modelos:
- DeepSeek V4 Pro a prueba: ¿El rey del open weights?
- Pusimos a prueba MiMo 2.5 Pro: ¿Mejor que DeepSeek?
Creatividad vs. precisión: Fable y Codex en la nueva landing
Esta semana también he estado rediseñando y mejorando la landing de la formación de AI Expert. He usado Fable (con Claude) y a nivel de diseño y creatividad me ha parecido otro nivel. En un rato me montó componentes interactivos muy visuales para explicar los beneficios del curso.
Pero aquí viene el matiz interesante: el trazo gordo lo hace perfecto, pero el detalle fino lo pierde. Fable se encalló en cosas absurdas del maquetado (rompiendo textos y perdiendo el tamaño de los elementos) y falló al renderizar un vídeo con Remotion. ¿La solución? Le pasé el problema a Codex y lo resolvió a la primera. Al final, tener diferentes modelos especializados para cada fase del flujo es lo que marca la diferencia.
Si quieres ver cómo ha quedado la landing interactiva, puedes echarle un ojo aquí: 👉 Nueva landing de AI Expert
También merece la pena mirar…
- Fable 5 vuelve con límites: Se ha relanzado el modelo limitando ciertas tareas de programación y depuración debido a políticas de seguridad, lo cual ha generado cierta controversia por la ambigüedad de las tareas bloqueadas. Más info en X.
- Codex configurando Stream Deck: Un ejemplo tonto pero muy práctico de micro-automatización: Codex diseñando sus propios iconos para los botones de Elgato y ejecutando un script para actualizarlos dinámicamente. Ver hilo en X.
- Letta Code mods: Ahora soporta modificaciones directas a nivel de harness (modificar contexto, inyectar herramientas, etc.), lo que permite que los agentes adapten su propio entorno de ejecución. Ver en X.
- Wiki personal con agentes: Matt Pocock ha compartido un experimento interesante: una wiki alimentada automáticamente por agentes que ingieren X, Discord y Gmail cada pocas horas para crear memoria persistente. Ver en X.
- Flujos de trabajo continuo con Codex: Un desglose técnico de primitivas para flujos largos (heartbeats, hilos precreados, gates y aprendizaje recurrente). Ver en X.
¿Quieres aprender a montar estos flujos?
Todo esto de los agentes, la automatización y el uso de modelos locales y comerciales no sirve de nada si no sabes estructurar el flujo de trabajo con criterio.
En septiembre abrimos una nueva edición de AI Expert, nuestro programa online donde aprenderás a diseñar e implementar estos sistemas agénticos desde la base y con código real. Tienes toda la información aquí:
Un abrazo,
Antonio Leiva
