kling_20260526_作品_A_nostalgi_4533_1
Sin categoría3 min

RAG Time

Investigación SLM

[01] La tesis

La próxima década de agentes no se ganará con más parámetros.

Se ganará orquestando muchos modelos pequeños —especializados, baratos, rápidos— coordinados por una capa delgada de decisión.

[02] El argumento

En junio de 2025, un equipo de NVIDIA Research publicó una posición que lo resume mejor que nosotros: los modelos pequeños son suficientemente potentes, intrínsecamente más adecuados y necesariamente más económicos para muchas de las invocaciones que ocurren dentro de un sistema agéntico.

El argumento es más fuerte precisamente donde un agente pasa la mayor parte del tiempo: llamada a herramientas, razonamiento estructurado y pasos orquestados por código. Ahí un modelo pequeño iguala o supera a uno grande.

Llamar a un modelo de frontera para cada paso es desperdicio. Reserva el grande para los momentos de planificación. Usa SLM para todo lo demás.

— Belcak et al., Small Language Models are the Future of Agentic AI, arXiv:2506.02153

[03] Por qué SLM

Menos de 10.000 millones de parámetros. Entre 10 y 30 veces más baratos por token en sistemas reales. Latencia un orden de magnitud menor. Afinado asequible: horas en lugar de semanas. Privacidad real, en el dispositivo cuando importa.

Phi, Llama 3.2, Gemma, Mistral Small, Apple Foundation. La brecha con los grandes se cierra cada mes.

Un dato que da la medida de lo que ha cambiado: Phi-2, con 2.700 millones de parámetros, iguala a modelos de 30.000 millones en razonamiento de sentido común y generación de código, y corre unas quince veces más rápido.

Y una definición práctica, que es la mejor que hemos encontrado y ahorra la discusión de qué significa "pequeño":

Un SLM es un modelo que corre en un dispositivo de consumo corriente y responde lo bastante rápido para atender a un usuario. Todo lo demás es un LLM.

[04] El orquestador

Una capa fina decide qué subagente, qué herramienta, qué memoria.

Lee el contexto, despacha el trabajo, y escala al modelo grande solo cuando hace falta razonar de verdad. El resto del tiempo mantiene el ritmo.

[05] Lo que el argumento no dice

Todo esto habla de tipos de tarea, no del tráfico real de un producto concreto. Conviene decirlo, porque circulan resúmenes que convierten esa posición en un porcentaje que el paper no da.

Es perfectamente posible que la mayoría de los tipos de tarea de tu agente quepan en un modelo pequeño y que la mayor parte de lo que tus usuarios piden de verdad caiga en el resto, porque las tareas abiertas son justo las que la gente pide conscientemente. Un sistema puede tener el noventa por ciento de sus nodos resueltos por SLM y aun así escalar al modelo grande en dos de cada tres conversaciones.

Esa distribución no la sabe nadie hasta que la mide en su propio sistema. Es lo primero que estamos midiendo en el nuestro.

[06] Composición

Ragtime es el runtime y la UX para componer estos sistemas.

Agentes en paralelo. Sandbox de herramientas. Memoria persistente. Diff y rollback. Trazabilidad completa. Stream nativo.

[07] Estado

Pre-alfa. Construyendo el orquestador. Zaragoza, 2026.

Lo que nos falta por demostrar, en orden: qué porcentaje de peticiones reales resuelve un modelo pequeño sin escalar al grande, cuántos modelos aguantan a la vez en una máquina de dieciséis gigas antes de empezar a paginar, y en qué casos concretos el orquestador se equivoca.

Los tres irán publicados aquí cuando existan, incluidos los que no nos favorezcan.


Cómo se monta todo esto sin presupuesto, en Sobre los inicios lentos.**

SLMagentesorquestaciónRagtime