Hay una escena que se repite en muchos sistemas de agentes: el usuario hace una pregunta concreta y nosotros le entregamos al modelo un catálogo enorme de herramientas, documentos y posibles caminos. Después le pedimos que gaste razonamiento en averiguar qué parte de todo eso era necesaria. Me interesaba probar el orden contrario: hacer primero una selección rápida y dejar al agente grande el trabajo que realmente necesita su capacidad.

De esa pregunta salió uno de los experimentos de System One Playground. La consulta del usuario pasa por Jev o Laya, que intenta identificar las herramientas candidatas. Solo después entra el agente que resolverá la tarea. No se trata de escribir la respuesta con el modelo pequeño, sino de preparar mejor el terreno para el siguiente paso.

Elegir herramientas también es una tarea

Este tipo de selección se conoce como tool routing. Imagina un agente con varias maneras de buscar, consultar datos o ejecutar operaciones. La primera decisión no es qué contestar, sino qué capacidades conviene poner a su alcance para esta pregunta. Si la selección es buena, el agente recibe un conjunto más manejable de opciones y dedica menos contexto a revisar herramientas irrelevantes.

La parte delicada es lo que queda fuera. Un filtro que elimina la herramienta correcta puede simplificar el contexto y, al mismo tiempo, impedir la respuesta. Por eso una prueba de routing no se evalúa solo por cuánto reduce el catálogo: también hay que mirar cuáles herramientas conserva, cuáles descarta y qué pasa cuando la consulta es difícil de clasificar.

Lo que mostró esta versión

En la demostración, Laya base todavía comete errores de clasificación. Jev se desempeñó mejor en este caso. El resultado no cierra la discusión sobre cuál modelo conviene usar; señala dónde está el trabajo pendiente. Me interesa ajustar estos modelos para tareas concretas de selección y medir si ese esfuerzo logra un filtro más confiable.

Ese es el valor de dejar el experimento a la vista: se puede probar la idea y también encontrar sus tropiezos. Si trabajas con agentes, puedes abrir el Playground, hacer tus propias consultas y pensar en qué punto de tu flujo tendría sentido decidir rápido antes de pedirle al modelo grande que razone más.