De Chat a Sistema Cognitivo: cómo evolucionan los LLM hacia agentes inteligentes
5 de marzo de 2026
De chat a sistema cognitivo
La mayoría de las empresas cree que está usando inteligencia artificial.
En realidad, solo están usando chat.
Un usuario escribe algo.
Un modelo responde texto.
Eso es útil, pero está lejos de ser un sistema inteligente.
Un sistema realmente inteligente no solo responde.
Planifica, usa herramientas, recuerda información y ejecuta acciones.
Ahí es donde aparecen los agentes y los sistemas cognitivos.
El problema de los chatbots
Cuando alguien dice "le pregunté a la IA", casi siempre imagina un chat. Pero eso es apenas el punto de partida de una arquitectura mucho más compleja.
Existe una diferencia enorme entre:
- un chatbot
- un sistema cognitivo
entender esa diferencia es clave si querés construir aplicaciones de IA que realmente funcionen.
Cada capa agrega capacidades nuevas, la evolución suele verse así:
1. Qué es realmente un LLM (y qué no es)
Un Large Language Model (LLM) es un modelo entrenado para predecir la siguiente palabra en una secuencia. Nada más, nada menos.
Suena simple, pero de esa predicción emerge algo que parece razonamiento. La clave está en el "parece".
Cuando le damos un prompt como:
La capital de Argentina es...
Internamente calcula probabilidades:
Y responde: Buenos Aires.
Eso no significa que "sepa geografía". Significa que estadísticamente esa secuencia aparece mucho en sus datos de entrenamiento. Es completación de patrones, no comprensión semántica.
Lo que los LLM hacen bien
- Generación de texto
- Resumen y traducción
- Razonamiento aproximado
- Escritura de código
Sus limitaciones
- Alucinaciones (respuestas plausibles pero incorrectas)
- Conocimiento limitado a la fecha de entrenamiento
- No pueden ejecutar acciones
- No aprenden automáticamente de conversaciones
- Son no deterministas
Ah, y un punto que se menciona poco: no existe el modelo universal. Gemini, Claude Opus, Codex, Copilot... cada uno sobresale en tareas distintas. Y los modelos chinos de código abierto como Kimi o MiniMax están entregando alrededor del 90% del rendimiento de los modelos occidentales con mucho menos costo.
2. El problema del contexto
Antes de hablar de agentes hay que entender una limitación fundamental:
la ventana de contexto.
Imaginá un pizarrón de tamaño fijo.
En ese pizarrón entra:
- el prompt del sistema
- el historial de conversación
- archivos cargados
- instrucciones
Cuando se llena, el modelo empieza a degradarse.
Síntomas comunes
Instruction drift
El modelo empieza a ignorar instrucciones iniciales.
Recency bias
Prioriza lo último que leyó.
Compaction loss
Cuando el sistema comprime el contexto para hacer espacio, pierde decisiones arquitectónicas, nombres de variables, preferencias del usuario.
3. La solución parcial: RAG
Para resolver el problema del conocimiento limitado aparece RAG.
Retrieval Augmented Generation.
La idea es simple:
- buscar información relevante
- inyectarla en el contexto
- dejar que el modelo responda
Arquitectura RAG
Esto permite:
- usar documentación interna
- conectar bases de conocimiento
- responder con datos actualizados
Pero RAG sigue siendo reactivo. Por eso, la arquitectura importa más de lo que parece.
LLM con herramientas: conectarse al mundo real
Un modelo solo puede responder con lo que aprendió. Si necesita información nueva o ejecutar algo, necesita herramientas (tools).
Ejemplos comunes:
WebSearchTool— buscar en internetDatabaseQueryTool— consultar bases de datosCodeExecutionTool— correr códigoFileSystemTool— leer y escribir archivosAPIRequestTool— llamar a servicios externos
El flujo cambia así:
Antes:
Con herramientas:
Ejemplo concreto: si le preguntás "¿Cuánto vale el dólar hoy?", el modelo decide usar WebSearch con query "precio dolar argentina hoy". La herramienta devuelve USD/ARS = 1060, y el LLM responde: El dólar está aproximadamente en 1060 ARS.
Ahora el modelo puede acceder al mundo real. Pero todavía no es un agente.
4. Qué es un AI Agent (y por qué es diferente)
Un AI Agent es un sistema que usa un LLM para:
- Interpretar un objetivo
- Decidir qué acciones tomar
- Usar herramientas para ejecutarlas
- Observar los resultados
- Iterar hasta completar la tarea
El ciclo de un agente:
Ejemplo práctico: si le piden buscar las 3 notebooks más baratas para programar y compararlas, un agente buscaría en distintas fuentes, filtraría por precio, revisaría specs, compararía resultados y generaría un informe. El modelo no solo responde, ejecuta un proceso completo.
Arquitectura de un agente
El modelo:
- Piensa qué hacer
- Usa una herramienta
- Observa el resultado
- Decide el siguiente paso
Esto se parece mucho más a un ciclo cognitivo.
El patrón ReAct: Reason + Act
Uno de los patrones más usados para construir agentes se llama ReAct, que combina razonamiento y ejecución en ciclos.
Ejemplo resolviendo un bug:
Cada paso agrega información al contexto. El agente aprende del resultado de sus propias acciones.
Tipos de memoria en agentes de IA
Para trabajar en problemas complejos sin perder el hilo, los agentes necesitan distintos tipos de memoria.
Memoria a corto plazo (Short-term memory)
El contexto inmediato de la tarea en curso:
- Historial reciente de la conversación
- Plan de pasos actuales
- Resultados de herramientas recientes
Memoria a largo plazo (Long-term memory)
Conocimiento persistente que sobrevive entre sesiones:
- Documentos de referencia
- Decisiones tomadas anteriormente
- Código generado y validado
- Preferencias del usuario
Las tecnologías más usadas acá son bases de datos vectoriales y knowledge graphs.
Memoria de trabajo (Working memory)
Memoria recuperada según relevancia para la tarea actual:
Esto permite trabajar con datasets mucho más grandes que el contexto del modelo, trayendo solo lo que importa en cada momento.
El anti-patrón del "God Agent" (y por qué destruye todo)
Hay un error muy común al diseñar sistemas de IA: crear un único agente que hace todo.
Análisis → Diseño → Implementación → Testing → Review
El problema es predecible: ese agente llena el 80% de su contexto antes de empezar a programar. Las decisiones tomadas al principio se vuelven inaccesibles. El agente empieza a alucinar contradicciones entre fases.
La solución es "dividir y ganar":
- Orchestrator: coordina el flujo, no ejecuta nada
- Sub-agentes especializados: cada uno recibe solo el contexto mínimo necesario (~15-20% de utilización)
- Cada fase empieza con contexto limpio, sin el ruido acumulado
Sistemas multi-agente y orquestación
Un sistema multi-agente coordina varios agentes para resolver problemas que ninguno podría resolver solo.
La evolución de cómo se organiza el contexto:
- AGENTS.md monolítico: un único archivo gigante con todas las reglas del proyecto. Se vuelve inmanejable rápido.
- Skills Router: un archivo liviano que carga dinámicamente el contexto relevante para cada tarea.
- Sub-agentes efímeros: cada fase crea un agente temporal con contexto fresco. Nace → ejecuta → reporta → muere.
- Patrón completo: Orchestrator + Skills + Sub-agentes + Memoria persistente.
Reflection Agents: la IA que se critica a sí misma
Los LLM pueden generar respuestas convincentes pero incorrectas. Una solución elegante es agregar un segundo agente que revise el resultado del primero.
Roles típicos:
- Actor: genera la solución
- Critic: evalúa la calidad, detecta errores, sugiere mejoras
- Refinement loop: el actor ajusta en base al feedback
Este patrón es especialmente útil en generación de código, análisis técnico, o cualquier output donde la corrección importa más que la velocidad.
5. Sistemas cognitivos: cuando todo se une
Un sistema cognitivo no es solo un agente con más herramientas. Es una arquitectura que combina:
- Múltiples agentes especializados
- Memoria persistente entre sesiones
- Orquestación inteligente del contexto
- Capacidad de autocrítica y refinamiento
- Skills modulares reutilizables
La idea central: las limitaciones de los LLM no se resuelven con ventanas de contexto más grandes ni con mejores prompts. Se resuelven con arquitectura.
Ejemplo de arquitectura multi‑agente
Cada agente se especializa.
El sistema completo actúa como una unidad cognitiva distribuida.
Resumen: la evolución completa
Cada paso no reemplaza al anterior: lo envuelve y lo potencia.