
Por qué tus agentes de IA necesitan una capa de memoria (y por qué el modelo no es el foso)
Karpathy describió los LLM como un nuevo sistema operativo: el modelo es la CPU y el contexto es la RAM. Pero ningún ordenador serio se queda sin disco. La memoria persistente es la capa que falta.
Construir sobre LLMs hoy se parece a programar contra una CPU sin disco duro. Andrej Karpathy lo dijo de forma explícita en 2023: los grandes modelos de lenguaje se comportan como un nuevo tipo de sistema operativo, donde el modelo es la CPU y la ventana de contexto es la RAM. La analogía es útil precisamente por lo que deja fuera: el almacenamiento persistente.
Sin esa capa, cada ejecución de tu agente arranca en frío. Re-embebes los mismos documentos, vuelves a meter el mismo contexto en el prompt y pagas los mismos tokens, una y otra vez.

El contexto no escala metiéndolo todo en el prompt
La respuesta ingenua —"meto todo en el contexto, ya caben millones de tokens"— no escala por tres razones:
- Coste: rellenar la ventana en cada llamada multiplica el gasto de tokens de forma lineal con el uso.
- Latencia: prompts gigantes son prompts lentos.
- Precisión: más contexto irrelevante diluye la atención del modelo. Recuperar lo correcto bate a recuperar todo.
Lo que necesitas no es un contexto más grande. Es recuperación selectiva de la memoria correcta en el momento correcto, con su procedencia.
El modelo no es el foso
Si tu producto depende de que GPT sea mejor que Claude esta semana, no tienes foso: tienes una integración. Los modelos convergen y se vuelven intercambiables. Lo que no es intercambiable es el conocimiento estructurado del dominio de tu usuario: sus decisiones, sus documentos, su historial, conectados en un grafo de hechos con citas.
Esa capa es independiente del modelo por diseño. Cambias de proveedor y tu memoria sigue ahí.
Qué hace MemoryFirst
MemoryFirst es esa capa de memoria, servida como API e implementación de MCP:
- Ingesta correos, documentos, llamadas, código y eventos operativos y los estructura en un grafo de hechos.
- Recupera con búsqueda densa + BM25 + grafo, fusión RRF y reranking cross-encoder, y devuelve la respuesta con citas verificables (el párrafo, el minuto, el mensaje exacto).
- Se mantiene al día: la información contradictoria se resuelve hacia la verdad más reciente en vez de devolver ambas versiones.
- Independiente del modelo: API compatible con OpenAI y servidor MCP (stdio, HTTP, SSE), así cualquier agente —Claude, Cursor, ChatGPT— la lee.
Los modelos se vuelven intercambiables; lo que no lo es, es el conocimiento estructurado y verificable de tu negocio.
El patrón AI-first para developers
Construir AI-first no es añadir un wrapper de chat. Es diseñar tu sistema para que acumule contexto en vez de descartarlo. Das al agente un disco: una capa de memoria persistente, auditable y portable entre modelos. El modelo es un commodity. La memoria es tuya.
Empieza con la documentación o conecta el servidor MCP en una tarde.
Dale memoria a tus agentes.
La capa de memoria para IA: API compatible con OpenAI + MCP, con citas y datos en la UE.
Empezar gratis