Agentmemory: Memória Persistente para Claude Code — 92% Menos Tokens

Já aconteceu com você. Sessão um, você explica toda sua arquitetura de autenticação para o Claude Code. Sessão dois, está explicando de novo. Seu CLAUDE.md começou com 20 linhas e agora tem 300 — um monstro que se despeja inteiro no contexto independentemente de você precisar ou não. No segundo mês de uso sério, esse arquivo só está custando 22.000+ tokens por sessão, e a maioria é informação desatualizada.

agentmemory é a solução. É uma camada de memória local que roda como servidor MCP junto ao seu agente, captura silenciosamente o que o agente faz, comprime essas observações em memórias estruturadas e pesquisáveis, e injeta apenas o contexto relevante no início de cada nova sessão.

O benchmark que o tornou tendência esta semana: com 240 observações, um CLAUDE.md despeja 22.000+ tokens no contexto. agentmemory usa ~1.900 — uma redução de 92%. As mesmas observações. O mesmo histórico. Apenas recuperação mais inteligente.

Por que esses 22.000 tokens são pagos em cada sessão e não uma única vez? A resposta está em O que são tokens em IA e por que eles cobram por eles, que explica a base de faturamento sobre a qual se apoia toda a economia desta nota.

O problema que resolve

Os LLMs são stateless por design. Cada sessão começa do zero. Os workarounds que os desenvolvedores construíram — arquivos CLAUDE.md, .cursorrules, o ritual de colar-seu-contexto-aqui — compartilham o mesmo defeito: são manuais, crescem sem limite e carregam tudo independentemente da relevância.

agentmemory segue um caminho diferente. Em vez de um arquivo plano, constrói um store de memória indexado. Captura decisões, incidentes, arquivos tocados, abordagens que falharam e resultados de ferramentas. Quando uma nova sessão começa, recupera apenas o relevante para a tarefa atual — não tudo o que você fez alguma vez.

A diferença na prática: se na segunda-feira você configurou autenticação JWT e escolheu jose sobre jsonwebtoken por compatibilidade com Edge, na quinta-feira seu agente já sabe. Você não re-explica. Não cola. Simplesmente sabe.

Como funciona

agentmemory roda como servidor local (padrão: localhost:3111) com um visualizador em localhost:3113. A configuração é um único comando:

npx @agentmemory/agentmemory

Para Claude Code especificamente, se integra via hooks — o mesmo mecanismo que Claude Code usa para callbacks pré/pós execução de ferramentas. Uma vez instalado, captura automaticamente eventos do ciclo de sessão, chamadas de ferramentas, mensagens e resultados de tarefas sem nenhuma mudança no seu fluxo de trabalho.

O motor de memória usa recuperação híbrida: busca por palavras-chave BM25 + embeddings vetoriais + uma camada de knowledge graph para relações entre entidades. Um ciclo de compressão por hora mescla observações duplicadas, reduz entradas obsoletas com scoring de retenção e gera um audit trail limpo. No benchmark LongMemEval-S, este pipeline alcança 95,2% R@5 — a memória correta aparece entre os 5 primeiros resultados 95% do tempo.

Os embeddings vetoriais rodam localmente usando @xenova/transformers, o que significa zero chamadas externas a APIs para operações de memória e um custo estimado de ~$10/ano com modelos na nuvem, ou grátis com inferência local.

Compatibilidade com agentes

Aqui é onde agentmemory se diferencia das soluções específicas para Claude. Funciona com qualquer agente que fale MCP ou HTTP — o que em 2026 significa praticamente tudo:

Claude Code, Cursor, Codex CLI, Gemini CLI, Windsurf, Kilo Code, OpenCode, Cline, Roo Code, Goose, Aider, Hermes e OpenClaw têm integrações confirmadas. Um servidor, memórias compartilhadas entre todos eles. Se você trocar de ferramenta no meio de um projeto, sua memória o acompanha.

A REST API (/agentmemory/*) permite que qualquer agente sem suporte nativo de MCP igualmente consulte o store de memória via HTTP.

O que se recorda

agentmemory foi projetado especificamente para memória operacional — não histórico de chat. A distinção importa.

Captura: decisões de arquitetura, escolhas de dependências e sua justificativa, bugs conhecidos e seus fixes, restrições de deployment, estado de cobertura de testes, localizações de componentes chave e abordagens que falharam (para que seu agente não tente o mesmo caminho quebrado duas vezes).

A camada de knowledge graph extrai entidades e relações dessas observações. Você pode consultar o grafo em /agentmemory/graph ou visualizá-lo no visualizador. As arestas temporais são suportadas, assim o sistema não apenas sabe o quê foi decidido, mas quando — útil para rastrear como sua arquitetura evoluiu.

Para usuários existentes de Claude Code, há importação JSONL: aponte agentmemory para seus arquivos de transcrição do Claude Code e rehidrate o histórico completo de sessões — observações, usos de ferramentas, cronograma — ao store de memória.

Um aviso honesto

Uma limitação conhecida que vale a pena mencionar: o plugin atualmente envia tokens de autenticação sobre HTTP plano (issue #275, aberto). O binding padrão para localhost contém essa exposição para a maioria dos casos de uso, mas se você está expondo a REST API além de uma única máquina — por exemplo, em um setup de equipe ou atrás de um reverse proxy — você vai querer TLS e uma revisão de autenticação antes de ir por esse caminho. O projeto é ativo e isso está no roadmap.

Os benchmarks destacados (92% de redução de tokens, 95,2% R@5) são medidos sobre o pipeline próprio de agentmemory e sua suite de testes (LongMemEval-S). Competidores como Mem0 publicam números em conjuntos de avaliação diferentes, então as comparações diretas não são maçã com maçã. Considere os números como solidamente direcionais, não como um leaderboard entre ferramentas.

Para começar

# Inicie o servidor de memória
npx @agentmemory/agentmemory

# Visualizador disponível em http://localhost:3113
# Servidor MCP disponível em http://localhost:3111

Para Claude Code, o instalador lida com o registro de hooks automaticamente, escrevendo os comandos necessários em ~/.claude/settings.json. Para outros agentes, verifique o repo para os guias de integração por ferramenta — a maioria tem pastas de plugin dedicadas com READMEs de configuração.

O projeto é 100% open source, ultrapassou 5.000 estrelas no GitHub em suas duas primeiras semanas, e tem uma comunidade ativa de contribuidores com 654 testes passando no momento desta publicação.

GitHub: github.com/rohitg00/agentmemory
Site: agent-memory.dev