PageIndex: O Framework de RAG que Descartou Embeddings (e Alcançou 98.7% de Precisão)

Se você já construiu um pipeline de RAG, conhece a frustração: carrega um PDF na sua base de dados vetorial, corta em chunks de 500 tokens, e cruza os dedos para que o modelo de embeddings entenda qual chunk responde a pergunta. Muitas vezes não consegue — não porque o LLM seja ruim, mas porque o passo de retrieval destruiu a estrutura do documento antes que o LLM pudesse raciocinar sobre ela.

PageIndex, um framework open source de VectifyAI com mais de 29.2K estrelas no GitHub, parte de uma observação incômoda: a similaridade semântica não é a mesma coisa que relevância.


O problema com o chunking

O RAG tradicional faz duas apostas: que os documentos devem ser cortados em chunks, e que a similaridade vetorial vai destacar os corretos. Para Q&A casual sobre posts de blog, isso funciona. Para documentos profissionais — relatórios financeiros, contratos legais, especificações técnicas — costuma colapsar.

Um número em uma célula de tabela não significa nada sem seu cabeçalho de coluna. Uma nota de rodapé que referencia a Seção 4.2 é inútil se a Seção 4.2 ficou em outro chunk. O pipeline tira a estrutura hierárquica do documento — a mesma que o torna legível — e depois pede ao LLM que raciocine sobre os retaços.

VectifyAI chama isso de armadilha do “lixo entra, lixo sai”. PageIndex evita isso completamente descartando tanto o chunking quanto os embeddings.


Como funciona PageIndex

Em lugar de uma base de dados vetorial, PageIndex constrói um índice hierárquico em forma de árvore a partir do documento. Pense como um sumário inteligente: cada nó tem um título, um resumo e um intervalo de páginas. A estrutura reflete como o documento está realmente organizado — capítulos, seções, subseções, tabelas.

Quando chega uma consulta, um LLM lê a árvore e raciocina sobre quais nós têm mais probabilidade de conter a resposta. Pode seguir referências cruzadas, reconhecer quando uma pergunta com múltiplas partes exige buscar em duas seções distintas, e devolver um rastreamento completo do raciocínio mostrando exatamente quais nós visitou.

Mingtian Zhang, cofundador de VectifyAI, descreve isso como “AlphaGo para recuperação de documentos” — a mesma lógica de tree search que potencializou IAs de jogos agora navega hierarquias documentais em lugar de estados do tabuleiro. Vale esclarecer: alguns reviews apontam que a comparação com AlphaGo é um pouco exagerada — na prática é um LLM raciocínio sobre uma árvore JSON, não Monte Carlo Tree Search com redes de valor treinadas. Funciona bem independentemente do framing.

A lista de dependências reflete a simplicidade da abordagem: OpenAI SDK, PyMuPDF, tiktoken. Sem PyTorch, sem FAISS, sem base de dados vetorial. O sistema completo ronda as 2.500 linhas de Python.


O benchmark que fez levantar sobrancelhas

FinanceBench é um benchmark de Q&A financeiro sobre relatórios SEC e earnings — um dos problemas de retrieval mais difíceis em produção, que exige raciocínio multi-passo, referências cruzadas entre seções, e números exatos.

Sistema Precisão em FinanceBench
GPT-4o sozinho ~31%
Perplexity ~45%
RAG vetorial tradicional ~50–60%
PageIndex (Mafin 2.5) 98.7%

Essa diferença de quase 40–50 pontos é suficiente para que qualquer dev trabalhando em pipelines de documentos leve a sério.


Onde realmente brilha

PageIndex é projetado para documentos estruturados e profissionais onde a hierarquia importa:

  • Relatórios financeiros e filings SEC
  • Contratos legais e documentação regulatória
  • Manuais técnicos e papers acadêmicos
  • Qualquer documento onde um sumário existe por alguma razão

O bônus de rastreabilidade é real: em lugar de um score de similaridade coseno de caixa preta, você obtém um rastreamento completo do raciocínio. Para ambientes com compliance estrito — finanças, legal, saúde — poder mostrar por que o sistema recuperou uma seção particular não é um nice-to-have: é um requisito.


Onde os trade-offs são reais

É importante ser direto sobre os custos:

A indexação é mais cara. Construir a árvore exige chamadas ao LLM por documento. Para documentos que você vai consultar apenas uma ou duas vezes, o overhead pode não valer a pena.

A latência é diferente, não necessariamente mais lenta. O cofundador explica que como o retrieval ocorre em linha com a geração (em lugar de como um pré-passo bloqueante), o Time to First Token pode ser comparável a uma chamada LLM padrão. Mas o uso total de tokens por consulta é maior que o retrieval vetorial.

Não substitui a busca semântica sobre coleções grandes. As bases de dados vetoriais continuam vencendo para consultas fuzzy através de milhares de documentos. PageIndex é uma ferramenta de precisão para retrieval profundo dentro de documentos individuais.

Lacuna entre cloud e self-hosted. A versão open source usa parsing padrão de PDFs. O serviço cloud adiciona OCR melhorado e melhor tratamento de layouts complexos. Para documentos com estrutura visual pesada — PDFs escaneados, tabelas financeiras complexas — isso importa.


Como começar

pip install pageindex

O repo inclui um exemplo de RAG agentic completo usando o OpenAI Agents SDK, e há um servidor MCP para integração direta com agentes — compatível com Claude Code ou qualquer tool que suporte MCP.

Para equipes que já têm pipelines de RAG sobre documentos financeiros ou legais e estão batendo em limites de precisão, PageIndex merece uma avaliação séria. Para Q&A de propósito geral sobre coleções mistas e grandes, seu setup vetorial atual provavelmente continua sendo a decisão correta.

GitHub: VectifyAI/PageIndex
Plataforma cloud: pageindex.ai


Você está construindo pipelines de RAG no seu trabalho? Que tipo de documentos gera mais dores de cabeça para você com as abordagens tradicionais?