Se você já construiu um pipeline de RAG, conhece a frustração: carrega um PDF na sua base de dados vetorial, corta em chunks de 500 tokens, e cruza os dedos para que o modelo de embeddings entenda qual chunk responde a pergunta. Muitas vezes não consegue — não porque o LLM seja ruim, mas porque o passo de retrieval destruiu a estrutura do documento antes que o LLM pudesse raciocinar sobre ela.
PageIndex, um framework open source de VectifyAI com mais de 29.2K estrelas no GitHub, parte de uma observação incômoda: a similaridade semântica não é a mesma coisa que relevância.
O problema com o chunking
O RAG tradicional faz duas apostas: que os documentos devem ser cortados em chunks, e que a similaridade vetorial vai destacar os corretos. Para Q&A casual sobre posts de blog, isso funciona. Para documentos profissionais — relatórios financeiros, contratos legais, especificações técnicas — costuma colapsar.
Um número em uma célula de tabela não significa nada sem seu cabeçalho de coluna. Uma nota de rodapé que referencia a Seção 4.2 é inútil se a Seção 4.2 ficou em outro chunk. O pipeline tira a estrutura hierárquica do documento — a mesma que o torna legível — e depois pede ao LLM que raciocine sobre os retaços.
VectifyAI chama isso de armadilha do “lixo entra, lixo sai”. PageIndex evita isso completamente descartando tanto o chunking quanto os embeddings.
Como funciona PageIndex
Em lugar de uma base de dados vetorial, PageIndex constrói um índice hierárquico em forma de árvore a partir do documento. Pense como um sumário inteligente: cada nó tem um título, um resumo e um intervalo de páginas. A estrutura reflete como o documento está realmente organizado — capítulos, seções, subseções, tabelas.
Quando chega uma consulta, um LLM lê a árvore e raciocina sobre quais nós têm mais probabilidade de conter a resposta. Pode seguir referências cruzadas, reconhecer quando uma pergunta com múltiplas partes exige buscar em duas seções distintas, e devolver um rastreamento completo do raciocínio mostrando exatamente quais nós visitou.
Mingtian Zhang, cofundador de VectifyAI, descreve isso como “AlphaGo para recuperação de documentos” — a mesma lógica de tree search que potencializou IAs de jogos agora navega hierarquias documentais em lugar de estados do tabuleiro. Vale esclarecer: alguns reviews apontam que a comparação com AlphaGo é um pouco exagerada — na prática é um LLM raciocínio sobre uma árvore JSON, não Monte Carlo Tree Search com redes de valor treinadas. Funciona bem independentemente do framing.
A lista de dependências reflete a simplicidade da abordagem: OpenAI SDK, PyMuPDF, tiktoken. Sem PyTorch, sem FAISS, sem base de dados vetorial. O sistema completo ronda as 2.500 linhas de Python.
O benchmark que fez levantar sobrancelhas
FinanceBench é um benchmark de Q&A financeiro sobre relatórios SEC e earnings — um dos problemas de retrieval mais difíceis em produção, que exige raciocínio multi-passo, referências cruzadas entre seções, e números exatos.
| Sistema | Precisão em FinanceBench |
|---|---|
| GPT-4o sozinho | ~31% |
| Perplexity | ~45% |
| RAG vetorial tradicional | ~50–60% |
| PageIndex (Mafin 2.5) | 98.7% |
Essa diferença de quase 40–50 pontos é suficiente para que qualquer dev trabalhando em pipelines de documentos leve a sério.
Onde realmente brilha
PageIndex é projetado para documentos estruturados e profissionais onde a hierarquia importa:
- Relatórios financeiros e filings SEC
- Contratos legais e documentação regulatória
- Manuais técnicos e papers acadêmicos
- Qualquer documento onde um sumário existe por alguma razão
O bônus de rastreabilidade é real: em lugar de um score de similaridade coseno de caixa preta, você obtém um rastreamento completo do raciocínio. Para ambientes com compliance estrito — finanças, legal, saúde — poder mostrar por que o sistema recuperou uma seção particular não é um nice-to-have: é um requisito.
Onde os trade-offs são reais
É importante ser direto sobre os custos:
A indexação é mais cara. Construir a árvore exige chamadas ao LLM por documento. Para documentos que você vai consultar apenas uma ou duas vezes, o overhead pode não valer a pena.
A latência é diferente, não necessariamente mais lenta. O cofundador explica que como o retrieval ocorre em linha com a geração (em lugar de como um pré-passo bloqueante), o Time to First Token pode ser comparável a uma chamada LLM padrão. Mas o uso total de tokens por consulta é maior que o retrieval vetorial.
Não substitui a busca semântica sobre coleções grandes. As bases de dados vetoriais continuam vencendo para consultas fuzzy através de milhares de documentos. PageIndex é uma ferramenta de precisão para retrieval profundo dentro de documentos individuais.
Lacuna entre cloud e self-hosted. A versão open source usa parsing padrão de PDFs. O serviço cloud adiciona OCR melhorado e melhor tratamento de layouts complexos. Para documentos com estrutura visual pesada — PDFs escaneados, tabelas financeiras complexas — isso importa.
Como começar
pip install pageindex
O repo inclui um exemplo de RAG agentic completo usando o OpenAI Agents SDK, e há um servidor MCP para integração direta com agentes — compatível com Claude Code ou qualquer tool que suporte MCP.
Para equipes que já têm pipelines de RAG sobre documentos financeiros ou legais e estão batendo em limites de precisão, PageIndex merece uma avaliação séria. Para Q&A de propósito geral sobre coleções mistas e grandes, seu setup vetorial atual provavelmente continua sendo a decisão correta.
→ GitHub: VectifyAI/PageIndex
→ Plataforma cloud: pageindex.ai
Você está construindo pipelines de RAG no seu trabalho? Que tipo de documentos gera mais dores de cabeça para você com as abordagens tradicionais?
