Como instalar Caveman no Claude Code, a skill que faz sua IA falar como um homem das cavernas

Julius Brussee é um estudante universitário holandês. Seu pai é Arjan Brussee — co-criador de Jazz Jackrabbit, veterano do desenvolvimento de videojogos. O filho herdou o instinto. Semana passada, Julius publicou um repo do GitHub de uma única linha com o tagline “why use many token when few token do trick” e acordou alguns dias depois descobrindo-o em tendência #1 no GitHub e encabeçando a discussão do Hacker News.

O repo se chama caveman. No momento em que escrevo isso, já superou as 14.000 estrelas e continua subindo.

A premissa é quase absurdamente simples: Claude Code (e a maioria dos agentes de código baseados em LLMs) são treinados para serem verbosos e corteses. Dizem “Claro! Com muito prazer te ajudo com isso. O problema que você está experimentando provavelmente se deve a…” antes de chegar à resposta real. Cada uma dessas palavras custa tokens. Caveman as elimina todas.


O que o Caveman faz exatamente

Caveman é uma skill de Claude Code — um arquivo de instruções em texto simples que muda como Claude formata suas respostas em prosa. A lógica central é direta:

Fora: artigos (a/an/the), palavras de preenchimento (just, really, basically, actually, simply), frases de cortesia (sure, certainly, of course, happy to help), linguagem de cobertura.

Dentro: respostas diretas. Padrão: [coisa] [ação] [razão]. [próximo passo].

A decisão crítica de design: o conteúdo técnico passa sem alterações. Blocos de código, caminhos de arquivos, URLs, comandos, números de versão, mensagens de erro — nada disso é comprimido. Apenas a explicação em prosa ao redor deles recebe o tratamento cavernícola.

O exemplo canônico do README:

Antes (Claude normal):

“The reason your React component is re-rendering is likely because you’re creating a new object reference on each render cycle. When you pass an inline object as a prop, React’s shallow comparison sees it as a different object every time, which triggers a re-render. I’d recommend using useMemo to memoize the object.”

Depois (caveman full):

“New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.”

Mesma solução. Mesma informação. Fração dos tokens.


Três modos (mais Chinês Clássico)

Caveman inclui três níveis de compressão para inglês:

Modo O que faz
/caveman lite Remove preenchimento e cortesias. Frases completas, artigos preservados.
/caveman full Caveman completo. Sem artigos, fragmentos OK, sinônimos curtos.
/caveman ultra Compressão máxima. Abreviações (DB, auth, fn, impl), setas para causalidade (X → Y), uma palavra quando uma palavra alcança.

E sim — o repo também inclui três modos wenyan (compressão literária em Chinês Clássico), porque aparentemente a fala cavernícola e o chinês escrito de 2.500 anos atrás são ambos extremamente eficientes em tokens. wenyan-ultra relata 80-90% de redução de caracteres mantendo todo o significado técnico.


O lado do input: caveman-compress

A skill cuida da compressão do output. Mas caveman também inclui uma ferramenta separada — caveman-compress — que cuida da compressão do input.

A ideia: seu CLAUDE.md é carregado no início de cada sessão de Claude Code. Se tiver 1.500 palavras de instruções verbosas, você está pagando overhead de tokens em cada sessão. Caveman-compress o reescreve em fala cavernícola comprimida, preservando o original como CLAUDE.md.original.md para que você possa ler e editar sem problemas.

O repo afirma ~45% de redução em tokens de input por sessão com esta abordagem. Seu CLAUDE.md se torna um problema de Claude ler rapidamente, enquanto você conserva a versão legível por humanos.


Os números de tokens: no que acreditar

O repo afirma 65-75% de redução em tokens de output. Benchmarks independentes sobre tarefas reais de coding mediram economias mais modestas mas genuínas — aproximadamente 14-21%. O projeto inclui sua própria suíte de avaliação (uv run python evals/llm_run.py) para que você possa medir com sua carga de trabalho específica.

O framing honesto do próprio README: “Caveman não faz o cérebro ficar menor. Caveman faz a boca ficar menor. O maior ganho é a legibilidade e a velocidade, economias de custo são um bônus.”

Há também uma referência de pesquisa real aqui. Um artigo de março de 2026 intitulado “Brevity Constraints Reverse Performance Hierarchies in Language Models” descobriu que restringir modelos grandes a respostas breves melhorou a precisão em 26 pontos percentuais em certos benchmarks e reverteu completamente os rankings de desempenho entre modelos. Em outras palavras: fazer Claude se calar pode torná-lo mais inteligente, não apenas mais barato.


Como instalar CAVEMAN no Claude Code?

Como plugin de Claude Code (recomendado — inclui hooks que ativam caveman automaticamente ao iniciar a sessão):

claude plugin marketplace add JuliusBrussee/caveman
claude plugin install caveman@caveman

Ou apenas como skill (sem hooks de auto-carga):

npx skills add JuliusBrussee/caveman

Uma vez instalado, você o ativa em sua sessão com /caveman, /caveman lite, /caveman full, ou /caveman ultra. A versão com hooks se ativa automaticamente.

Para usuários de Codex: clone o repo → abra Codex no projeto → /plugins → procure por Caveman → Install.


Por que se tornou viral

A mecânica importa menos do que o ponto mais amplo que caveman expôs: a verbosidade da IA tem um custo real, e esse custo vem sendo absorvido silenciosamente. A maioria dos devs não monitora o uso de tokens por sessão — simplesmente aparece na fatura. Caveman tornou isso visível ao tornar a compressão tão agressiva que fica engraçada.

Altingir as 14.000 estrelas em menos de uma semana significa que a dor era real e amplamente compartilhada. E que um estudante universitário o publicasse como um arquivo .skill de texto simples — não um produto SaaS, não uma extensão de browser, não uma ferramenta paga — é exatamente o tipo de coisa que faz um bom post no Hacker News.

A pergunta mais profunda que abriu a discussão: os LLMs são treinados para serem verbosos porque a verbosidade sinaliza esforço aos avaliadores humanos durante o RLHF? Se for assim, caveman é um workaround para um artefato de treinamento, não uma correção de bug. Essa é uma conversa mais interessante do que a economia de tokens em si.


Você já experimentou caveman em suas sessões de Claude Code? Quanto você economiza em tokens com seu caso de uso real? Compartilhe nos comentários :backhand_index_pointing_down: