BrowserSkill: como dar ao Claude Code seu navegador real, com a sessão já iniciada

BrowserSkill é uma CLI e extensão open source da Tencent que permite que Claude Code, Codex ou Cursor usem seu Chrome ou Edge real, com a sessão já iniciada. O agente trabalha com suas sessões e cookies, mas em uma janela separada, então você pode continuar usando seu navegador enquanto isso.

A versão 0.3.1 da extensão e da CLI bsk foi lançada em 23 de setembro de 2026, e tudo o que segue corresponde a essa versão. O projeto ainda está em pré-1.0 e avança rapidamente: os comandos e flags podem mudar.

O que é BrowserSkill?

BrowserSkill é uma ponte local entre seu agente de programação e seu navegador. Tem três partes:

  • A CLI bsk e seu daemon. O agente executa comandos bsk no terminal. Um daemon local os envia por WebSocket em 127.0.0.1 para a extensão.
  • A extensão, para Chrome e Microsoft Edge. Abre uma Agent Window dedicada e executa as ações do agente lá. Suas janelas normais não são tocadas.
  • Um skill. É um arquivo SKILL.md que ensina seu harness de agentes a usar bsk: iniciar uma sessão, ler a página, agir e sempre fechar a sessão ao terminar.

O agente nunca fala diretamente com o navegador. Cada ação percorre CLI → daemon → extensão → Agent Window.

O README lista esses harnesses compatíveis: Cursor, Claude Code, Codex, OpenClaw, CodeBuddy, WorkBuddy, Pi, Hermes Agent e DeepSeek Harness. DeepSeek Harness usa um plugin próprio em vez do skill. Qualquer outro harness que possa executar comandos de shell pode usar o skill copiando skill/SKILL.md em sua pasta de skills como browser-skill/SKILL.md.

Por que usar seu navegador real e não um headless browser?

Porque um headless browser começa sem nenhuma sessão iniciada. Cada tarefa que toca um site com login (seu painel de administração, um ambiente de staging atrás de SSO, um dashboard SaaS, um ticket em seu gerenciador de incidências) exige contas de teste, credenciais salvas ou um fluxo de login que o agente tem que superar. BrowserSkill pula essa etapa: o agente trabalha com os sites onde você já tem a sessão iniciada. É automação de navegador para agentes de IA em um navegador autenticado, não em um navegador vazio.

Para fazer scraping de páginas públicas, executar em CI ou qualquer coisa que deva funcionar sem desktop, headless continua sendo a ferramenta certa. Cobrimos esse lado em como dar um navegador ao seu agente de IA sem carregar Chromium e em Lightpanda. BrowserSkill é para o caso oposto: automatizar o navegador com IA em tarefas que só fazem sentido dentro de sua sessão.

Como se instala BrowserSkill?

A forma recomendada é que seu próprio agente o instale. Cole esta linha em Claude Code, Codex ou Cursor:

Set up browser-skill on this machine by following https://raw.githubusercontent.com/Tencent/BrowserSkill/main/AGENT_INSTALL.md

O agente instala a CLI e o skill, e depois o guia para carregar a extensão.

Para instalá-lo manualmente:

1. Instale a CLI bsk. No macOS ou Linux:

curl -fsSL https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.sh | sh
export PATH="${BSK_INSTALL_DIR:-$HOME/.local/bin}:$PATH"

No Windows (PowerShell):

irm https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.ps1 | iex

Verifique com bsk --version. Se seu agente já estava aberto durante a instalação, pode que ainda tenha o PATH anterior: reinicie-o.

2. Instale a extensão da Chrome Web Store ou de Edge Add-ons. O README avisa que a versão das lojas pode ficar atrás da da CLI.

3. Instale o skill em seu harness:

bsk install-skill

Escolha o harness com a barra de espaço e pressione Enter. Para uma instalação não interativa, indique o harness explicitamente, por exemplo bsk install-skill --harness cursor --json.

4. Verifique. Execute bsk doctor, abra o popup da extensão e confirme que aparece como conectada.

Como se usa BrowserSkill a partir de Claude Code?

Abra uma nova sessão do agente, confirme que browser-skill está disponível e dê uma tarefa a ele. Nos harnesses com skills invocáveis por slash command:

/browser-skill abre example.com e resuma o que há na página.

Por trás dessa linha, o skill obriga o agente a seguir um ciclo fixo:

bsk session start                  # imprime um id de sessão de 4 letras
bsk navigate <url> --session <id>
bsk snapshot --session <id>        # árvore de acessibilidade com refs @e1, @e2…
bsk click @e3 --session <id>       # ou fill, select, press
bsk session stop <id>              # obrigatório, mesmo se houver erros

O agente lê as páginas primeiro com bsk snapshot e só recorre a get-html ou screenshot quando o snapshot não é suficiente. Assim gasta menos tokens, que é o mesmo argumento que usa o README do Playwright MCP, da Microsoft, para recomendar CLI + skills em vez de MCP em agentes de programação.

O que pode fazer que um navegador headless não consegue?

Reutilizar seu login. Aponte o agente para seu admin de staging, seu dashboard de análise ou a prévia de um PR atrás de SSO: já está autenticado.

Tomar emprestada uma aba que você tem aberta. Por padrão, suas próprias abas são somente leitura para o agente. Para agir sobre uma, ele precisa tomá-la emprestada de forma explícita (bsk tab borrow <tab-id> --session <id>), o que a move para a Agent Window. Por padrão, a extensão pede sua confirmação antes. A aba volta para seu lugar quando o agente executa bsk tab return ou encerra a sessão.

Passar para você o que só uma pessoa pode fazer. Quando uma tarefa encontra um CAPTCHA, um login, um código OTP ou uma ação que convém confirmar, o agente pode chamar bsk request-help com uma instrução e o elemento destacado na tela. Depois espera que você clique em Continuar ou Cancelar. O agente recebe o resultado como continued, cancelled, timed_out ou navigated.

O que há de novo no BrowserSkill 0.3?

As notas da versão 0.3.1 se comparam com a 0.2.1, então cobrem toda a série 0.3:

  • Suporte para canvas. O agente agora pode detectar elementos canvas, capturar sua região visível e clicar em pontos dentro deles. Isso importa em gráficos, editores e mapas, que são invisíveis para uma árvore de acessibilidade.
  • Capturas de página completa, a partir das ações rápidas da extensão ou a partir do CLI: bsk screenshot --session <id> --full-page --out page.png.
  • Abas de tarefa em segundo plano. As abas controladas continuam funcionando e podem ser capturadas sem passar para o primeiro plano.
  • Conexões remotas autenticadas. O agente pode rodar em um servidor enquanto a extensão controla seu navegador local. A extensão abre uma conexão de saída, então seu equipamento não precisa de portas de entrada. O pareamento usa um link único que, por padrão, expira em cinco minutos.
  • Histórico local de execução de tarefas e diagnósticos persistentes de sites.
  • Ajustes de automação no popup. «Confirmar antes de tomar emprestadas abas» e «Permitir solicitações de ajuda humana» vêm ativados por padrão. Isso muda o comportamento anterior: a flag --unattended, tab borrow --no-confirm e BSK_REQUEST_HELP=off já não pulam esses ajustes. Se você tem scripts que dependiam deles, desative os ajustes na extensão.
  • Oito idiomas novos na extensão, entre eles português do Brasil.

A versão soma nove contribuidores novos.

BrowserSkill ou Playwright MCP?

Os dois podem usar seu navegador com a sessão iniciada. O modo --extension do Playwright MCP se conecta a um Chrome ou Edge aberto através de sua própria extensão. Então a escolha depende de como cada um se comporta:

  • Interface. BrowserSkill é um CLI com um skill. Playwright MCP é um servidor MCP com um catálogo amplo de ferramentas.
  • Onde o agente trabalha. BrowserSkill sempre trabalha em uma Agent Window separada, e suas abas exigem um empréstimo explícito. Playwright MCP, por padrão, abre seu próprio perfil persistente, salvo separadamente para cada workspace e distinto do seu navegador de uso diário. Para conectá-lo ao seu navegador aberto se usa --extension.
  • Passagem para uma pessoa. No BrowserSkill é uma primitiva integrada (request-help).
  • Maturidade. Playwright MCP vem do time do Playwright e suporta Chrome, Edge, Firefox e WebKit. BrowserSkill é pré-1.0 e, por enquanto, só funciona com navegadores Chromium.

Se você já tem o Playwright MCP conectado ao seu agente e sobretudo testa suas próprias aplicações, provavelmente não precisa mudar. Se quer que o agente trabalhe ao seu lado no seu navegador de todos os dias, com uma separação clara entre suas abas e as dele, BrowserSkill foi pensado para isso.

Funciona no Windows e Firefox? É grátis?

  • Windows: sim. Funciona no macOS (Apple Silicon e Intel), Linux (x64 e ARM64) e Windows x64.
  • Firefox: ainda não. A partir de 23 de setembro de 2026, o README a marca como planejada. Chrome e Edge estão suportados, e outros navegadores Chromium devem funcionar com a versão da Chrome Web Store.
  • Preço: é grátis e tem licença MIT. O custo do modelo que seu agente usar é à parte.

É seguro dar seu navegador a um agente de IA?

É tão seguro quanto o agente que você conectar e as páginas para as quais o enviar. O maior risco aberto é o prompt injection. BrowserSkill adiciona proteções reais, mas não elimina esse risco.

O que o projeto oferece:

  • O agente trabalha em sua própria janela.
  • Tomar emprestadas suas abas requer confirmação por padrão.
  • O skill inclui limites explícitos: não ler cookies, localStorage nem cabeçalhos de autenticação para extraí-los; não executar bsk evaluate em páginas de bancos, SSO ou gerenciadores de senhas; sempre encerrar a sessão.
  • O guia de conexões remotas é direto: um servidor pareado pode agir com todas as sessões iniciadas naquele perfil do navegador. Seu conselho é parear apenas com servidores confiáveis. As permissões de pareamento podem ser listadas e revogadas (bsk daemon devices, bsk daemon revoke).

O que falta é um modelo de ameaças na capa do projeto. Uma página que o agente lê pode conter texto projetado para desviá-lo, e suas sessões iniciadas são exatamente o que um atacante procuraria. Na série 0.3, o skill foi atualizado para informar ao agente que o conteúdo das páginas é informação, nunca instruções. É uma indicação para o modelo, não algo que a ferramenta imponha.

Regras práticas:

  • Use um perfil de navegador separado para o trabalho com agentes, com sessão iniciada apenas no que o agente precisa.
  • Mantenha ativadas as duas configurações de automação até confiar em um fluxo.
  • Não mande o agente para sites que não são confiáveis enquanto tiver acesso a sessões importantes.

Vale a pena tentar?

Se seu agente fica preso uma e outra vez em telas de login, sim. A instalação guiada pelo agente é apenas uma linha, a Agent Window separada permite continuar usando seu navegador, e a primitiva de ajuda humana resolve justamente os passos que um agente não deveria fazer sozinho. Comece com um perfil dedicado e com as confirmações ativadas. Se está configurando Claude Code do zero, nosso guia para o terminal cobre o básico primeiro.