FreeToken permite executar modelos locais que superam a VRAM da sua GPU ao combinar memória gráfica, RAM do sistema e processamento em CPU.
É um mecanismo de inferência de código aberto com licença Apache-2.0, um aplicativo de desktop e uma interface de linha de comando. Para desenvolvedores, uma de suas funcionalidades mais úteis é o servidor local: oferece endpoints compatíveis com as APIs da OpenAI e Anthropic aos quais você pode conectar clientes existentes. Repositório oficial
A pergunta prática é qual modelo sua máquina completa consegue suportar e como ela responderá durante o trabalho real.
Como o FreeToken executa um modelo que supera a VRAM?
O FreeToken mantém um conjunto de especialistas do modelo na RAM do sistema e utiliza a memória da GPU como cache, distribuindo o trabalho entre a execução em CPU e as transferências para a GPU.
Isso é especialmente útil com modelos Mixture-of-Experts, ou MoE. Esses ativam apenas uma parte de seus parâmetros para cada token, mas o conjunto completo de especialistas ainda precisa de armazenamento. Ter menos parâmetros ativos reduz o cálculo; os pesos restantes ainda ocupam espaço.
O FreeToken também aborda o processamento repetido de prompts durante sessões de agentes, onde as chamadas de ferramentas e mudanças no histórico podem forçar o recálculo de parte do contexto. Seu design combina o cache de especialistas com a reutilização de contexto já processado. Artigo técnico
Que hardware o FreeToken precisa?
Para instalar a CLI pelo procedimento documentado, você precisa de Linux x86_64, uma GPU NVIDIA e um ambiente CUDA compatível.
Em 11 de setembro de 2026, o guia de instalação especifica:
- Driver NVIDIA r580 ou posterior.
- CUDA 13, incluindo o toolkit com
nvccdisponível no seuPATHpara compilar os kernels no primeiro uso. - Python 3.10 ou posterior.
Não há uma quantidade única de RAM que sirva para todos os modelos. O checkpoint escolhido, sua precisão e a carga de trabalho determinam a memória necessária. Revise a RAM do sistema e o armazenamento disponível juntamente com a VRAM antes de escolher um modelo. Guia de instalação
O artigo técnico mostra por que essa distinção importa: o servidor de teste com uma RTX 5090 combina 32 GB de VRAM com 180 GiB de RAM do sistema. Várias comparações entre GPUs usam servidores alugados com execução em CPU limitada para aproximar a largura de banda de um equipamento de consumo. Uma avaliação usar uma GPU de consumo não significa que o equipamento completo seja equivalente ao seu PC. Ambiente de avaliação
O FreeToken funciona no Windows ou Mac?
O README oferece um aplicativo de desktop para Windows e Linux; o guia de instalação da CLI documenta Linux.
São vias de instalação distintas. Em 11 de setembro de 2026, a documentação citada não fornece um procedimento de instalação para macOS. Siga as instruções da via que você vai usar: os comandos do Linux não podem ser transferidos automaticamente para qualquer plataforma. Informações sobre o aplicativo de desktop
Se você usa Apple Silicon, também pode consultar nossa cobertura do Swiftlet.
Como instalar o FreeToken no Linux?
Uma vez atendidos os requisitos de hardware e CUDA, crie um ambiente Python e instale o pacote com suas dependências de aceleração.
O projeto recomenda usar uv:
uv venv && source .venv/bin/activate
uv pip install "freetoken[accel]"
Verifique se a CLI está disponível:
ft --version
Esses comandos vêm do guia oficial de instalação. Instalar o pacote não baixa automaticamente um modelo apropriado nem confirma que seus pesos cabem em sua máquina.
Como usar o FreeToken como servidor local?
Inicie o servidor com um checkpoint compatível e consulte qual identificador de modelo ele expõe.
O seguinte é o exemplo documentado pelo projeto. Em 11 de setembro de 2026, a lista de modelos compatíveis inclui esse checkpoint do Qwen; o caminho assume que você já o salvou nesse diretório:
ft serve --model ~/models/Qwen3.6-35B-A3B
Quando o servidor estiver pronto, consulte sua lista de modelos:
curl http://127.0.0.1:1919/v1/models
Use o identificador retornado em seu cliente. O guia de início documenta endpoints compatíveis com OpenAI e Anthropic. Consulte a lista atual de modelos compatíveis antes de baixar os pesos. Em 11 de setembro de 2026, os checkpoints multimodais são servidos apenas como texto. Guia de início
Como avaliar o desempenho do FreeToken em seu equipamento?
Meça o tempo até o primeiro token e a responsividade durante vários turnos com uma carga de trabalho semelhante à sua.
Os autores reportam melhorias de desempenho, mas são benchmarks do próprio projeto, sem validação independente nesta nota. Sua avaliação distingue a velocidade de geração do tempo até o primeiro token e não compara o tempo total para completar tarefas entre mecanismos, porque os agentes seguem trajetórias distintas. Gerar tokens mais rápido não é suficiente para demonstrar que um agente termina seu trabalho antes. Metodologia de avaliação
Comece com um checkpoint compatível cujos requisitos você possa atender com margem. Teste um prompt curto, uma entrada mais longa e uma sequência de perguntas de acompanhamento. Registre o modelo, a precisão, a RAM, a GPU e as esperas observadas.
O valor prático do FreeToken está em oferecer outra forma de aproveitar os recursos combinados de sua máquina. A decisão de incorporá-lo ao seu fluxo de trabalho deve depender de como ele resolve suas tarefas reais.