Qué hardware necesitas para ejecutar modelos locales con FreeToken

FreeToken permite ejecutar modelos locales que superan la VRAM de tu GPU al combinar memoria gráfica, RAM del sistema y procesamiento en CPU.

Es un motor de inferencia de código abierto con licencia Apache-2.0, una aplicación de escritorio y una interfaz de línea de comandos. Para los desarrolladores, una de sus funciones más útiles es el servidor local: ofrece endpoints compatibles con las API de OpenAI y Anthropic a los que puedes conectar clientes existentes. Repositorio oficial

La pregunta práctica es qué modelo puede soportar tu máquina completa y cómo responderá durante el trabajo real.

¿Cómo ejecuta FreeToken un modelo que supera la VRAM?

FreeToken mantiene un conjunto de expertos del modelo en la RAM del sistema y utiliza la memoria de la GPU como caché, repartiendo el trabajo entre la ejecución en CPU y las transferencias hacia la GPU.

Esto resulta especialmente útil con los modelos Mixture-of-Experts, o MoE. Estos activan solo una parte de sus parámetros para cada token, pero el conjunto completo de expertos sigue necesitando almacenamiento. Tener menos parámetros activos reduce el cálculo; los pesos restantes siguen ocupando espacio.

FreeToken también aborda el procesamiento repetido de prompts durante las sesiones de agentes, donde las llamadas a herramientas y los cambios en el historial pueden obligar a recalcular parte del contexto. Su diseño combina la caché de expertos con la reutilización de contexto ya procesado. Artículo técnico

¿Qué hardware necesita FreeToken?

Para instalar la CLI mediante el procedimiento documentado, necesitas Linux x86_64, una GPU NVIDIA y un entorno CUDA compatible.

Al 11 de septiembre de 2026, la guía de instalación especifica:

  • Driver NVIDIA r580 o posterior.
  • CUDA 13, incluido el toolkit con nvcc disponible en tu PATH para compilar los kernels en el primer uso.
  • Python 3.10 o posterior.

No hay una cantidad única de RAM que sirva para todos los modelos. El checkpoint elegido, su precisión y la carga de trabajo determinan la memoria necesaria. Revisa la RAM del sistema y el almacenamiento disponible junto con la VRAM antes de elegir un modelo. Guía de instalación

El artículo técnico muestra por qué importa esa distinción: el servidor de pruebas con una RTX 5090 combina 32 GB de VRAM con 180 GiB de RAM del sistema. Varias comparaciones entre GPU utilizan servidores alquilados con la ejecución en CPU limitada para aproximar el ancho de banda de un equipo de consumo. Que una prueba utilice una GPU de consumo no significa que el equipo completo sea equivalente a tu PC. Entorno de evaluación

¿FreeToken funciona en Windows o Mac?

El README ofrece una aplicación de escritorio para Windows y Linux; la guía de instalación de la CLI documenta Linux.

Son vías de instalación distintas. Al 11 de septiembre de 2026, la documentación citada no proporciona un procedimiento de instalación para macOS. Sigue las instrucciones de la vía que vayas a utilizar: los comandos de Linux no se pueden trasladar automáticamente a cualquier plataforma. Información sobre la aplicación de escritorio

Si utilizas Apple Silicon, puedes consultar también nuestra cobertura de Swiftlet.

¿Cómo instalar FreeToken en Linux?

Una vez cumplidos los requisitos de hardware y CUDA, crea un entorno de Python e instala el paquete con sus dependencias de aceleración.

El proyecto recomienda utilizar uv:

uv venv && source .venv/bin/activate
uv pip install "freetoken[accel]"

Comprueba que la CLI está disponible:

ft --version

Estos comandos proceden de la guía oficial de instalación. Instalar el paquete no descarga por sí solo un modelo adecuado ni confirma que sus pesos quepan en tu máquina.

¿Cómo usar FreeToken como servidor local?

Inicia el servidor con un checkpoint compatible y consulta qué identificador de modelo expone.

El siguiente es el ejemplo documentado por el proyecto. Al 11 de septiembre de 2026, la lista de modelos compatibles incluye este checkpoint de Qwen; la ruta supone que ya lo has guardado en ese directorio:

ft serve --model ~/models/Qwen3.6-35B-A3B

Cuando el servidor esté listo, consulta su lista de modelos:

curl http://127.0.0.1:1919/v1/models

Utiliza el identificador devuelto en tu cliente. La guía de inicio documenta endpoints compatibles con OpenAI y Anthropic. Consulta la lista actual de modelos compatibles antes de descargar los pesos. Al 11 de septiembre de 2026, los checkpoints multimodales se sirven únicamente como texto. Guía de inicio

¿Cómo evaluar el rendimiento de FreeToken en tu equipo?

Mide el tiempo hasta el primer token y la capacidad de respuesta durante varios turnos con una carga de trabajo parecida a la tuya.

Los autores reportan mejoras de rendimiento, pero son benchmarks del propio proyecto, sin validación independiente en esta nota. Su evaluación distingue la velocidad de generación del tiempo hasta el primer token y no compara el tiempo total para completar tareas entre motores, porque los agentes siguen trayectorias distintas. Generar tokens más rápido no basta para demostrar que un agente termina antes tu trabajo. Metodología de evaluación

Empieza con un checkpoint compatible cuyos requisitos puedas cumplir con margen. Prueba un prompt corto, una entrada más larga y una secuencia de preguntas de seguimiento. Registra el modelo, la precisión, la RAM, la GPU y las esperas observadas.

El valor práctico de FreeToken está en ofrecerte otra forma de aprovechar los recursos combinados de tu máquina. La decisión de incorporarlo a tu flujo de trabajo debería depender de cómo resuelva tus tareas reales.