---
title: "FreeToken AI: hardware, benchmarks e instalación"
canonical: https://wavect.io/es/blog/freetoken-ai-inference-engine-review/
language: es
description: "FreeToken AI reparte grandes modelos MoE entre GPU, CPU y RAM. Revisa hardware, benchmarks, instalación, límites y uso en producción."
image: "https://wavect.io/img/blog/headers/header_freetoken-ai-inference-engine-review.png"
---

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

14 min de lectura · 25 de agosto de 2026 Última revisión 25 de agosto de 2026

[**Siguiente**](/es/blog/airllm-layer-wise-inference-low-vram/)

# Análisis de FreeToken AI: ¿modelos MoE frontier en una GPU doméstica?

Resumen

FreeToken es un motor de inferencia de FlashML con licencia Apache 2.0 para ejecutar grandes modelos Mixture-of-Experts entre una GPU NVIDIA, CPU, RAM y PCIe. Sus autores reportan 39,3 tokens por segundo con Qwen3.6-35B-A3B en un portátil RTX 4060 de 8 GB y entre 22 y 25 tokens por segundo con DeepSeek-V4-Flash en una RTX 5090. Son resultados del paper del proyecto, no benchmarks de Wavect. La CLI actual requiere Linux x86_64, una GPU NVIDIA, driver r580 o posterior, CUDA 13 y Python 3.10 o posterior. FreeToken puede eliminar la factura por token de una API, pero no los costes de hardware, RAM, almacenamiento, electricidad, operaciones o validación del modelo. Haz un piloto cuando un MoE compatible supere tu eval y el control local o el uso sostenido justifiquen la infraestructura.

**FreeToken es un nuevo motor de inferencia open source que ejecuta grandes modelos Mixture-of-Experts repartiendo el trabajo entre los recursos de un solo ordenador.** Usa la VRAM como caché rápida de expertos, mantiene el pool completo en la RAM y divide el trabajo restante entre transferencias PCIe y ejecución en CPU. Así puede hacer utilizables a velocidad interactiva ciertos modelos que no caben en la GPU, siempre que el sistema NVIDIA sea compatible.

Este artículo analiza el proyecto de FlashML en `FlashML-org/FreeToken`, no servicios de tokens o SDK con nombres parecidos. Lo revisamos el **25 de agosto de 2026**. Su intención principal es responder una decisión concreta sobre FreeToken AI: requisitos de hardware, instalación, benchmarks de los autores, límites y encaje comercial. Para saber qué modelo cabe en un equipo, consulta nuestra [guía de hardware para LLM locales](/es/blog/llmfit-local-llm-hardware-guide/).

| Pregunta | Respuesta corta |
| --- | --- |
| ¿FreeToken es gratis? | El motor es open source con licencia Apache 2.0. Hardware, RAM, almacenamiento, electricidad y operaciones no son gratis. |
| ¿Entrega tokens de API gratis? | No. Sirve modelos open-weight en tu propio equipo, por lo que una petición local no genera una factura por token del proveedor. |
| ¿Qué hardware necesita la CLI? | Actualmente Linux x86_64, GPU NVIDIA, driver r580 o posterior, CUDA 13, Python 3.10 o posterior y suficiente RAM y almacenamiento para el checkpoint. |
| ¿Quién debería probarlo? | Equipos que evalúan un MoE compatible para coding agents, automatización privada, investigación o inferencia local sostenida. |
| ¿Quién debería esperar? | Usuarios de Apple Silicon o AMD, equipos que necesitan operaciones multiusuario maduras y compradores sin evals de modelo y coste por tarea. |

## ¿Qué es FreeToken AI?

FreeToken es un runtime edge-native de FlashML. El [repositorio oficial de FreeToken en GitHub](https://github.com/FlashML-org/FreeToken) describe soporte para portátiles, ordenadores gaming y GPU de workstation, además de endpoints compatibles con OpenAI y Anthropic para coding agents y agentes con herramientas. El código usa licencia Apache 2.0.

El proyecto se centra en modelos MoE sparse. Un checkpoint MoE contiene muchas redes expertas, pero el router solo activa una fracción por token. El cálculo necesario para un token puede ser mucho menor que el total de parámetros. El problema es la memoria: todos los expertos deben residir en algún sitio aunque la mayoría esté inactiva.

FreeToken trata el ordenador completo como un sistema de inferencia. Los pesos no expertos y los expertos frecuentes permanecen en GPU. El pool completo vive en RAM. Los cache misses se transfieren por PCIe para ejecutarse en GPU o se calculan directamente donde residen, en CPU.

## ¿Cómo ejecuta FreeToken un modelo mayor que la VRAM?

El [paper de investigación de FreeToken](https://arxiv.org/abs/2608.16157) describe cinco mecanismos coordinados:

1. **Caché compartida de expertos en GPU:** una política LRU sigue los pares capa-experto recientes en lugar de fijar toda la colocación al arrancar.
2. **Ejecución adaptada al ancho de banda:** una política medida reparte los misses entre transferencia PCIe más GPU y cálculo directo en CPU. La división se calibra en el equipo real.
3. **Prefill en pipeline:** dos buffers de capa solapan el movimiento de expertos con el cálculo de GPU.
4. **Anclas semánticas de estado:** checkpoints en llamadas de herramientas, bloques de razonamiento y turnos permiten reutilizar más contexto cuando un agente edita su historial.
5. **Pools elásticos de memoria:** el runtime redistribuye VRAM entre la caché de expertos y la KV cache a medida que crece el contexto, sin recargar el pool en RAM.

Esto no significa que un checkpoint de 284B o 753B quepa dentro de una GPU pequeña. El modelo completo sigue necesitando RAM o almacenamiento. FreeToken intenta mantener rápida la ruta activa asignando trabajo a GPU, CPU e interconexión según la fase.

## ¿Cuáles son los requisitos de hardware de FreeToken?

Los [requisitos oficiales de instalación de FreeToken](https://github.com/FlashML-org/FreeToken/blob/main/docs/install.md) indican Linux x86_64, una GPU NVIDIA, driver r580 o posterior, CUDA 13 y Python 3.10 o posterior. Los kernels CUDA se compilan en el primer uso, por lo que también hacen falta el toolkit CUDA 13 y `nvcc`.

Son mínimos de software, no una promesa de que el modelo elegido cabrá. También debes planificar:

- **RAM:** suficiente para el pool completo de expertos, las asignaciones del runtime y el sistema operativo.
- **VRAM:** suficiente para pesos no expertos, KV cache, buffers y una caché de expertos útil.
- **Almacenamiento rápido:** espacio para el checkpoint, pesos FTW opcionales, cachés y rollback.
- **Ancho de banda del host:** la memoria de CPU y PCIe influyen directamente en cómo se dividen los misses.
- **Energía y refrigeración:** un agente local puede mantener CPU, GPU y memoria bajo carga durante horas.

| Sistema | GPU | RAM | Modelo demostrado | Resultado de los autores |
| --- | --- | --- | --- | --- |
| Portátil | RTX 4060 Laptop, 8 GB | 32 GiB | Qwen3.6-35B-A3B NVFP4 | 39,3 tokens/s de decode |
| PC gaming | RTX 5090, 32 GB | 192 GiB | DeepSeek-V4-Flash, 284B totales | Serving interactivo demostrado |
| Workstation | RTX PRO 6000, 96 GB | 512 GiB | GLM-5.2, 753B totales | 14,9 tokens/s frente a 7,3 con llama.cpp |

Interpreta la tabla como evidencia de configuraciones probadas, no como guía de compra. El portátil usó un modelo NVFP4 oficial, mientras que varias comparaciones en sistemas mayores usaron formatos distintos. Arquitectura, cuantización, contexto, trayectoria del agente, RAM, ancho de banda de CPU y versión de PCIe cambian el resultado.

## ¿Qué modelos y backends admite FreeToken?

La [lista oficial de modelos compatibles](https://github.com/FlashML-org/FreeToken/blob/main/docs/models.md) incluye actualmente checkpoints seleccionados de DeepSeek-V4-Flash, GLM-5.2, GLM-4.7, Qwen3.6, Qwen3.5, Qwen3-MoE, gpt-oss, Gemma-4, MiniMax-M2.5 y Muse-Glimmer. El soporte depende de la arquitectura y el formato. Los checkpoints multimodales se sirven ahora solo como texto.

El backend MoE puede ser `fused`, `offload`, `cpu`, `hybrid` o `auto`. Fused exige que los expertos quepan en VRAM. Offload transmite misses desde RAM. CPU los calcula en su ubicación. Hybrid solapa ambas rutas. Auto comienza con offload y puede elegir hybrid cuando un benchmark de ancho de banda lo recomienda.

La lista cambiará rápido. Fija la versión de FreeToken, repositorio del modelo, revisión exacta, cuantización y licencia en cada eval. La licencia Apache del motor no sustituye la licencia ni las condiciones de uso del modelo.

## ¿Qué solidez tienen los benchmarks de FreeToken?

El paper evalúa seis sistemas, dos MoE principales, cuatro cargas agentic y cuatro motores baseline. Sus autores reportan entre 77 y 83 tokens/s para Qwen3.6-35B-A3B y entre 22 y 25 tokens/s para DeepSeek-V4-Flash en una RTX 5090. En cinco sistemas de consumo, FreeToken habría superado al mejor baseline compatible entre 1,3 y 2,1 veces. Su peor time to first token permaneció por debajo de 44 segundos en las celdas probadas, mientras cada baseline superó 150 segundos en alguna.

La evaluación aporta más que una captura con un prompt corto porque incluye coding agents, herramientas, contexto largo y latencia de cola. También alinea formatos entre motores cuando es posible. Aun así, es la primera versión de un preprint de arXiv y las mediciones pertenecen a los autores. Wavect no reprodujo los resultados de GPU para este artículo. Son un motivo sólido para hacer un benchmark, no una garantía de servicio.

## FreeToken frente a Ollama, AirLLM y un modelo residente menor

| Decisión | Punto de partida | Motivo |
| --- | --- | --- |
| Servir un MoE frontier compatible entre NVIDIA, CPU y RAM | Piloto de FreeToken | Su caché y ejecución híbrida atacan ese cuello de botella. |
| Ejecutar un modelo local habitual con un flujo sencillo | Ollama o llama.cpp | Empieza por el runtime menos complejo que cumpla el requisito. |
| Inspeccionar un checkpoint enorme con muy poca VRAM | [Inferencia por capas con AirLLM](/es/blog/airllm-layer-wise-inference-low-vram/) | En investigación, el acceso puede importar más que la latencia interactiva. |
| Elegir modelo antes que runtime | [Guía de hardware de llmfit](/es/blog/llmfit-local-llm-hardware-guide/) | Busca primero el modelo y cuantización más pequeños que superen la tarea. |
| Decidir si conviene self-hosting | [Calculadora de modelo local frente a API](/es/blog/local-models-vs-apis-break-even-eu-2026/) | Utilización, operaciones y coste por tarea aceptada dan la respuesta comercial. |

FreeToken es relevante cuando el modelo elegido es sparse y los contextos agentic provocan prefill repetido. Aporta menos si un modelo dense, menor y cuantizado ya cumple calidad y latencia dentro de VRAM. Tampoco elimina la comparación del modelo. Para un caso concreto, nuestra [guía de despliegue local de DeepSeek V4 Flash](/es/blog/deepseek-v4-flash-0731-local-ai-pc/) cubre memoria, cuantización y ajuste de hardware.

## ¿Cómo se instala y prueba FreeToken?

El [quick start oficial de FreeToken](https://github.com/FlashML-org/FreeToken/blob/main/docs/quickstart.md) expone endpoints compatibles con OpenAI y Anthropic. Una evaluación mínima empieza así:

```
uv venv
source .venv/bin/activate
uv pip install "freetoken[accel]"
ft bench bw
ft serve --model Qwen/Qwen3.6-35B-A3B
```

Verifica `/v1/models`, envía una completion corta y conecta un agente después. La CLI puede iniciar Codex, Claude Code, OpenCode, OpenClaw y otros harnesses compatibles contra el servidor local. Usa primero `ft launch... --dry-run` para ver cambios de configuración antes de aplicarlos.

No empieces con el checkpoint más grande. Prueba primero el artefacto compatible más pequeño que represente la carga. Registra tamaño de descarga, cold start, time to first token, throughput de prompt, decode, pico de VRAM, pico de RAM, contexto, consumo y fallos.

## ¿La inferencia local es realmente gratis?

Las peticiones locales no crean un cargo por token de un proveedor. Eso no equivale a coste cero. El coste por tarea aceptada incluye depreciación de hardware, RAM, NVMe, electricidad, refrigeración, ingeniería, monitorización, actualizaciones, seguridad, caídas, capacidad ociosa y fallback.

Para un desarrollador con workstation existente, el coste marginal puede parecer casi cero. En un producto para clientes suelen dominar redundancia y utilización. Compara el sistema FreeToken exacto con la API que sustituiría usando los mismos prompts, herramientas, criterios de éxito y concurrencia. Un token gratis y rápido no ayuda si el modelo falla la tarea o el servidor incumple la latencia.

## ¿Cuándo tiene sentido comercial un piloto de FreeToken?

- **Cargas agentic sostenidas:** coding y herramientas generan suficiente volumen para justificar infraestructura propia.
- **Control local:** ubicación de datos, operación offline o acceso predecible pesan más que cambiar de modelo al instante.
- **Hardware existente:** la empresa ya posee GPU NVIDIA adecuada, RAM suficiente y almacenamiento rápido.
- **Calidad de un MoE compatible:** uno de los modelos soportados supera un eval específico frente a la API actual.
- **Propiedad de ingeniería:** alguien mantiene parches, revisiones, observabilidad, autenticación y recuperación.

Usa una API gestionada o un modelo residente menor cuando la demanda sea baja o irregular, el producto necesite la última capacidad frontier, el hardware Apple o AMD sea fijo, el servicio multimodal sea obligatorio o el equipo no pueda operar inferencia local. Una arquitectura híbrida suele ser el punto comercial más seguro: inferencia local para tareas privadas y predecibles, con fallback cloud controlado para peticiones difíciles o saturadas.

## Checklist de preparación para producción

1. **Fija cada artefacto:** commit o release de FreeToken, modelo, revisión, cuantización, CUDA, driver y dependencias.
2. **Ejecuta evals de tarea:** compara tasa de tareas aceptadas, no parámetros o un leaderboard genérico.
3. **Mide trazas agentic:** incluye contexto largo, herramientas, concurrencia, reintentos y compactación.
4. **Protege el endpoint:** conserva el binding de loopback salvo que exista un servicio de red protegido. Añade autenticación, autorización, rate limits y logs antes del acceso remoto.
5. **Observa los cuellos de botella:** registra cola, prefill, primer token, decode, cache hits, RAM, VRAM, almacenamiento y energía.
6. **Prueba presión de memoria:** verifica qué ocurre cuando otra aplicación toma VRAM o crece la KV cache.
7. **Planifica fallos y fallback:** define carga fallida, timeout, baja calidad, saturación y caída del host.
8. **Recalcula el coste total:** usa utilización medida y tareas exitosas antes de comprar hardware.

Para el problema de rendimiento ligado al contexto, revisa nuestro análisis de [latencia de KV cache compartida en inferencia LLM multi-turn](/es/blog/shared-kv-cache-llm-inference-latency/). FreeToken añade anclas semánticas y asignación elástica, pero el producto sigue necesitando medición end-to-end alrededor del agent harness.

## Límites de las fuentes

Las funciones, licencia y soporte general de hardware proceden del repositorio oficial. La arquitectura y los benchmarks son del paper de los autores. Los prerrequisitos vienen de la instalación. La compatibilidad de modelos y backends viene de la documentación de modelos. Los comandos y APIs vienen del quick start. Wavect no reprodujo los benchmarks de hardware ni afirma validación independiente. Soporte, modelos y requisitos pueden cambiar después de la fecha de revisión.

## Preguntas frecuentes

### ¿Qué es FreeToken AI?

FreeToken es un motor de inferencia open source de FlashML para servir grandes modelos Mixture-of-Experts entre GPU NVIDIA, CPU, RAM y PCIe. Expone APIs compatibles con OpenAI y Anthropic.

### ¿FreeToken entrega tokens de IA gratis?

No. Ejecuta modelos open-weight en hardware que controlas, así que las peticiones locales no generan una factura por token. Sigues pagando hardware, RAM, almacenamiento, electricidad y operaciones.

### ¿FreeToken puede funcionar con 8 GB de VRAM?

Los autores reportan Qwen3.6-35B-A3B NVFP4 a 39,3 tokens de decode por segundo en un portátil RTX 4060 con 8 GB de VRAM y 32 GiB de RAM. Reproduce esa configuración en tu equipo exacto.

### ¿Qué sistemas operativos y GPU admite?

La guía actual de CLI requiere Linux x86_64 y GPU NVIDIA con driver r580 o posterior y CUDA 13. El proyecto también anuncia una app de Windows. Comprueba compatibilidad con el release actual.

### ¿FreeToken es más rápido que Ollama?

En las cargas MoE probadas, los autores reportan mayor decode y menor latencia de cola que los baselines compatibles, incluido Ollama donde aplica. No significa que gane con todo modelo o carga.

### ¿Qué modelos admite FreeToken?

La lista actual incluye checkpoints seleccionados de DeepSeek-V4, GLM, Qwen MoE, gpt-oss, Gemma-4, MiniMax y Muse-Glimmer. La compatibilidad depende de arquitectura y formato. Los modelos multimodales son text-only.

### ¿FreeToken está listo para producción?

Es prometedor para un piloto controlado. Producción todavía exige evals, artefactos fijados, autenticación, autorización, observabilidad, concurrencia, recuperación, fallback y costes medidos.

## Reflexiones finales

FreeToken cambia la pregunta de IA local. Ya no se trata solo de si un modelo cabe en VRAM, sino de si un ordenador puede coordinar GPU, CPU, RAM y PCIe con suficiente eficiencia. Los resultados de los autores convierten esa dirección en una opción creíble, sobre todo para modelos sparse y agentes de larga duración.

No compres hardware por un titular de parámetros. Confirma el soporte, reserva RAM y almacenamiento, reproduce el benchmark con el checkpoint exacto y compara el coste por tarea aceptada con un modelo residente menor y una API gestionada. Si FreeToken gana esa prueba, la inferencia MoE frontier local puede ser una arquitectura de producto y no solo una demo de laboratorio.

## También te puede gustar..

[**¿Qué LLM local cabe en tu hardware?** Preselecciona modelos y cuantizaciones antes de elegir motor de inferencia.](/es/blog/llmfit-local-llm-hardware-guide/) [**Modelos locales frente a APIs** Calcula cuándo la inferencia propia supera a la API tras medir utilización y operaciones.](/es/blog/local-models-vs-apis-break-even-eu-2026/)

Modelos e infraestructura

## Continúa por este clúster

Selección de modelos, economía de inferencia, despliegue local, compresión y serving.

[Empieza por el artículo fundamental**Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights**](/es/blog/self-hosting-llms-eu-cost/)

- [Darkbloom AI: Inferencia Privada en Macs Inactivos](/es/blog/darkbloom-ai-private-inference-mac/)
- [Ox Alpha Free: configuración, privacidad y guía de compra](/es/blog/ox-alpha-free-ai-model-guide-2026/)
- [Precios de Pika Audio API: ¿SFX cuesta de verdad 20 veces menos?](/es/blog/pika-audio-models-api-pricing-2026/)
- [La apuesta de $13M de Thunder Compute por virtualizar GPUs: guía de compra](/es/blog/thunder-compute-gpu-virtualization-series-a/)
- [AirLLM con 4 GB de VRAM: cómo funciona la inferencia por capas](/es/blog/airllm-layer-wise-inference-low-vram/)

Tu bandeja, sin ruido

## Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

14 min de lectura · 25 de agosto de 2026 Última revisión 25 de agosto de 2026

[**Siguiente**](/es/blog/airllm-layer-wise-inference-low-vram/)

Nuevos artículos por correo ×

×

Recibe nuevos artículos por correo

Un correo breve cuando publicamos. Gratis y sin seguimiento.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/es/blog/freetoken-ai-inference-engine-review/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-08-25",
      "inLanguage": "es",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-08-25",
      "url": "https://wavect.io/es/blog/freetoken-ai-inference-engine-review/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "FreeToken es un motor de inferencia de FlashML con licencia Apache 2.0 para ejecutar grandes modelos Mixture-of-Experts entre una GPU NVIDIA, CPU, RAM y PCIe. Sus autores reportan 39,3 tokens por segundo con Qwen3.6-35B-A3B en un portátil RTX 4060 de 8 GB y entre 22 y 25 tokens por segundo con DeepSeek-V4-Flash en una RTX 5090. Son resultados del paper del proyecto, no benchmarks de Wavect. La CLI actual requiere Linux x86_64, una GPU NVIDIA, driver r580 o posterior, CUDA 13 y Python 3.10 o posterior. FreeToken puede eliminar la factura por token de una API, pero no los costes de hardware, RAM, almacenamiento, electricidad, operaciones o validación del modelo. Haz un piloto cuando un MoE compatible supere tu eval y el control local o el uso sostenido justifiquen la infraestructura.",
  "articleBody": " Resumen del blog/IA y agentes/Modelos e infraestructura Análisis de FreeToken AI: ¿modelos MoE frontier en una GPU doméstica? Resumen FreeToken es un motor de inferencia de FlashML con licencia Apache 2.0 para ejecutar grandes modelos Mixture-of-Experts entre una GPU NVIDIA, CPU, RAM y PCIe. Sus autores reportan 39,3 tokens por segundo con Qwen3.6-35B-A3B en un portátil RTX 4060 de 8 GB y entre 22 y 25 tokens por segundo con DeepSeek-V4-Flash en una RTX 5090. Son resultados del paper del proyecto, no benchmarks de Wavect. La CLI actual requiere Linux x86_64, una GPU NVIDIA, driver r580 o posterior, CUDA 13 y Python 3.10 o posterior. FreeToken puede eliminar la factura por token de una API, pero no los costes de hardware, RAM, almacenamiento, electricidad, operaciones o validación del modelo. Haz un piloto cuando un MoE compatible supere tu eval y el control local o el uso sostenido justifiquen la infraestructura. FreeToken es un nuevo motor de inferencia open source que ejecuta grandes modelos Mixture-of-Experts repartiendo el trabajo entre los recursos de un solo ordenador. Usa la VRAM como caché rápida de expertos, mantiene el pool completo en la RAM y divide el trabajo restante entre transferencias PCIe y ejecución en CPU. Así puede hacer utilizables a velocidad interactiva ciertos modelos que no caben en la GPU, siempre que el sistema NVIDIA sea compatible. Este artículo analiza el proyecto de FlashML en FlashML-org/FreeToken, no servicios de tokens o SDK con nombres parecidos. Lo revisamos el 25 de agosto de 2026. Su intención principal es responder una decisión concreta sobre FreeToken AI: requisitos de hardware, instalación, benchmarks de los autores, límites y encaje comercial. Para saber qué modelo cabe en un equipo, consulta nuestra guía de hardware para LLM locales. Resumen para decidir sobre FreeToken PreguntaRespuesta corta ¿FreeToken es gratis?El motor es open source con licencia Apache 2.0. Hardware, RAM, almacenamiento, electricidad y operaciones no son gratis. ¿Entrega tokens de API gratis?No. Sirve modelos open-weight en tu propio equipo, por lo que una petición local no genera una factura por token del proveedor. ¿Qué hardware necesita la CLI?Actualmente Linux x86_64, GPU NVIDIA, driver r580 o posterior, CUDA 13, Python 3.10 o posterior y suficiente RAM y almacenamiento para el checkpoint. ¿Quién debería probarlo?Equipos que evalúan un MoE compatible para coding agents, automatización privada, investigación o inferencia local sostenida. ¿Quién debería esperar?Usuarios de Apple Silicon o AMD, equipos que necesitan operaciones multiusuario maduras y compradores sin evals de modelo y coste por tarea. ¿Qué es FreeToken AI? FreeToken es un runtime edge-native de FlashML. El repositorio oficial de FreeToken en GitHub describe soporte para portátiles, ordenadores gaming y GPU de workstation, además de endpoints compatibles con OpenAI y Anthropic para coding agents y agentes con herramientas. El código usa licencia Apache 2.0. El proyecto se centra en modelos MoE sparse. Un checkpoint MoE contiene muchas redes expertas, pero el router solo activa una fracción por token. El cálculo necesario para un token puede ser mucho menor que el total de parámetros. El problema es la memoria: todos los expertos deben residir en algún sitio aunque la mayoría esté inactiva. FreeToken trata el ordenador completo como un sistema de inferencia. Los pesos no expertos y los expertos frecuentes permanecen en GPU. El pool completo vive en RAM. Los cache misses se transfieren por PCIe para ejecutarse en GPU o se calculan directamente donde residen, en CPU. ¿Cómo ejecuta FreeToken un modelo mayor que la VRAM? El paper de investigación de FreeToken describe cinco mecanismos coordinados: Caché compartida de expertos en GPU: una política LRU sigue los pares capa-experto recientes en lugar de fijar toda la colocación al arrancar. Ejecución adaptada al ancho de banda: una política medida reparte los misses entre transferencia PCIe más GPU y cálculo directo en CPU. La división se calibra en el equipo real. Prefill en pipeline: dos buffers de capa solapan el movimiento de expertos con el cálculo de GPU. Anclas semánticas de estado: checkpoints en llamadas de herramientas, bloques de razonamiento y turnos permiten reutilizar más contexto cuando un agente edita su historial. Pools elásticos de memoria: el runtime redistribuye VRAM entre la caché de expertos y la KV cache a medida que crece el contexto, sin recargar el pool en RAM. Esto no significa que un checkpoint de 284B o 753B quepa dentro de una GPU pequeña. El modelo completo sigue necesitando RAM o almacenamiento. FreeToken intenta mantener rápida la ruta activa asignando trabajo a GPU, CPU e interconexión según la fase. ¿Cuáles son los requisitos de hardware de FreeToken? Los requisitos oficiales de instalación de FreeToken indican Linux x86_64, una GPU NVIDIA, driver r580 o posterior, CUDA 13 y Python 3.10 o posterior. Los kernels CUDA se compilan en el primer uso, por",
  "articleSection": "Infraestructura de IA",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "repositorio oficial de FreeToken en GitHub",
      "url": "https://github.com/FlashML-org/FreeToken"
    },
    {
      "@type": "WebPage",
      "name": "paper de investigación de FreeToken",
      "url": "https://arxiv.org/abs/2608.16157"
    },
    {
      "@type": "WebPage",
      "name": "requisitos oficiales de instalación de FreeToken",
      "url": "https://github.com/FlashML-org/FreeToken/blob/main/docs/install.md"
    },
    {
      "@type": "WebPage",
      "name": "lista oficial de modelos compatibles",
      "url": "https://github.com/FlashML-org/FreeToken/blob/main/docs/models.md"
    },
    {
      "@type": "WebPage",
      "name": "quick start oficial de FreeToken",
      "url": "https://github.com/FlashML-org/FreeToken/blob/main/docs/quickstart.md"
    }
  ],
  "dateModified": "2026-08-25",
  "datePublished": "2026-08-25",
  "description": "FreeToken es un motor de inferencia de FlashML con licencia Apache 2.0 para ejecutar grandes modelos Mixture-of-Experts entre una GPU NVIDIA, CPU, RAM y PCIe. Sus autores reportan 39,3 tokens por segundo con Qwen3.6-35B-A3B en un portátil RTX 4060 de 8 GB y entre 22 y 25 tokens por segundo con DeepSeek-V4-Flash en una RTX 5090. Son resultados del paper del proyecto, no benchmarks de Wavect. La CLI actual requiere Linux x86_64, una GPU NVIDIA, driver r580 o posterior, CUDA 13 y Python 3.10 o posterior. FreeToken puede eliminar la factura por token de una API, pero no los costes de hardware, RAM, almacenamiento, electricidad, operaciones o validación del modelo. Haz un piloto cuando un MoE compatible supere tu eval y el control local o el uso sostenido justifiquen la infraestructura.",
  "headline": "Análisis de FreeToken AI: ¿modelos MoE frontier en una GPU doméstica?",
  "image": "https://wavect.io/img/blog/headers/header_freetoken-ai-inference-engine-review.svg",
  "inLanguage": "es",
  "keywords": "FreeToken, IA local, Infraestructura de IA",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/es/blog/freetoken-ai-inference-engine-review/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/es/blog/freetoken-ai-inference-engine-review/",
  "wordCount": 2742
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/",
      "name": "Inicio",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/overview/",
      "name": "Resumen del blog",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/topics/ai-agents/",
      "name": "IA y agentes",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/clusters/models-infrastructure/",
      "name": "Modelos e infraestructura",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/freetoken-ai-inference-engine-review/",
      "name": "FreeToken AI: hardware, benchmarks e instalación | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "FreeToken es un motor de inferencia open source de FlashML para servir grandes modelos Mixture-of-Experts entre GPU NVIDIA, CPU, RAM y PCIe. Expone APIs compatibles con OpenAI y Anthropic."
      },
      "name": "¿Qué es FreeToken AI?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "No. Ejecuta modelos open-weight en hardware que controlas, así que las peticiones locales no generan una factura por token. Sigues pagando hardware, RAM, almacenamiento, electricidad y operaciones."
      },
      "name": "¿FreeToken entrega tokens de IA gratis?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Los autores reportan Qwen3.6-35B-A3B NVFP4 a 39,3 tokens de decode por segundo en un portátil RTX 4060 con 8 GB de VRAM y 32 GiB de RAM. Reproduce esa configuración en tu equipo exacto."
      },
      "name": "¿FreeToken puede funcionar con 8 GB de VRAM?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "La guía actual de CLI requiere Linux x86_64 y GPU NVIDIA con driver r580 o posterior y CUDA 13. El proyecto también anuncia una app de Windows. Comprueba compatibilidad con el release actual."
      },
      "name": "¿Qué sistemas operativos y GPU admite?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "En las cargas MoE probadas, los autores reportan mayor decode y menor latencia de cola que los baselines compatibles, incluido Ollama donde aplica. No significa que gane con todo modelo o carga."
      },
      "name": "¿FreeToken es más rápido que Ollama?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "La lista actual incluye checkpoints seleccionados de DeepSeek-V4, GLM, Qwen MoE, gpt-oss, Gemma-4, MiniMax y Muse-Glimmer. La compatibilidad depende de arquitectura y formato. Los modelos multimodales son text-only."
      },
      "name": "¿Qué modelos admite FreeToken?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Es prometedor para un piloto controlado. Producción todavía exige evals, artefactos fijados, autenticación, autorización, observabilidad, concurrencia, recuperación, fallback y costes medidos."
      },
      "name": "¿FreeToken está listo para producción?"
    }
  ]
}
```
