---
title: "¿Qué LLM local puedes ejecutar? Guía de llmfit"
canonical: https://wavect.io/es/blog/llmfit-local-llm-hardware-guide/
language: es
description: "Encuentra con llmfit LLM locales para tu RAM, VRAM, CPU y caso de uso. Entiende MoE, cuantización, velocidad, límites y pruebas de producción."
image: "https://wavect.io/img/blog/headers/header_llmfit-local-llm-hardware-guide.png"
---

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

11 min de lectura · 27 de julio de 2026 Última revisión 27 de julio de 2026

[**Siguiente**](/es/blog/lean-ctx-agency-experience/)

# ¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware

Resumen

llmfit es una herramienta gratuita de terminal con licencia MIT que detecta RAM, CPU y memoria de GPU y clasifica cientos de modelos locales por ajuste, velocidad estimada, calidad y contexto. Úsala antes de descargar pesos para preseleccionar un modelo y una cuantización adecuados para tu hardware. El resultado es una estimación de planificación, no una garantía de despliegue. Verifica el modelo con tu longitud de contexto, runtime, prompts, concurrencia y licencia reales antes de comprar hardware o comprometerte con el self-hosting.

**llmfit responde la pregunta que debería preceder a cualquier descarga de un modelo local: ¿qué funcionará bien en este equipo?** La herramienta gratuita detecta RAM, CPU, GPU y VRAM y clasifica cientos de modelos por ajuste de memoria, velocidad estimada, calidad y contexto útil. También selecciona la cuantización de mayor calidad que espera que quepa.

Puede ahorrarte una descarga de 20 GB y una tarde perdida. No demuestra que el modelo tenga suficiente precisión, una licencia válida para tu producto o velocidad bajo carga real. Usa llmfit para crear una preselección y después prueba esa lista con tu runtime y tu carga.

## llmfit en 60 segundos

| Pregunta | Respuesta | Implicación de compra |
| --- | --- | --- |
| ¿Qué es? | Una TUI interactiva y una CLI para dimensionar hardware de LLM locales | Reduce las opciones de modelo y cuantización antes de descargar. |
| ¿Qué detecta? | RAM disponible, núcleos de CPU, GPU, VRAM y backend de aceleración | La recomendación se calcula para tu equipo, no para un nivel genérico. |
| ¿Qué puntúa? | Ajuste, velocidad estimada, calidad y contexto | El modelo más grande no gana automáticamente. |
| ¿Qué sistemas admite? | Soporte completo para Linux y Apple Silicon, con detección GPU más limitada en Windows y Mac Intel | Confirma primero la detección con `llmfit system`. |
| ¿Qué runtimes conecta? | Ollama, llama.cpp, MLX, Docker Model Runner y LM Studio | Puedes pasar de la recomendación a la descarga o al runtime local. |
| ¿Entiende modelos MoE? | Sí, separa parámetros totales y activos y modela el offloading de expertos | No trata Mixtral o DeepSeek como modelos densos normales. |
| ¿Es gratis? | Sí, el código de llmfit usa licencia MIT | Cada modelo mantiene su propia licencia. |
| ¿Garantiza el rendimiento? | No, produce una estimación sensible al hardware | Valida prompts, contexto, concurrencia y arranques en frío. |

## Instala y pide una recomendación antes de descargar pesos

Homebrew es la ruta sencilla en macOS o Linux. En Windows puedes usar Scoop. Si ya trabajas con `uv`, `uvx` ejecuta llmfit sin una instalación persistente.

```
# macOS o Linux
brew install llmfit

## Windows
scoop install llmfit

## Una ejecución mediante uv
uvx llmfit
```

El comando `llmfit` abre la interfaz interactiva. Para un proceso reproducible de decisión, estos comandos de CLI son más útiles:

```
# Confirma el hardware detectado
llmfit system

## Devuelve cinco recomendaciones para programación
llmfit recommend --json --use-case coding --limit 5

## Revisa los supuestos de un candidato
llmfit info "NOMBRE DEL MODELO"

## Estima hardware para un contexto de 8K
llmfit plan "NOMBRE DEL MODELO" --context 8192 --json
```

La [referencia oficial de CLI y automatización](https://github.com/AlexsJones/llmfit/blob/main/docs/cli.md) incluye overrides de hardware, límites de contexto y una API REST local. Por eso llmfit también sirve para scripts y planificación de nodos.

## Cómo decide llmfit qué modelo cabe

Primero identifica el backend de aceleración, como CUDA, Metal, ROCm, SYCL o CPU. Después compara el catálogo con la memoria disponible y una jerarquía de cuantización desde Q8_0 hasta Q2_K. Intenta conservar la opción de mayor calidad que cabe. Si el contexto completo no entra, puede recalcular con uno menor.

| Puntuación | Qué representa | Qué falta |
| --- | --- | --- |
| Quality | Tamaño, reputación de la familia, penalización de cuantización y afinidad con la tarea | Precisión en tu dominio, idioma, seguridad y tool calling |
| Speed | Tokens por segundo estimados según ancho de banda, tamaño y modo | Procesamiento del prompt, batching, temperatura y kernels del runtime |
| Fit | Uso eficiente de memoria con margen recomendado | Otros procesos, memoria gráfica y concurrencia real |
| Context | Contexto anunciado frente al objetivo de la tarea | Degradación con contextos largos y utilidad del contexto recuperado |

La combinación cambia según el caso de uso. Programación puede favorecer a un especialista pequeño sobre un generalista mayor. Razonamiento da más peso a calidad y chat a velocidad. Es mejor que ordenar por parámetros, pero sigue siendo una heurística. Tu conjunto de aceptación decide.

## Por qué importa el soporte MoE

Los modelos Mixture-of-Experts publican muchos parámetros totales, pero solo activan una parte por token. Una calculadora pensada para modelos densos puede producir una estimación engañosa. llmfit lee metadatos MoE, distingue parámetros activos y modela una ruta con expertos activos en VRAM e inactivos descargados a RAM.

Eso no significa que solo los parámetros activos necesiten memoria. Todos los pesos deben existir en algún punto del serving, normalmente RAM, almacenamiento o ambos. El cambio de expertos, el offload a CPU y el tráfico PCIe afectan la velocidad. La [documentación del modelo de puntuación](https://github.com/AlexsJones/llmfit/blob/main/docs/how-it-works.md) es un mejor punto de partida que la aritmética densa, pero no sustituye el benchmark.

## Cuantización: que quepa no significa que sirva

La cuantización reduce memoria al almacenar pesos con menor precisión. llmfit recorre sus niveles hasta encontrar una configuración viable. Para producción debes añadir dos límites:

- **Usa el contexto real.** Un modelo puede caber a 4K y desbordarse a RAM a 32K por el crecimiento de la caché KV.
- **Define un mínimo de calidad.** Un modelo Q2 que carga no tiene por qué ser suficiente para código, varios idiomas o JSON fiable.

Ejecuta `llmfit plan` con el contexto previsto y compara al menos dos cuantizaciones vecinas sobre un conjunto fijo. Si la mejor opción casi cabe, quizá debas cambiar de hardware o usar una API en vez de comprimir más.

## Dónde verificar la detección de hardware

| Plataforma | Detección | Comprobación |
| --- | --- | --- |
| Linux con NVIDIA | `nvidia-smi`, también con varias GPU | Verifica VRAM por tarjeta y el reparto de tensores o capas. |
| Linux con AMD | `rocm-smi` | La VRAM puede quedar desconocida y requerir un override. |
| Apple Silicon | `system_profiler`, memoria unificada como pool compartido | Reserva memoria para macOS y otras aplicaciones. |
| Intel Arc | sysfs para GPU discreta y `lspci` para integrada | La gráfica integrada comparte la RAM disponible. |
| Windows | RAM y CPU, más NVIDIA mediante `nvidia-smi` | Usa `llmfit doctor` si los datos parecen incorrectos. |
| Android o Termux | Normalmente solo CPU y RAM | La detección de GPU móvil no está disponible. |

La [matriz oficial de plataformas](https://github.com/AlexsJones/llmfit/blob/main/docs/platform-support.md) explica los overrides `--memory`, `--ram` y `--cpu-cores`. Un override cambia el cálculo, pero no añade soporte a un runtime que no lo tenga.

## Cinco comprobaciones entre un ajuste verde y producción

1. **Confirma el equipo detectado.** Guarda `llmfit system --json` con la decisión y corrige valores ausentes o compartidos.
2. **Filtra por la tarea real.** Elige programación, razonamiento, chat, multimodal o embeddings.
3. **Fija contexto y concurrencia.** Modela entradas y peticiones simultáneas reales, no una demo individual.
4. **Prueba el runtime.** Mide tokens por segundo, tiempo hasta el primer token, procesamiento del prompt, pico de memoria y fallos.
5. **Revisa todo el despliegue.** Incluye licencia, datos, observabilidad, actualizaciones, fallback, seguridad y coste total.

Un modelo puede encajar perfectamente y ser una mala decisión comercial. Compara ingeniería y capacidad ociosa con el gasto de API mediante nuestro [marco de break-even entre modelos locales y APIs](/es/blog/local-models-vs-apis-break-even-eu-2026/). Para un caso actual con 128 GB de memoria unificada, nuestro [análisis de DeepSeek V4 Flash 0731 en un solo PC](/es/blog/deepseek-v4-flash-0731-local-ai-pc/) separa que el modelo cargue de que esté listo para producción. El [análisis de Colibri GLM 5.2 en hardware de consumo](/es/blog/colibri-glm-5-2-consumer-hardware/) muestra cómo memoria, ancho de banda y carga cambian la respuesta.

## Cuándo basta llmfit y cuándo empieza la ingeniería

| Decisión | Usa llmfit para | Añade ingeniería para |
| --- | --- | --- |
| Asistente personal | Modelo y cuantización iniciales | Prueba rápida de calidad y velocidad con tus documentos |
| Compra de workstation | Simulación y diferencia de upgrade | Benchmarks comparables y coste completo del sistema |
| Piloto interno | Ranking y salida JSON repetible | Accesos, límites de datos, evaluación y monitorización |
| Producto para clientes | Supuestos iniciales de capacidad | Carga, escalado, fallback, seguridad, licencia y on-call |
| Clúster GPU | API de ajuste por nodo | Topología, hardware heterogéneo y recuperación |

El camino comercial limpio es progresivo. Descarta candidatos malos con llmfit, invierte tiempo de benchmark solo en los dos o tres mejores y elige self-hosting cuando calidad, latencia, riesgo y coste medidos superen a la opción gestionada.

## Límites que deben constar en la decisión

- La velocidad se estima con ancho de banda, tamaño y factores de eficiencia. Los kernels y la carga pueden cambiar el resultado.
- El catálogo está integrado en el binario. Actualiza llmfit para recibir nuevos modelos.
- La calidad por tarea usa benchmarks de familias y heurísticas, no tu conjunto privado.
- Sumar VRAM de varias GPU no iguala tarjetas, interconexiones ni anchos de banda.
- Que un modelo cargue no valida licencia, seguridad, precisión de dominio ni preparación operativa.

## Fuentes y límites de las afirmaciones

Instalación, comandos, runtimes, privacidad y licencia MIT proceden del [repositorio de llmfit](https://github.com/AlexsJones/llmfit). Detección, cuantización, MoE, puntuación y fórmulas de velocidad proceden de la [documentación técnica](https://github.com/AlexsJones/llmfit/blob/main/docs/how-it-works.md). Los límites de plataforma están en la [referencia de soporte](https://github.com/AlexsJones/llmfit/blob/main/docs/platform-support.md). La medición de tokens por segundo y tiempo al primer token sigue la [guía de benchmarking](https://github.com/AlexsJones/llmfit/blob/main/docs/benchmarking.md). Datos verificados el 27 de julio de 2026. Wavect no reprodujo de forma independiente las estimaciones para este artículo.

## Preguntas frecuentes

### ¿Qué es llmfit?

llmfit es una herramienta gratuita de terminal que detecta RAM, CPU, GPU y VRAM y clasifica cientos de LLM locales por ajuste, velocidad estimada, calidad y contexto. Ofrece TUI, CLI, JSON y API REST local.

### ¿Cómo sé qué LLM puedo ejecutar en mi PC?

Instala llmfit, verifica el hardware con `llmfit system` y ejecuta `llmfit recommend --json --use-case coding --limit 5`. Cambia coding por tu tarea y revisa cada candidato con `llmfit info`.

### ¿llmfit admite Apple Silicon y GPU NVIDIA?

Sí. Apple Silicon usa memoria unificada detectada con system_profiler. NVIDIA usa nvidia-smi y admite varias GPU. Linux tiene el soporte más amplio. En Windows, la detección GPU se centra en NVIDIA.

### ¿llmfit calcula bien modelos MoE?

Detecta metadatos Mixture-of-Experts y separa parámetros totales y activos. Modela expertos activos en VRAM e inactivos en RAM. Aun así, debes medir tráfico de memoria y velocidad del runtime.

### ¿Un ajuste Perfect garantiza velocidad?

No. Perfect indica que el modelo cumple el objetivo recomendado de memoria GPU. La velocidad sigue siendo una estimación. Contexto, batching, offload, kernels y concurrencia cambian el rendimiento.

### ¿llmfit es gratis y privado?

El software es gratuito y usa licencia MIT. Según su documentación, no transfiere información salvo cuando solicitas una función de red, como descargas, consultas a providers o leaderboard. Los modelos tienen licencias y riesgos propios.

### ¿Debe una empresa usar llmfit antes de comprar hardware?

Sí, como filtro inicial. Simula RAM, VRAM y CPU, crea una preselección y valida la compra con benchmarks, contexto, concurrencia, licencia, energía, redundancia y coste operativo.

## Reflexiones finales

Ejecuta llmfit antes de descargar pesos o elegir una GPU. Convierte datos de hardware en una preselección defendible y hace visibles la cuantización, MoE y los límites de contexto.

Después no confundas la puntuación con la decisión final. Sirve los mejores candidatos, usa tu evaluación real, mide toda la curva de latencia y memoria y calcula la operación. El ganador no es el modelo más grande que carga, sino el sistema fiable más pequeño que cumple calidad, latencia, privacidad y coste.

## También te puede gustar..

[**Colibri GLM 5.2 en hardware de consumo** Observa cómo memoria, ancho de banda y carga real cambian una decisión local.](/es/blog/colibri-glm-5-2-consumer-hardware/) [**Modelos locales frente a APIs** Calcula cuándo el self-hosting supera el precio de API incluyendo ingeniería y capacidad ociosa.](/es/blog/local-models-vs-apis-break-even-eu-2026/)

Modelos e infraestructura

## Continúa por este clúster

Selección de modelos, economía de inferencia, despliegue local, compresión y serving.

[Empieza por el artículo fundamental**Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights**](/es/blog/self-hosting-llms-eu-cost/)

- [El stack vLLM y Triton de Netflix: 7 lecciones de producción](/es/blog/netflix-vllm-triton-inference-stack/)
- [Transformers.js en el navegador: cuándo llevar la IA local a tu producto](/es/blog/transformers-js-browser-ai-guide/)
- [Cómo autoalojar LiteLLM en producción: guía 2026](/es/blog/self-host-litellm-production-2026/)
- [Wiki empresarial preparada para IA: arquitectura e implementación](/es/blog/ai-ready-company-wiki/)
- [¿Claude añade marcas de agua al texto? Respuesta API 2026](/es/blog/claude-text-watermark-api-2026/)

Tu bandeja, sin ruido

## Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

11 min de lectura · 27 de julio de 2026 Última revisión 27 de julio de 2026

[**Siguiente**](/es/blog/lean-ctx-agency-experience/)

Nuevos artículos por correo ×

×

Recibe nuevos artículos por correo

Un correo breve cuando publicamos. Gratis y sin seguimiento.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/es/blog/llmfit-local-llm-hardware-guide/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-27",
      "inLanguage": "es",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-27",
      "url": "https://wavect.io/es/blog/llmfit-local-llm-hardware-guide/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "llmfit es una herramienta gratuita de terminal con licencia MIT que detecta RAM, CPU y memoria de GPU y clasifica cientos de modelos locales por ajuste, velocidad estimada, calidad y contexto. Úsala antes de descargar pesos para preseleccionar un modelo y una cuantización adecuados para tu hardware. El resultado es una estimación de planificación, no una garantía de despliegue. Verifica el modelo con tu longitud de contexto, runtime, prompts, concurrencia y licencia reales antes de comprar hardware o comprometerte con el self-hosting.",
  "articleBody": " Resumen del blog/IA y agentes/Modelos e infraestructura ¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware Resumen llmfit es una herramienta gratuita de terminal con licencia MIT que detecta RAM, CPU y memoria de GPU y clasifica cientos de modelos locales por ajuste, velocidad estimada, calidad y contexto. Úsala antes de descargar pesos para preseleccionar un modelo y una cuantización adecuados para tu hardware. El resultado es una estimación de planificación, no una garantía de despliegue. Verifica el modelo con tu longitud de contexto, runtime, prompts, concurrencia y licencia reales antes de comprar hardware o comprometerte con el self-hosting. llmfit responde la pregunta que debería preceder a cualquier descarga de un modelo local: ¿qué funcionará bien en este equipo? La herramienta gratuita detecta RAM, CPU, GPU y VRAM y clasifica cientos de modelos por ajuste de memoria, velocidad estimada, calidad y contexto útil. También selecciona la cuantización de mayor calidad que espera que quepa. Puede ahorrarte una descarga de 20 GB y una tarde perdida. No demuestra que el modelo tenga suficiente precisión, una licencia válida para tu producto o velocidad bajo carga real. Usa llmfit para crear una preselección y después prueba esa lista con tu runtime y tu carga. llmfit en 60 segundos Datos de llmfit verificados el 27 de julio de 2026 PreguntaRespuestaImplicación de compra ¿Qué es?Una TUI interactiva y una CLI para dimensionar hardware de LLM localesReduce las opciones de modelo y cuantización antes de descargar. ¿Qué detecta?RAM disponible, núcleos de CPU, GPU, VRAM y backend de aceleraciónLa recomendación se calcula para tu equipo, no para un nivel genérico. ¿Qué puntúa?Ajuste, velocidad estimada, calidad y contextoEl modelo más grande no gana automáticamente. ¿Qué sistemas admite?Soporte completo para Linux y Apple Silicon, con detección GPU más limitada en Windows y Mac IntelConfirma primero la detección con llmfit system. ¿Qué runtimes conecta?Ollama, llama.cpp, MLX, Docker Model Runner y LM StudioPuedes pasar de la recomendación a la descarga o al runtime local. ¿Entiende modelos MoE?Sí, separa parámetros totales y activos y modela el offloading de expertosNo trata Mixtral o DeepSeek como modelos densos normales. ¿Es gratis?Sí, el código de llmfit usa licencia MITCada modelo mantiene su propia licencia. ¿Garantiza el rendimiento?No, produce una estimación sensible al hardwareValida prompts, contexto, concurrencia y arranques en frío. Instala y pide una recomendación antes de descargar pesos Homebrew es la ruta sencilla en macOS o Linux. En Windows puedes usar Scoop. Si ya trabajas con uv, uvx ejecuta llmfit sin una instalación persistente. # macOS o Linux brew install llmfit # Windows scoop install llmfit # Una ejecución mediante uv uvx llmfit El comando llmfit abre la interfaz interactiva. Para un proceso reproducible de decisión, estos comandos de CLI son más útiles: # Confirma el hardware detectado llmfit system # Devuelve cinco recomendaciones para programación llmfit recommend --json --use-case coding --limit 5 # Revisa los supuestos de un candidato llmfit info \"NOMBRE DEL MODELO\" # Estima hardware para un contexto de 8K llmfit plan \"NOMBRE DEL MODELO\" --context 8192 --json La referencia oficial de CLI y automatización incluye overrides de hardware, límites de contexto y una API REST local. Por eso llmfit también sirve para scripts y planificación de nodos. Cómo decide llmfit qué modelo cabe Primero identifica el backend de aceleración, como CUDA, Metal, ROCm, SYCL o CPU. Después compara el catálogo con la memoria disponible y una jerarquía de cuantización desde Q8_0 hasta Q2_K. Intenta conservar la opción de mayor calidad que cabe. Si el contexto completo no entra, puede recalcular con uno menor. PuntuaciónQué representaQué falta QualityTamaño, reputación de la familia, penalización de cuantización y afinidad con la tareaPrecisión en tu dominio, idioma, seguridad y tool calling SpeedTokens por segundo estimados según ancho de banda, tamaño y modoProcesamiento del prompt, batching, temperatura y kernels del runtime FitUso eficiente de memoria con margen recomendadoOtros procesos, memoria gráfica y concurrencia real ContextContexto anunciado frente al objetivo de la tareaDegradación con contextos largos y utilidad del contexto recuperado La combinación cambia según el caso de uso. Programación puede favorecer a un especialista pequeño sobre un generalista mayor. Razonamiento da más peso a calidad y chat a velocidad. Es mejor que ordenar por parámetros, pero sigue siendo una heurística. Tu conjunto de aceptación decide. Por qué importa el soporte MoE Los modelos Mixture-of-Experts publican muchos parámetros totales, pero solo activan una parte por token. Una calculadora pensada para modelos densos puede producir una estimación engañosa. llmfit lee metadatos MoE, distingue parámetros activos y modela una ruta con expertos activos en VRAM e inactivos descargados a RAM. Eso no significa",
  "articleSection": "Infraestructura de IA",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-07-27",
  "datePublished": "2026-07-27",
  "description": "llmfit es una herramienta gratuita de terminal con licencia MIT que detecta RAM, CPU y memoria de GPU y clasifica cientos de modelos locales por ajuste, velocidad estimada, calidad y contexto. Úsala antes de descargar pesos para preseleccionar un modelo y una cuantización adecuados para tu hardware. El resultado es una estimación de planificación, no una garantía de despliegue. Verifica el modelo con tu longitud de contexto, runtime, prompts, concurrencia y licencia reales antes de comprar hardware o comprometerte con el self-hosting.",
  "headline": "¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware",
  "image": "https://wavect.io/img/blog/headers/header_llmfit-local-llm-hardware-guide.svg",
  "inLanguage": "es",
  "keywords": "LLM locales, Infraestructura de IA",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/es/blog/llmfit-local-llm-hardware-guide/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/es/blog/llmfit-local-llm-hardware-guide/",
  "wordCount": 2113
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/",
      "name": "Inicio",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/overview/",
      "name": "Resumen del blog",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/topics/ai-agents/",
      "name": "IA y agentes",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/clusters/models-infrastructure/",
      "name": "Modelos e infraestructura",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/llmfit-local-llm-hardware-guide/",
      "name": "¿Qué LLM local puedes ejecutar? Guía de llmfit | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "llmfit es una herramienta gratuita de terminal que detecta RAM, CPU, GPU y VRAM y clasifica cientos de LLM locales por ajuste, velocidad estimada, calidad y contexto. Ofrece TUI, CLI, JSON y API REST local."
      },
      "name": "¿Qué es llmfit?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Instala llmfit, verifica el hardware con llmfit system y ejecuta llmfit recommend --json --use-case coding --limit 5. Cambia coding por tu tarea y revisa cada candidato con llmfit info."
      },
      "name": "¿Cómo sé qué LLM puedo ejecutar en mi PC?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Sí. Apple Silicon usa memoria unificada detectada con system_profiler. NVIDIA usa nvidia-smi y admite varias GPU. Linux tiene el soporte más amplio. En Windows, la detección GPU se centra en NVIDIA."
      },
      "name": "¿llmfit admite Apple Silicon y GPU NVIDIA?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Detecta metadatos Mixture-of-Experts y separa parámetros totales y activos. Modela expertos activos en VRAM e inactivos en RAM. Aun así, debes medir tráfico de memoria y velocidad del runtime."
      },
      "name": "¿llmfit calcula bien modelos MoE?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "No. Perfect indica que el modelo cumple el objetivo recomendado de memoria GPU. La velocidad sigue siendo una estimación. Contexto, batching, offload, kernels y concurrencia cambian el rendimiento."
      },
      "name": "¿Un ajuste Perfect garantiza velocidad?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "El software es gratuito y usa licencia MIT. Según su documentación, no transfiere información salvo cuando solicitas una función de red, como descargas, consultas a providers o leaderboard. Los modelos tienen licencias y riesgos propios."
      },
      "name": "¿llmfit es gratis y privado?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Sí, como filtro inicial. Simula RAM, VRAM y CPU, crea una preselección y valida la compra con benchmarks, contexto, concurrencia, licencia, energía, redundancia y coste operativo."
      },
      "name": "¿Debe una empresa usar llmfit antes de comprar hardware?"
    }
  ]
}
```
