Volver
Kevin Riedl

11 min de lectura · 27 de julio de 2026

Siguiente

¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware

llmfit responde la pregunta que debería preceder a cualquier descarga de un modelo local: ¿qué funcionará bien en este equipo? La herramienta gratuita detecta RAM, CPU, GPU y VRAM y clasifica cientos de modelos por ajuste de memoria, velocidad estimada, calidad y contexto útil. También selecciona la cuantización de mayor calidad que espera que quepa.

Puede ahorrarte una descarga de 20 GB y una tarde perdida. No demuestra que el modelo tenga suficiente precisión, una licencia válida para tu producto o velocidad bajo carga real. Usa llmfit para crear una preselección y después prueba esa lista con tu runtime y tu carga.

¿Estás planificando un producto de IA privado o self-hosted y necesitas justificar modelo, hardware y runtime?

 Revisar la arquitectura de IA

llmfit en 60 segundos

Datos de llmfit verificados el 27 de julio de 2026
PreguntaRespuestaImplicación de compra
¿Qué es?Una TUI interactiva y una CLI para dimensionar hardware de LLM localesReduce las opciones de modelo y cuantización antes de descargar.
¿Qué detecta?RAM disponible, núcleos de CPU, GPU, VRAM y backend de aceleraciónLa recomendación se calcula para tu equipo, no para un nivel genérico.
¿Qué puntúa?Ajuste, velocidad estimada, calidad y contextoEl modelo más grande no gana automáticamente.
¿Qué sistemas admite?Soporte completo para Linux y Apple Silicon, con detección GPU más limitada en Windows y Mac IntelConfirma primero la detección con llmfit system.
¿Qué runtimes conecta?Ollama, llama.cpp, MLX, Docker Model Runner y LM StudioPuedes pasar de la recomendación a la descarga o al runtime local.
¿Entiende modelos MoE?Sí, separa parámetros totales y activos y modela el offloading de expertosNo trata Mixtral o DeepSeek como modelos densos normales.
¿Es gratis?Sí, el código de llmfit usa licencia MITCada modelo mantiene su propia licencia.
¿Garantiza el rendimiento?No, produce una estimación sensible al hardwareValida prompts, contexto, concurrencia y arranques en frío.

Instala y pide una recomendación antes de descargar pesos

Homebrew es la ruta sencilla en macOS o Linux. En Windows puedes usar Scoop. Si ya trabajas con uv, uvx ejecuta llmfit sin una instalación persistente.

# macOS o Linux
brew install llmfit

# Windows
scoop install llmfit

# Una ejecución mediante uv
uvx llmfit

El comando llmfit abre la interfaz interactiva. Para un proceso reproducible de decisión, estos comandos de CLI son más útiles:

# Confirma el hardware detectado
llmfit system

# Devuelve cinco recomendaciones para programación
llmfit recommend --json --use-case coding --limit 5

# Revisa los supuestos de un candidato
llmfit info "NOMBRE DEL MODELO"

# Estima hardware para un contexto de 8K
llmfit plan "NOMBRE DEL MODELO" --context 8192 --json

La referencia oficial de CLI y automatización incluye overrides de hardware, límites de contexto y una API REST local. Por eso llmfit también sirve para scripts y planificación de nodos.

Cómo decide llmfit qué modelo cabe

Primero identifica el backend de aceleración, como CUDA, Metal, ROCm, SYCL o CPU. Después compara el catálogo con la memoria disponible y una jerarquía de cuantización desde Q8_0 hasta Q2_K. Intenta conservar la opción de mayor calidad que cabe. Si el contexto completo no entra, puede recalcular con uno menor.

PuntuaciónQué representaQué falta
QualityTamaño, reputación de la familia, penalización de cuantización y afinidad con la tareaPrecisión en tu dominio, idioma, seguridad y tool calling
SpeedTokens por segundo estimados según ancho de banda, tamaño y modoProcesamiento del prompt, batching, temperatura y kernels del runtime
FitUso eficiente de memoria con margen recomendadoOtros procesos, memoria gráfica y concurrencia real
ContextContexto anunciado frente al objetivo de la tareaDegradación con contextos largos y utilidad del contexto recuperado

La combinación cambia según el caso de uso. Programación puede favorecer a un especialista pequeño sobre un generalista mayor. Razonamiento da más peso a calidad y chat a velocidad. Es mejor que ordenar por parámetros, pero sigue siendo una heurística. Tu conjunto de aceptación decide.

Por qué importa el soporte MoE

Los modelos Mixture-of-Experts publican muchos parámetros totales, pero solo activan una parte por token. Una calculadora pensada para modelos densos puede producir una estimación engañosa. llmfit lee metadatos MoE, distingue parámetros activos y modela una ruta con expertos activos en VRAM e inactivos descargados a RAM.

Eso no significa que solo los parámetros activos necesiten memoria. Todos los pesos deben existir en algún punto del serving, normalmente RAM, almacenamiento o ambos. El cambio de expertos, el offload a CPU y el tráfico PCIe afectan la velocidad. La documentación del modelo de puntuación es un mejor punto de partida que la aritmética densa, pero no sustituye el benchmark.

Cuantización: que quepa no significa que sirva

La cuantización reduce memoria al almacenar pesos con menor precisión. llmfit recorre sus niveles hasta encontrar una configuración viable. Para producción debes añadir dos límites:

  • Usa el contexto real. Un modelo puede caber a 4K y desbordarse a RAM a 32K por el crecimiento de la caché KV.
  • Define un mínimo de calidad. Un modelo Q2 que carga no tiene por qué ser suficiente para código, varios idiomas o JSON fiable.

Ejecuta llmfit plan con el contexto previsto y compara al menos dos cuantizaciones vecinas sobre un conjunto fijo. Si la mejor opción casi cabe, quizá debas cambiar de hardware o usar una API en vez de comprimir más.

Dónde verificar la detección de hardware

PlataformaDetecciónComprobación
Linux con NVIDIAnvidia-smi, también con varias GPUVerifica VRAM por tarjeta y el reparto de tensores o capas.
Linux con AMDrocm-smiLa VRAM puede quedar desconocida y requerir un override.
Apple Siliconsystem_profiler, memoria unificada como pool compartidoReserva memoria para macOS y otras aplicaciones.
Intel Arcsysfs para GPU discreta y lspci para integradaLa gráfica integrada comparte la RAM disponible.
WindowsRAM y CPU, más NVIDIA mediante nvidia-smiUsa llmfit doctor si los datos parecen incorrectos.
Android o TermuxNormalmente solo CPU y RAMLa detección de GPU móvil no está disponible.

La matriz oficial de plataformas explica los overrides --memory, --ram y --cpu-cores. Un override cambia el cálculo, pero no añade soporte a un runtime que no lo tenga.

Cinco comprobaciones entre un ajuste verde y producción

  1. Confirma el equipo detectado. Guarda llmfit system --json con la decisión y corrige valores ausentes o compartidos.
  2. Filtra por la tarea real. Elige programación, razonamiento, chat, multimodal o embeddings.
  3. Fija contexto y concurrencia. Modela entradas y peticiones simultáneas reales, no una demo individual.
  4. Prueba el runtime. Mide tokens por segundo, tiempo hasta el primer token, procesamiento del prompt, pico de memoria y fallos.
  5. Revisa todo el despliegue. Incluye licencia, datos, observabilidad, actualizaciones, fallback, seguridad y coste total.

Un modelo puede encajar perfectamente y ser una mala decisión comercial. Compara ingeniería y capacidad ociosa con el gasto de API mediante nuestro marco de break-even entre modelos locales y APIs. El análisis de Colibri GLM 5.2 en hardware de consumo muestra cómo memoria, ancho de banda y carga cambian la respuesta.

Cuándo basta llmfit y cuándo empieza la ingeniería

DecisiónUsa llmfit paraAñade ingeniería para
Asistente personalModelo y cuantización inicialesPrueba rápida de calidad y velocidad con tus documentos
Compra de workstationSimulación y diferencia de upgradeBenchmarks comparables y coste completo del sistema
Piloto internoRanking y salida JSON repetibleAccesos, límites de datos, evaluación y monitorización
Producto para clientesSupuestos iniciales de capacidadCarga, escalado, fallback, seguridad, licencia y on-call
Clúster GPUAPI de ajuste por nodoTopología, hardware heterogéneo y recuperación

El camino comercial limpio es progresivo. Descarta candidatos malos con llmfit, invierte tiempo de benchmark solo en los dos o tres mejores y elige self-hosting cuando calidad, latencia, riesgo y coste medidos superen a la opción gestionada.

Límites que deben constar en la decisión

  • La velocidad se estima con ancho de banda, tamaño y factores de eficiencia. Los kernels y la carga pueden cambiar el resultado.
  • El catálogo está integrado en el binario. Actualiza llmfit para recibir nuevos modelos.
  • La calidad por tarea usa benchmarks de familias y heurísticas, no tu conjunto privado.
  • Sumar VRAM de varias GPU no iguala tarjetas, interconexiones ni anchos de banda.
  • Que un modelo cargue no valida licencia, seguridad, precisión de dominio ni preparación operativa.

Fuentes y límites de las afirmaciones

Instalación, comandos, runtimes, privacidad y licencia MIT proceden del repositorio de llmfit. Detección, cuantización, MoE, puntuación y fórmulas de velocidad proceden de la documentación técnica. Los límites de plataforma están en la referencia de soporte. La medición de tokens por segundo y tiempo al primer token sigue la guía de benchmarking. Datos verificados el 27 de julio de 2026. Wavect no reprodujo de forma independiente las estimaciones para este artículo.

Preguntas frecuentes

¿Qué es llmfit?

llmfit es una herramienta gratuita de terminal que detecta RAM, CPU, GPU y VRAM y clasifica cientos de LLM locales por ajuste, velocidad estimada, calidad y contexto. Ofrece TUI, CLI, JSON y API REST local.

¿Cómo sé qué LLM puedo ejecutar en mi PC?

Instala llmfit, verifica el hardware con llmfit system y ejecuta llmfit recommend --json --use-case coding --limit 5. Cambia coding por tu tarea y revisa cada candidato con llmfit info.

¿llmfit admite Apple Silicon y GPU NVIDIA?

Sí. Apple Silicon usa memoria unificada detectada con system_profiler. NVIDIA usa nvidia-smi y admite varias GPU. Linux tiene el soporte más amplio. En Windows, la detección GPU se centra en NVIDIA.

¿llmfit calcula bien modelos MoE?

Detecta metadatos Mixture-of-Experts y separa parámetros totales y activos. Modela expertos activos en VRAM e inactivos en RAM. Aun así, debes medir tráfico de memoria y velocidad del runtime.

¿Un ajuste Perfect garantiza velocidad?

No. Perfect indica que el modelo cumple el objetivo recomendado de memoria GPU. La velocidad sigue siendo una estimación. Contexto, batching, offload, kernels y concurrencia cambian el rendimiento.

¿llmfit es gratis y privado?

El software es gratuito y usa licencia MIT. Según su documentación, no transfiere información salvo cuando solicitas una función de red, como descargas, consultas a providers o leaderboard. Los modelos tienen licencias y riesgos propios.

¿Debe una empresa usar llmfit antes de comprar hardware?

Sí, como filtro inicial. Simula RAM, VRAM y CPU, crea una preselección y valida la compra con benchmarks, contexto, concurrencia, licencia, energía, redundancia y coste operativo.

Reflexiones finales

Ejecuta llmfit antes de descargar pesos o elegir una GPU. Convierte datos de hardware en una preselección defendible y hace visibles la cuantización, MoE y los límites de contexto.

Después no confundas la puntuación con la decisión final. Sirve los mejores candidatos, usa tu evaluación real, mide toda la curva de latencia y memoria y calcula la operación. El ganador no es el modelo más grande que carga, sino el sistema fiable más pequeño que cumple calidad, latencia, privacidad y coste.

¿Necesitas convertir una lista de modelos locales en arquitectura de producción, plan de benchmark y decisión build-versus-API?

 Planificar el piloto de IA local

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

11 min de lectura · 27 de julio de 2026

Siguiente

Recibe nuevos artículos por correo

Un correo breve cuando publicamos. Gratis y sin seguimiento.

Gratis, doble opt-in y sin píxeles de seguimiento.