Volver
Kevin Riedl

11 min de lectura · 27 de julio de 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware

llmfit responde la pregunta que debería preceder a cualquier descarga de un modelo local: ¿qué funcionará bien en este equipo? La herramienta gratuita detecta RAM, CPU, GPU y VRAM y clasifica cientos de modelos por ajuste de memoria, velocidad, calidad y contexto útil. La velocidad puede ser una medición local, un resultado comunitario equivalente, una estimación calibrada localmente o una estimación de fórmula. También selecciona la cuantización de mayor calidad que espera que quepa.

Puede ahorrarte una descarga de 20 GB y una tarde perdida. No demuestra que el modelo tenga suficiente precisión, una licencia válida para tu producto o velocidad bajo carga real. Usa llmfit para crear una preselección y después prueba esa lista con tu runtime y tu carga.

¿Estás planificando un producto de IA privado o self-hosted y necesitas justificar modelo, hardware y runtime?

 Revisar la arquitectura de IA

llmfit en 60 segundos

Datos de llmfit verificados el 2 de septiembre de 2026
PreguntaRespuestaImplicación de compra
¿Qué es?Una TUI interactiva y una CLI para dimensionar hardware de LLM localesReduce las opciones de modelo y cuantización antes de descargar.
¿Versión estable actual?v1.1.12, publicada el 28 de agosto de 2026Fija la versión usada en la decisión porque la lógica de hardware, ajuste y catálogo sigue cambiando.
¿Qué detecta?RAM disponible, núcleos de CPU, GPU, VRAM y backend de aceleraciónLa recomendación se calcula para tu equipo, no para un nivel genérico.
¿Qué puntúa?Ajuste, velocidad, calidad y contextoEl modelo más grande no gana automáticamente y debes inspeccionar la base del valor de velocidad.
¿Qué sistemas admite?Soporte completo para Linux y Apple Silicon, con detección GPU más limitada en Windows y Mac IntelConfirma primero la detección con llmfit system.
¿Qué runtimes conecta?Ollama, llama.cpp, MLX, Docker Model Runner y LM StudioPuedes pasar de la recomendación a la descarga o al runtime local.
¿Entiende modelos MoE?Sí, separa parámetros totales y activos y modela el offloading de expertosNo trata Mixtral o DeepSeek como modelos densos normales.
¿Es gratis?Sí, el código de llmfit usa licencia MITCada modelo mantiene su propia licencia.
¿Garantiza el rendimiento?No, produce una estimación sensible al hardwareValida prompts, contexto, concurrencia y arranques en frío.

Instala y pide una recomendación antes de descargar pesos

El proyecto recomienda su tap de Homebrew con binario precompilado para macOS o Linux. La fórmula de Homebrew Core también existe, pero puede compilar desde el código fuente si no hay una botella disponible. En Windows puedes usar Scoop. Si ya trabajas con uv, uvx ejecuta llmfit sin una instalación persistente.

# macOS o Linux
brew install AlexsJones/llmfit/llmfit

# Windows
scoop install llmfit

# Una ejecución mediante uv
uvx llmfit

El comando llmfit abre la interfaz interactiva. Para un proceso reproducible de decisión, estos comandos de CLI son más útiles:

# Confirma el hardware detectado
llmfit system

# Devuelve cinco recomendaciones para programación
llmfit recommend --json --use-case coding --limit 5

# Revisa los supuestos de un candidato
llmfit info "NOMBRE DEL MODELO"

# Estima hardware para un contexto de 8K
llmfit plan "NOMBRE DEL MODELO" --context 8192 --json

La referencia oficial de CLI y automatización incluye overrides de hardware, límites de contexto y una API REST local. Por eso llmfit también sirve para scripts y planificación de nodos.

Cómo decide llmfit qué modelo cabe

Primero identifica el backend de aceleración, como CUDA, Metal, ROCm, SYCL o CPU. Después compara el catálogo con la memoria disponible y una jerarquía de cuantización desde Q8_0 hasta Q2_K. Intenta conservar la opción de mayor calidad que cabe. Si el contexto completo no entra, puede recalcular con uno menor.

PuntuaciónQué representaQué falta
QualityTamaño, reputación de la familia, penalización de cuantización y afinidad con la tareaPrecisión en tu dominio, idioma, seguridad y tool calling
SpeedTokens por segundo medidos, calibrados o estimados, con confianza separadaCarga futura de producción, batching, temperatura y kernels del runtime
FitUso eficiente de memoria con margen recomendadoOtros procesos, memoria gráfica y concurrencia real
ContextContexto anunciado frente al objetivo de la tareaDegradación con contextos largos y utilidad del contexto recuperado

La combinación cambia según el caso de uso. Programación puede favorecer a un especialista pequeño sobre un generalista mayor. Razonamiento da más peso a calidad y chat a velocidad. Es mejor que ordenar por parámetros, pero sigue siendo una heurística. Tu conjunto de aceptación decide.

La velocidad ya no siempre procede de una fórmula. El orden de confianza actual es una medición propia, una medición comunitaria en hardware equivalente, una mediana de localmaxxing para un preset equivalente y, por último, la estimación de fórmula. Los benchmarks locales aptos también pueden calibrar otras estimaciones en el mismo equipo. Revisa la confianza y la base de la estimación antes de comparar todos los valores de tokens por segundo como si tuvieran la misma evidencia.

Por qué importa el soporte MoE

Los modelos Mixture-of-Experts publican muchos parámetros totales, pero solo activan una parte por token. Una calculadora pensada para modelos densos puede producir una estimación engañosa. llmfit lee metadatos MoE, distingue parámetros activos y modela una ruta con expertos activos en VRAM e inactivos descargados a RAM.

Eso no significa que solo los parámetros activos necesiten memoria. Todos los pesos deben existir en algún punto del serving, normalmente RAM, almacenamiento o ambos. El cambio de expertos, el offload a CPU y el tráfico PCIe afectan la velocidad. La documentación del modelo de puntuación es un mejor punto de partida que la aritmética densa, pero no sustituye el benchmark.

Cuantización: que quepa no significa que sirva

La cuantización reduce memoria al almacenar pesos con menor precisión. llmfit recorre sus niveles hasta encontrar una configuración viable. Para producción debes añadir dos límites:

  • Usa el contexto real. Un modelo puede caber a 4K y desbordarse a RAM a 32K por el crecimiento de la caché KV.
  • Define un mínimo de calidad. Un modelo Q2 que carga no tiene por qué ser suficiente para código, varios idiomas o JSON fiable.

Ejecuta llmfit plan con el contexto previsto y compara al menos dos cuantizaciones vecinas sobre un conjunto fijo. Si la mejor opción casi cabe, quizá debas cambiar de hardware o usar una API en vez de comprimir más.

Dónde verificar la detección de hardware

PlataformaDetecciónComprobación
Linux con NVIDIAnvidia-smi, también con varias GPUVerifica VRAM por tarjeta y el reparto de tensores o capas.
Linux con AMDrocm-smiLa VRAM puede quedar desconocida y requerir un override.
Linux con Ascendnpu-smiLa detección y una estimación Ascend no prueban que el modelo funcione correctamente con tu runtime.
Apple Siliconsystem_profiler, memoria unificada como pool compartidoReserva memoria para macOS y otras aplicaciones.
Intel Arcsysfs para GPU discreta y lspci para integradaLa gráfica integrada comparte la RAM disponible.
WindowsRAM y CPU, más NVIDIA mediante nvidia-smiUsa llmfit doctor si los datos parecen incorrectos.
Android o TermuxNormalmente solo CPU y RAMLa detección de GPU móvil no está disponible.

La matriz oficial de plataformas explica los overrides --memory, --ram y --cpu-cores. Un override cambia el cálculo, pero no añade soporte a un runtime que no lo tenga.

Cinco comprobaciones entre un ajuste verde y producción

  1. Confirma el equipo detectado. Guarda llmfit system --json con la decisión y corrige valores ausentes o compartidos.
  2. Filtra por la tarea real. Elige programación, razonamiento, chat, multimodal o embeddings.
  3. Fija contexto y concurrencia. Modela entradas y peticiones simultáneas reales, no una demo individual.
  4. Prueba el runtime. Mide tokens por segundo, tiempo hasta el primer token, procesamiento del prompt, pico de memoria y fallos. llmfit guarda localmente las ejecuciones correctas; compartirlas como pull request de GitHub es opcional.
  5. Revisa todo el despliegue. Incluye licencia, datos, observabilidad, actualizaciones, fallback, seguridad y coste total.

Un modelo puede encajar perfectamente y ser una mala decisión comercial. Compara ingeniería y capacidad ociosa con el gasto de API mediante nuestro marco de break-even entre modelos locales y APIs. Si eliges un nuevo sobremesa de Apple, nuestra guía de compra del Mac mini M6 y Mac Studio M5 asigna modelo, contexto y concurrencia al nivel de memoria adecuado. Para un caso actual con 128 GB de memoria unificada, nuestro análisis de DeepSeek V4 Flash 0731 en un solo PC separa que el modelo cargue de que esté listo para producción. El análisis de Colibri GLM 5.2 en hardware de consumo muestra cómo memoria, ancho de banda y carga cambian la respuesta.

Cuándo basta llmfit y cuándo empieza la ingeniería

DecisiónUsa llmfit paraAñade ingeniería para
Asistente personalModelo y cuantización inicialesPrueba rápida de calidad y velocidad con tus documentos
Compra de workstationSimulación y diferencia de upgradeBenchmarks comparables y coste completo del sistema
Piloto internoRanking y salida JSON repetibleAccesos, límites de datos, evaluación y monitorización
Producto para clientesSupuestos iniciales de capacidadCarga, escalado, fallback, seguridad, licencia y on-call
Clúster GPUAPI de ajuste por nodoTopología, hardware heterogéneo y recuperación

El camino comercial limpio es progresivo. Descarta candidatos malos con llmfit, invierte tiempo de benchmark solo en los dos o tres mejores y elige self-hosting cuando calidad, latencia, riesgo y coste medidos superen a la opción gestionada.

Límites que deben constar en la decisión

  • Un valor de velocidad puede ser medido, calibrado o estimado. La confianza y la base de la estimación importan tanto como la cifra.
  • El catálogo está integrado en el binario. Actualiza llmfit para recibir nuevos modelos.
  • La calidad por tarea usa benchmarks de familias y heurísticas, no tu conjunto privado.
  • Sumar VRAM de varias GPU no iguala tarjetas, interconexiones ni anchos de banda.
  • Que un modelo cargue no valida licencia, seguridad, precisión de dominio ni preparación operativa.

Fuentes y límites de las afirmaciones

Instalación, comandos, runtimes, privacidad y licencia MIT proceden del repositorio de llmfit. Detección, cuantización, MoE, niveles de ajuste, puntuación y confianza de velocidad proceden de la documentación técnica. Los límites de plataforma están en la referencia de soporte. El flujo actual de benchmarks locales, comunitarios y calibrados está en la referencia de benchmarks de la CLI. Datos verificados el 2 de septiembre de 2026. Wavect no reprodujo de forma independiente las mediciones ni estimaciones para este artículo.

Preguntas frecuentes

¿Qué es llmfit?

llmfit es una herramienta gratuita de terminal que detecta RAM, CPU, GPU y VRAM y clasifica cientos de LLM locales por ajuste, velocidad, calidad y contexto. La velocidad puede ser medida, calibrada o estimada. Ofrece TUI, CLI, JSON y API REST local.

¿Cómo sé qué LLM puedo ejecutar en mi PC?

Instala llmfit, verifica el hardware con llmfit system y ejecuta llmfit recommend --json --use-case coding --limit 5. Cambia coding por tu tarea y revisa cada candidato con llmfit info.

¿llmfit admite Apple Silicon y GPU NVIDIA?

Sí. Apple Silicon usa memoria unificada detectada con system_profiler. NVIDIA usa nvidia-smi y admite varias GPU. Linux tiene el soporte más amplio. En Windows, la detección GPU se centra en NVIDIA.

¿llmfit calcula bien modelos MoE?

Detecta metadatos Mixture-of-Experts y separa parámetros totales y activos. Modela expertos activos en VRAM e inactivos en RAM. Aun así, debes medir tráfico de memoria y velocidad del runtime.

¿Un ajuste Perfect garantiza velocidad?

No. Perfect significa que una ruta GPU o tensor-parallel usa como máximo el 60 por ciento del pool de memoria relevante. MoE con offload, CPU+GPU y CPU quedan limitados a Good. La velocidad tiene una base de evidencia separada; contexto, batching, offload, kernels y concurrencia siguen cambiando el rendimiento.

¿llmfit es gratis y privado?

El software es gratuito y usa licencia MIT. Según su documentación, no transfiere información salvo cuando solicitas una función de red, como descargas, consultas a providers o leaderboard. Los modelos tienen licencias y riesgos propios.

¿Debe una empresa usar llmfit antes de comprar hardware?

Sí, como filtro inicial. Simula RAM, VRAM y CPU, crea una preselección y valida la compra con benchmarks, contexto, concurrencia, licencia, energía, redundancia y coste operativo.

Reflexiones finales

Ejecuta llmfit antes de descargar pesos o elegir una GPU. Convierte datos de hardware en una preselección defendible y hace visibles la cuantización, MoE y los límites de contexto.

Después no confundas la puntuación con la decisión final. Sirve los mejores candidatos, usa tu evaluación real, mide toda la curva de latencia y memoria y calcula la operación. El ganador no es el modelo más grande que carga, sino el sistema fiable más pequeño que cumple calidad, latencia, privacidad y coste.

¿Necesitas convertir una lista de modelos locales en arquitectura de producción, plan de benchmark y decisión build-versus-API?

 Planificar el piloto de IA local

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

11 min de lectura · 27 de julio de 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.