¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware
llmfit responde la pregunta que debería preceder a cualquier descarga de un modelo local: ¿qué funcionará bien en este equipo? La herramienta gratuita detecta RAM, CPU, GPU y VRAM y clasifica cientos de modelos por ajuste de memoria, velocidad estimada, calidad y contexto útil. También selecciona la cuantización de mayor calidad que espera que quepa.
Puede ahorrarte una descarga de 20 GB y una tarde perdida. No demuestra que el modelo tenga suficiente precisión, una licencia válida para tu producto o velocidad bajo carga real. Usa llmfit para crear una preselección y después prueba esa lista con tu runtime y tu carga.
¿Estás planificando un producto de IA privado o self-hosted y necesitas justificar modelo, hardware y runtime?
Revisar la arquitectura de IAllmfit en 60 segundos
| Pregunta | Respuesta | Implicación de compra |
|---|---|---|
| ¿Qué es? | Una TUI interactiva y una CLI para dimensionar hardware de LLM locales | Reduce las opciones de modelo y cuantización antes de descargar. |
| ¿Qué detecta? | RAM disponible, núcleos de CPU, GPU, VRAM y backend de aceleración | La recomendación se calcula para tu equipo, no para un nivel genérico. |
| ¿Qué puntúa? | Ajuste, velocidad estimada, calidad y contexto | El modelo más grande no gana automáticamente. |
| ¿Qué sistemas admite? | Soporte completo para Linux y Apple Silicon, con detección GPU más limitada en Windows y Mac Intel | Confirma primero la detección con llmfit system. |
| ¿Qué runtimes conecta? | Ollama, llama.cpp, MLX, Docker Model Runner y LM Studio | Puedes pasar de la recomendación a la descarga o al runtime local. |
| ¿Entiende modelos MoE? | Sí, separa parámetros totales y activos y modela el offloading de expertos | No trata Mixtral o DeepSeek como modelos densos normales. |
| ¿Es gratis? | Sí, el código de llmfit usa licencia MIT | Cada modelo mantiene su propia licencia. |
| ¿Garantiza el rendimiento? | No, produce una estimación sensible al hardware | Valida prompts, contexto, concurrencia y arranques en frío. |
Instala y pide una recomendación antes de descargar pesos
Homebrew es la ruta sencilla en macOS o Linux. En Windows puedes usar Scoop. Si ya trabajas con uv, uvx ejecuta llmfit sin una instalación persistente.
# macOS o Linux
brew install llmfit
# Windows
scoop install llmfit
# Una ejecución mediante uv
uvx llmfitEl comando llmfit abre la interfaz interactiva. Para un proceso reproducible de decisión, estos comandos de CLI son más útiles:
# Confirma el hardware detectado
llmfit system
# Devuelve cinco recomendaciones para programación
llmfit recommend --json --use-case coding --limit 5
# Revisa los supuestos de un candidato
llmfit info "NOMBRE DEL MODELO"
# Estima hardware para un contexto de 8K
llmfit plan "NOMBRE DEL MODELO" --context 8192 --jsonLa referencia oficial de CLI y automatización incluye overrides de hardware, límites de contexto y una API REST local. Por eso llmfit también sirve para scripts y planificación de nodos.
Cómo decide llmfit qué modelo cabe
Primero identifica el backend de aceleración, como CUDA, Metal, ROCm, SYCL o CPU. Después compara el catálogo con la memoria disponible y una jerarquía de cuantización desde Q8_0 hasta Q2_K. Intenta conservar la opción de mayor calidad que cabe. Si el contexto completo no entra, puede recalcular con uno menor.
| Puntuación | Qué representa | Qué falta |
|---|---|---|
| Quality | Tamaño, reputación de la familia, penalización de cuantización y afinidad con la tarea | Precisión en tu dominio, idioma, seguridad y tool calling |
| Speed | Tokens por segundo estimados según ancho de banda, tamaño y modo | Procesamiento del prompt, batching, temperatura y kernels del runtime |
| Fit | Uso eficiente de memoria con margen recomendado | Otros procesos, memoria gráfica y concurrencia real |
| Context | Contexto anunciado frente al objetivo de la tarea | Degradación con contextos largos y utilidad del contexto recuperado |
La combinación cambia según el caso de uso. Programación puede favorecer a un especialista pequeño sobre un generalista mayor. Razonamiento da más peso a calidad y chat a velocidad. Es mejor que ordenar por parámetros, pero sigue siendo una heurística. Tu conjunto de aceptación decide.
Por qué importa el soporte MoE
Los modelos Mixture-of-Experts publican muchos parámetros totales, pero solo activan una parte por token. Una calculadora pensada para modelos densos puede producir una estimación engañosa. llmfit lee metadatos MoE, distingue parámetros activos y modela una ruta con expertos activos en VRAM e inactivos descargados a RAM.
Eso no significa que solo los parámetros activos necesiten memoria. Todos los pesos deben existir en algún punto del serving, normalmente RAM, almacenamiento o ambos. El cambio de expertos, el offload a CPU y el tráfico PCIe afectan la velocidad. La documentación del modelo de puntuación es un mejor punto de partida que la aritmética densa, pero no sustituye el benchmark.
Cuantización: que quepa no significa que sirva
La cuantización reduce memoria al almacenar pesos con menor precisión. llmfit recorre sus niveles hasta encontrar una configuración viable. Para producción debes añadir dos límites:
- Usa el contexto real. Un modelo puede caber a 4K y desbordarse a RAM a 32K por el crecimiento de la caché KV.
- Define un mínimo de calidad. Un modelo Q2 que carga no tiene por qué ser suficiente para código, varios idiomas o JSON fiable.
Ejecuta llmfit plan con el contexto previsto y compara al menos dos cuantizaciones vecinas sobre un conjunto fijo. Si la mejor opción casi cabe, quizá debas cambiar de hardware o usar una API en vez de comprimir más.
Dónde verificar la detección de hardware
| Plataforma | Detección | Comprobación |
|---|---|---|
| Linux con NVIDIA | nvidia-smi, también con varias GPU | Verifica VRAM por tarjeta y el reparto de tensores o capas. |
| Linux con AMD | rocm-smi | La VRAM puede quedar desconocida y requerir un override. |
| Apple Silicon | system_profiler, memoria unificada como pool compartido | Reserva memoria para macOS y otras aplicaciones. |
| Intel Arc | sysfs para GPU discreta y lspci para integrada | La gráfica integrada comparte la RAM disponible. |
| Windows | RAM y CPU, más NVIDIA mediante nvidia-smi | Usa llmfit doctor si los datos parecen incorrectos. |
| Android o Termux | Normalmente solo CPU y RAM | La detección de GPU móvil no está disponible. |
La matriz oficial de plataformas explica los overrides --memory, --ram y --cpu-cores. Un override cambia el cálculo, pero no añade soporte a un runtime que no lo tenga.
Cinco comprobaciones entre un ajuste verde y producción
- Confirma el equipo detectado. Guarda
llmfit system --jsoncon la decisión y corrige valores ausentes o compartidos. - Filtra por la tarea real. Elige programación, razonamiento, chat, multimodal o embeddings.
- Fija contexto y concurrencia. Modela entradas y peticiones simultáneas reales, no una demo individual.
- Prueba el runtime. Mide tokens por segundo, tiempo hasta el primer token, procesamiento del prompt, pico de memoria y fallos.
- Revisa todo el despliegue. Incluye licencia, datos, observabilidad, actualizaciones, fallback, seguridad y coste total.
Un modelo puede encajar perfectamente y ser una mala decisión comercial. Compara ingeniería y capacidad ociosa con el gasto de API mediante nuestro marco de break-even entre modelos locales y APIs. El análisis de Colibri GLM 5.2 en hardware de consumo muestra cómo memoria, ancho de banda y carga cambian la respuesta.
Cuándo basta llmfit y cuándo empieza la ingeniería
| Decisión | Usa llmfit para | Añade ingeniería para |
|---|---|---|
| Asistente personal | Modelo y cuantización iniciales | Prueba rápida de calidad y velocidad con tus documentos |
| Compra de workstation | Simulación y diferencia de upgrade | Benchmarks comparables y coste completo del sistema |
| Piloto interno | Ranking y salida JSON repetible | Accesos, límites de datos, evaluación y monitorización |
| Producto para clientes | Supuestos iniciales de capacidad | Carga, escalado, fallback, seguridad, licencia y on-call |
| Clúster GPU | API de ajuste por nodo | Topología, hardware heterogéneo y recuperación |
El camino comercial limpio es progresivo. Descarta candidatos malos con llmfit, invierte tiempo de benchmark solo en los dos o tres mejores y elige self-hosting cuando calidad, latencia, riesgo y coste medidos superen a la opción gestionada.
Límites que deben constar en la decisión
- La velocidad se estima con ancho de banda, tamaño y factores de eficiencia. Los kernels y la carga pueden cambiar el resultado.
- El catálogo está integrado en el binario. Actualiza llmfit para recibir nuevos modelos.
- La calidad por tarea usa benchmarks de familias y heurísticas, no tu conjunto privado.
- Sumar VRAM de varias GPU no iguala tarjetas, interconexiones ni anchos de banda.
- Que un modelo cargue no valida licencia, seguridad, precisión de dominio ni preparación operativa.
Fuentes y límites de las afirmaciones
Instalación, comandos, runtimes, privacidad y licencia MIT proceden del repositorio de llmfit. Detección, cuantización, MoE, puntuación y fórmulas de velocidad proceden de la documentación técnica. Los límites de plataforma están en la referencia de soporte. La medición de tokens por segundo y tiempo al primer token sigue la guía de benchmarking. Datos verificados el 27 de julio de 2026. Wavect no reprodujo de forma independiente las estimaciones para este artículo.
Preguntas frecuentes
¿Qué es llmfit?
llmfit es una herramienta gratuita de terminal que detecta RAM, CPU, GPU y VRAM y clasifica cientos de LLM locales por ajuste, velocidad estimada, calidad y contexto. Ofrece TUI, CLI, JSON y API REST local.
¿Cómo sé qué LLM puedo ejecutar en mi PC?
Instala llmfit, verifica el hardware con llmfit system y ejecuta llmfit recommend --json --use-case coding --limit 5. Cambia coding por tu tarea y revisa cada candidato con llmfit info.
¿llmfit admite Apple Silicon y GPU NVIDIA?
Sí. Apple Silicon usa memoria unificada detectada con system_profiler. NVIDIA usa nvidia-smi y admite varias GPU. Linux tiene el soporte más amplio. En Windows, la detección GPU se centra en NVIDIA.
¿llmfit calcula bien modelos MoE?
Detecta metadatos Mixture-of-Experts y separa parámetros totales y activos. Modela expertos activos en VRAM e inactivos en RAM. Aun así, debes medir tráfico de memoria y velocidad del runtime.
¿Un ajuste Perfect garantiza velocidad?
No. Perfect indica que el modelo cumple el objetivo recomendado de memoria GPU. La velocidad sigue siendo una estimación. Contexto, batching, offload, kernels y concurrencia cambian el rendimiento.
¿llmfit es gratis y privado?
El software es gratuito y usa licencia MIT. Según su documentación, no transfiere información salvo cuando solicitas una función de red, como descargas, consultas a providers o leaderboard. Los modelos tienen licencias y riesgos propios.
¿Debe una empresa usar llmfit antes de comprar hardware?
Sí, como filtro inicial. Simula RAM, VRAM y CPU, crea una preselección y valida la compra con benchmarks, contexto, concurrencia, licencia, energía, redundancia y coste operativo.
Reflexiones finales
Ejecuta llmfit antes de descargar pesos o elegir una GPU. Convierte datos de hardware en una preselección defendible y hace visibles la cuantización, MoE y los límites de contexto.
Después no confundas la puntuación con la decisión final. Sirve los mejores candidatos, usa tu evaluación real, mide toda la curva de latencia y memoria y calcula la operación. El ganador no es el modelo más grande que carga, sino el sistema fiable más pequeño que cumple calidad, latencia, privacidad y coste.
¿Necesitas convertir una lista de modelos locales en arquitectura de producción, plan de benchmark y decisión build-versus-API?
Planificar el piloto de IA local