你的硬件能运行哪个本地 LLM?llmfit 使用指南
下载任何本地模型前,都应该先回答一个问题:它能不能在这台机器上流畅运行?llmfit 就是为这个问题设计的。这款免费终端工具会检测内存、CPU、GPU 与显存,再按内存适配度、预估速度、质量和可用上下文对数百个模型排序,并选择预计能装入硬件的最高质量量化版本。
它可以帮你避免下载几十 GB 权重后才发现无法使用。但它不能证明模型在你的业务上足够准确,也不能替你判断许可证或生产并发。正确用法是先用 llmfit 缩小候选范围,再用真实运行时和工作负载做基准测试。
正在规划私有或自托管 AI 产品,需要能经得起评审的模型、硬件与运行时决策?
评审 AI 架构60 秒了解 llmfit
| 问题 | 答案 | 对采购的意义 |
|---|---|---|
| llmfit 是什么? | 用于本地 LLM 硬件选型的交互式 TUI 与 CLI | 下载前先缩小模型与量化版本范围。 |
| 会检测什么? | 可用内存、CPU 核心、GPU、显存与加速后端 | 推荐基于当前机器,而不是通用内存档位。 |
| 会评估什么? | 适配度、预估速度、质量与上下文 | 参数最大的模型不会自动排第一。 |
| 支持哪些系统? | 完整支持 Linux 与 Apple Silicon,Windows 与 Intel Mac 的 GPU 检测范围较窄 | 先运行 llmfit system 确认检测结果。 |
| 连接哪些运行时? | Ollama、llama.cpp、MLX、Docker Model Runner 与 LM Studio | 可从推荐直接进入下载或本地运行。 |
| 能识别 MoE 吗? | 可以,会区分总参数与激活参数,并估算专家卸载 | 不会把 Mixtral、DeepSeek 一类模型当成普通稠密模型。 |
| 是否免费? | 是,llmfit 代码采用 MIT 许可证 | 每个模型仍有独立许可证,需要另行审查。 |
| 评分是否等于保证? | 不是,它是结合硬件信息的估算 | 上线前仍要测试真实提示词、上下文、并发与冷启动。 |
在下载模型前完成安装与推荐
macOS 和 Linux 可以使用 Homebrew,Windows 可以使用 Scoop。如果你已经使用 uv,也可以通过 uvx 直接运行,不保留长期安装。
# macOS 或 Linux
brew install llmfit
# Windows
scoop install llmfit
# 通过 uv 单次运行
uvx llmfit直接运行 llmfit 会打开交互式终端界面。若要形成可重复的选型记录,下面这些 CLI 命令更有用:
# 确认检测到的硬件
llmfit system
# 以 JSON 返回 5 个编程模型建议
llmfit recommend --json --use-case coding --limit 5
# 查看某个候选模型的假设
llmfit info "模型名称"
# 按 8K 上下文估算指定模型所需硬件
llmfit plan "模型名称" --context 8192 --json官方的 CLI 与自动化文档还提供硬件覆盖参数、上下文上限与本地 REST API,因此 llmfit 也能用于脚本和节点调度。
llmfit 如何判断模型是否适配
llmfit 首先识别 CUDA、Metal、ROCm、SYCL 或 CPU 等加速后端。随后,它会把模型目录与可用内存比较,并从 Q8_0 到 Q2_K 依次尝试量化级别,尽量保留能装入硬件的最高质量版本。如果完整上下文无法装入,还可以缩短上下文后重新计算。
| 评分 | 代表什么 | 没有覆盖什么 |
|---|---|---|
| Quality | 模型规模、模型家族表现、量化损失与任务匹配 | 你的领域准确率、语言、安全与工具调用测试 |
| Speed | 根据内存带宽、模型大小与运行模式估算 tokens/s | 提示词处理、批处理、温度限制与运行时内核差异 |
| Fit | 模型使用可用内存的效率,并偏好保留余量 | 其他进程、显示占用与生产并发 |
| Context | 模型标称上下文与目标任务需求的关系 | 长上下文质量衰减与检索内容的真实价值 |
综合评分会随用途改变。编程任务可能把较小的专用模型排在大通用模型前面,推理更重视质量,聊天更重视速度。这比只看参数量更合理,但依然是启发式排序,最终标准应是你的验收集。
MoE 支持为什么重要
混合专家模型会公布很大的总参数量,但每个 token 只激活一部分网络。只按稠密模型计算的工具容易给出误导性的算力结论。llmfit 会读取 MoE 元数据,区分总参数与激活参数,并估算激活专家进入显存、非激活专家卸载到内存的路径。
这并不意味着只有激活参数需要内存。完整权重仍要存在于服务路径的某个位置,通常是系统内存、存储或两者。专家切换、CPU 卸载与 PCIe 流量也会影响速度。llmfit 的 评分原理文档比简单的稠密参数计算更适合作为起点,但仍不能替代真实基准测试。
量化:能装入不等于能交付
量化通过降低权重精度减少内存占用。llmfit 会逐级寻找可以装入硬件的配置。探索阶段这样做很高效,生产阶段还要加上两个边界:
- 使用真实上下文上限。模型在 4K 上下文时可能完全装入显存,到了 32K 却因为 KV Cache 增长而溢出到内存。
- 设定质量底线。能够加载的 Q2 模型,不一定能可靠完成代码、多语言或结构化输出。
用 llmfit plan 输入计划中的上下文,再在固定评估集上比较至少两个相邻量化版本。如果高质量版本只差一点就能装入,正确答案可能是更换硬件或使用 API,而不是继续压缩。
硬件检测需要在哪些地方复核
| 平台 | 检测方式 | 复核重点 |
|---|---|---|
| Linux 与 NVIDIA | nvidia-smi,支持多 GPU | 确认每张卡的显存以及张量或层的分配方案。 |
| Linux 与 AMD | rocm-smi | 部分环境无法读出显存,需要手动覆盖。 |
| Apple Silicon | system_profiler,将统一内存视为共享池 | 为 macOS 与其他应用保留内存。 |
| Intel Arc | 独立显卡用 sysfs,集成显卡用 lspci | 集成显卡会共享系统内存。 |
| Windows | 检测内存与 CPU,NVIDIA 通过 nvidia-smi | 结果异常时运行 llmfit doctor。 |
| Android 或 Termux | 通常只能检测 CPU 与内存 | 当前不支持移动 GPU 自动检测。 |
官方平台支持表说明了 --memory、--ram 与 --cpu-cores 手动覆盖参数。覆盖参数只会改变推荐计算,不会让操作系统或推理引擎获得原本没有的支持。
从绿色适配到生产上线还要做 5 项检查
- 确认检测结果。把
llmfit system --json保存到决策记录,先修正缺失或共享内存值。 - 按真实任务筛选。明确选择编程、推理、聊天、多模态或嵌入,不要让通用评分替你决定专用任务。
- 固定上下文与并发。使用预计输入长度与同时请求数,而不是单用户演示。
- 测试真实运行时。测量 tokens/s、首 token 时间、提示词处理、峰值内存与故障表现。
- 审查完整部署。模型许可证、数据边界、可观测性、升级、回退、安全与总成本都要进入结论。
一个模型即使完美装入硬件,也可能不是正确的商业选择。你可以用我们的本地模型与 API 盈亏平衡框架比较工程投入、闲置容量与 API 支出。Colibri GLM 5.2 消费级硬件分析则展示了内存、带宽和工作负载如何改变具体模型的结论。
什么时候 llmfit 已经够用,什么时候需要工程验证
| 决策 | llmfit 可完成 | 还需补充 |
|---|---|---|
| 个人本地助手 | 筛选模型与量化 | 用你的文档快速测试质量和速度 |
| 购买工作站 | 模拟硬件与升级差距 | 同类硬件实测与完整系统成本 |
| 内部团队试点 | 候选排序与可重复 JSON 输出 | 访问控制、数据边界、评估与用量监控 |
| 面向客户的产品 | 早期容量假设 | 压力测试、扩缩容、回退、安全、许可证与值班责任 |
| GPU 集群调度 | 节点级适配 API | 拓扑感知调度、异构 GPU 测试与故障恢复 |
更稳健的商业路径是分阶段决策。先用 llmfit 排除明显不合适的候选,只为排名前两三个模型投入基准测试时间。只有当实测质量、延迟、风险与总成本优于托管方案时,再决定自托管。
必须写进决策记录的工具边界
- 速度来自内存带宽、模型大小与效率系数的估算,运行时内核和工作负载会改变结果。
- 模型目录嵌入在二进制中,需要升级 llmfit 才能获得目录更新。
- 任务质量依赖模型家族基准与回退规则,不是你的私有评估集。
- 多张 GPU 的总显存相加,不代表不同显卡、互连与带宽完全等价。
- 模型可以加载,不代表许可证、安全、领域准确率或运维成熟度已经达标。
来源与结论边界
安装、命令、运行时、隐私行为与 MIT 许可证来自 llmfit 官方仓库。硬件检测、量化、MoE、评分与速度公式来自官方的 工作原理文档。平台限制来自平台支持说明。tokens/s 与首 token 时间的测量流程来自基准测试指南。信息核查日期为 2026 年 7 月 27 日。Wavect 没有为本文独立复现 llmfit 的速度估算。
常见问题
llmfit 是什么?
llmfit 是一款免费终端工具,会检测内存、CPU、GPU 与显存,并按适配度、预估速度、质量和上下文对数百个本地 LLM 排序。它提供交互式 TUI、CLI、JSON 推荐与本地 REST API。
如何知道我的电脑能运行哪个 LLM?
安装 llmfit 后,先用 llmfit system 确认硬件检测,再运行 llmfit recommend --json --use-case coding --limit 5。你可以把 coding 换成自己的用途,并在下载前用 llmfit info 查看候选模型。
llmfit 支持 Apple Silicon 和 NVIDIA GPU 吗?
支持。Apple Silicon 通过 system_profiler 检测统一内存,NVIDIA 通过 nvidia-smi 检测,并支持多 GPU。Linux 支持范围最广,Windows 的 GPU 检测目前主要面向 NVIDIA。
llmfit 能正确计算 MoE 模型吗?
llmfit 会识别混合专家元数据,区分总参数与激活参数,并估算激活专家进入显存、非激活专家卸载到内存的路径。你仍需测试真实内存流量与运行速度。
Perfect 适配是否保证模型很快?
不保证。Perfect 表示模型满足 llmfit 推荐的 GPU 内存目标。速度仍是估算,上下文、批处理、卸载、内核与并发用户都会改变实测吞吐。
llmfit 是否免费且保护隐私?
llmfit 软件免费并采用 MIT 许可证。其文档说明,除非你主动使用下载、运行时查询或社区排行榜等联网功能,否则不会传输信息。模型本身另有许可证和数据风险。
企业购买 AI 硬件前是否应该用 llmfit?
应该,但要把它当作早期筛选器。模拟计划中的内存、显存与 CPU,生成候选清单,再用实测、真实上下文、并发、许可证、能耗、冗余与运维成本验证采购。
最终思考
下载权重或选择 GPU 前,先运行 llmfit。它能把硬件信息转化为可解释的候选清单,并提前暴露量化、MoE 与上下文限制。
但不要把评分当成最终结论。服务排名靠前的候选模型,运行真实评估集,测量完整延迟和内存曲线,再计算运维成本。最佳模型不是能够加载的最大模型,而是满足质量、延迟、隐私与成本目标的最小可靠系统。
需要把本地模型候选清单转化为生产架构、基准测试计划与自建或 API 决策?
规划本地 AI 试点