“我的电脑能不能跑这个模型”至少包含三个问题:能否加载、能否在目标上下文下稳定运行、输出质量和等待时间是否可以接受。只看模型参数量或下载大小,无法同时回答这三个问题。
本文提供估算与记录方法,不宣称测试过某台机器,也不提供未经验证的 tokens/s 数字。
先分清三种容量
磁盘空间保存下载的模型文件;运行内存容纳权重与运行时状态;上下文相关缓存则随着输入、输出和并发改变。系统、浏览器及其他应用也需要内存,因此下载包比可用内存小,不代表一定能稳定运行。
离散显卡的显存和系统内存也不能简单看成一个池。具体如何分配,取决于运行环境。使用 Ollama 时,可通过官方提供的 ollama ps 查看模型当前加载情况,再结合系统监视工具检查占用。
一个只用于初筛的计算
假设模型有 80 亿个参数,每个参数按 4 bit 存储,理想化权重体积是:
8,000,000,000 × 4 ÷ 8 = 4,000,000,000 字节
约 4 GB(十进制),约 3.73 GiB(二进制)
这不是整机最低内存要求。量化附加信息、运行时、缓存和上下文都未包括在内。不要据此得出“4 GB 内存就能跑 8B 模型”的结论。选择时应查看具体模型标签和文件,再留出运行余量。
从一个小样本开始
先下载你明确选择的模型版本,做一个短输入确认服务正常。然后使用同一段真实材料,例如一份不含敏感信息的说明文档,要求提取固定字段。保留期望答案,检查遗漏、编造和格式错误。
接着增加输入长度,最后才增加并发。一次改变多个条件,失败时很难判断是模型质量、上下文还是机器资源的问题。
| 记录项 | 怎么记录 | 用来决定什么 |
|---|---|---|
| 模型完整标签 | 不只记系列名称 | 保证下一次比较同一版本 |
| 输入与输出长度 | 保存固定样本和输出限制 | 区分任务规模差异 |
| 首次与后续耗时 | 分开记录模型加载和已加载的请求 | 判断交互等待是否可接受 |
| 峰值内存与处理器分配 | 系统监视工具 + ollama ps |
判断是否需要更小模型或更短上下文 |
| 通过与失败样本 | 逐项核对参考答案 | 避免只看运行成功 |
三个常见问题的排查顺序
**下载失败:**先检查网络、磁盘空间和模型名称。此阶段还没有进入生成过程,不应通过调整提示词来解决。
**能输出但很慢:**区分首次加载、首字等待和后续生成。检查处理器分配、内存压力与其他应用占用,缩短上下文后再比较。不要把 CPU 与 GPU 分配差异误判成模型本身的速度变化。
**长文档失败:**先减少输入并关闭并发。确认实际设置的上下文和所用模型支持范围,再逐步恢复负载。能回答一句短问题,并不说明它能处理整份资料。
本地客户端不等于所有请求都在本地
Ollama 官方文档区分本地运行与云功能。如果你的要求是资料在本地处理,需要核对实际模型与运行模式,并按官方说明关闭云功能。其他连接到模型的应用、插件或搜索工具仍可能有独立的数据流。
同样,能在自己电脑打开服务,不代表已经适合直接开放给其他人。需要网络共享时,先规划访问控制,不要仅把监听地址改成公开地址。
什么时候升级硬件
先问小模型能否完成任务。如果质量不达标,单纯增加内存不会让同一个模型更懂任务;如果质量达标但长上下文导致资源不足,才更值得比较更大内存、缩短材料或按段处理的成本。
只偶尔运行重任务时,也可以对照API 任务预算。本地方案的成本包括设备、等待时间和维护,API 方案则包含请求费用和数据处理条件。
参考资料
运行命令、处理器分配和云功能说明依据 Ollama FAQ;安装与使用入口见 Ollama Quickstart。参数体积算例是数学估算,记录表是本站方法建议。返回 Ollama 工具页。