为什么折腾本地模型
- 敏感数据不出内网,企业场景的硬需求
- 高频小任务(分类、抽取、格式化)用 API 太贵,本地模型免费跑到饱
- 理解模型的真实边界,才能在方案设计时做出正确的选型
实验环境
Text
实测观察
- 7B-8B Q4 量化:响应流畅,日常问答和文本处理完全够用
- 14B Q4:可用,但内存水位偏高,不适合同时开大型应用
- 更大参数量:16GB 统一内存是硬墙,量化到极限也会频繁换页
- 小模型 + 好提示词,在结构化任务上能逼近大模型 API 的效果
- 推理型模型(R1 系列)的思考链很长,本地跑批量任务时吞吐是瓶颈
- 统一内存架构下,模型加载后的常驻内存比标称值更值得关注