杭州, China
BlogMay 15, 2026

本地 LLM 部署实验:Mac mini M4 16GB 能跑什么

Local LLM Lab · Ollama 实测笔记
王春刚
  • 敏感数据不出内网,企业场景的硬需求
  • 高频小任务(分类、抽取、格式化)用 API 太贵,本地模型免费跑到饱
  • 理解模型的真实边界,才能在方案设计时做出正确的选型
Text
硬件:  Mac mini M4 16GB 统一内存
运行时: Ollama
测试模型: Qwen3 / Gemma / DeepSeek R1(蒸馏版)
能流畅跑的甜点区:7B-14B 量化模型
  • 7B-8B Q4 量化:响应流畅,日常问答和文本处理完全够用
  • 14B Q4:可用,但内存水位偏高,不适合同时开大型应用
  • 更大参数量:16GB 统一内存是硬墙,量化到极限也会频繁换页
几个反直觉的发现
  • 小模型 + 好提示词,在结构化任务上能逼近大模型 API 的效果
  • 推理型模型(R1 系列)的思考链很长,本地跑批量任务时吞吐是瓶颈
  • 统一内存架构下,模型加载后的常驻内存比标称值更值得关注
| 场景 | 建议 | |---|---| | 敏感数据处理 | 本地模型,隐私优先 | | 高频结构化任务 | 本地小模型 + 严格提示词模板 | | 复杂推理 / 创作 | 云端 API,效果差距仍然显著 | | Agent 工具调用 | 混合:路由层本地,执行层云端 |
Share this post: