上周老客户问我:「小林,你帮我做的合同草稿能不能用本地 AI 再过一遍?客户名单我不想上传到国外服务器。」我说行。结果用 Ollama 跑了半小时,输出像高中生凑字数 — 我当场想挖地洞。

这工具是什么 + 谁在用

本地跑大模型,就是把 AI 装到你自己的电脑上,数据不出门。常见的免费工具是 Ollama、LM Studio、Jan,三选一就行。我的心理咨询师朋友陈姐(北京,2024 年开始用)拿它处理来访者的脱敏笔记;设计师阿亮在深圳给甲方出 logo 时,也拿它跑一些轻活。

但你跑起来总感觉「比 ChatGPT 笨」,八成是这三个开关没动:

  • 量化等级:模型文件被压缩得越狠越小越快,但也越「傻」。Q4 比 Q8 快但更笨,Q8 又比 FP16 慢。一般人卡在 Q4 出不来效果。
  • 上下文窗口:默认可能是 2044(你能塞给它的字数),你扔给它一份 5000 字合同,它直接「断片」。拉到 4096 或 8192 通常立刻变聪明。
  • 提示词格式:每个模型有自己偏好的聊天模板(Llama 3、Qwen、Mistral 都不一样),用错格式它就开始胡言乱语。

你今天复刻成本

钱:0 - 3000 元。Mac M1 及以上基本零成本(Ollama 直接跑);Windows 用户建议至少 RTX 3060 12G,二手约 2000 元。

时间:30 分钟 - 2 小时。装软件 10 分钟,调三个开关 20 分钟,反复试效果 1 小时。我也是在这步折腾了一下午才搞明白。

技术门槛:会装软件就行。不需要写代码。

第一步:打开 Ollama 或 LM Studio → 找到「Context Length」或「上下文长度」→ 从默认 2044 改成 4096 → 用同一个问题重新问一遍。立刻会感觉不一样。

分人群建议

如果你刚起步 / 还没客户:先别折腾本地。免费版 ChatGPT、Claude、Gemini 够你用半年。先把业务跑通,再想成本优化。我也是折腾本地三个月后才老实回到 ChatGPT 写主稿。

如果你有 1-2 个客户 / 担心数据:本地 AI 值得试。先用 Ollama 跑 Qwen 2.5 7B(中文最友好)+ 4096 上下文,把敏感文件丢进去试试。我那份合同初稿就是这么过出来的。

如果你在扩规模 / 5 人以上:建议直接买 ChatGPT/Claude 企业版(带数据隔离承诺),或者在公司内网服务器部署。本地 AI 适合个人和小团队,人多了维护成本反而高。