大模型「知识截止、不知私有数据、会一本正经地胡说」——本讲教你把模型从闭卷考试变成开卷考试:自建私有知识库(腾讯 ima / RAG),并在自己电脑上离线部署大模型(Ollama),让数据不出本机。
学完本讲,你应当能够……
ollama run deepseek-r1:7b / qwen2.5:7b输入一个问题,观察 纯大模型「闭卷」 与 RAG「开卷」 的差别——检索到片段才是可靠回答的前提。
| 方案 | 原理 | 优点 | 代价 / 适用 |
|---|---|---|---|
| 提示工程 | 把内容塞进 Prompt | 零成本、即时 | 受上下文窗口限制,无法沉淀 |
| RAG 检索增强 | 外挂知识库,边查边答 | 可更新、可溯源、成本低 | 依赖检索质量,适合绝大多数场景 |
| 微调 Fine-Tuning | 用数据再训练模型 | 风格/能力定制强 | 成本高、难更新、需算力 |
| 本地部署 | 模型跑在自己电脑 | 数据不出本机、离线可用 | 受显存限制,能力弱于云端大模型 |
| 模型规模 | FP16 显存 | INT8 显存 | INT4 显存 | 参考口径 |
|---|---|---|---|---|
| 7B | 约 14 GB | 约 7 GB | 约 4 GB | RTX 4090 24GB 可跑 8B 级 |
| 14B | 约 28 GB | 约 14 GB | 约 8 GB | 需较大显存或量化 |
| 70B | 约 140 GB | 约 70 GB | 约 35 GB | 需多卡/服务器 |
源自真实工程与教学的四个实例
扫码/点击直达
