部署流程:从零到可用
上页解决「选什么」,本页解决「怎么装」。项目侧给出 33 天 6 阶段的推进节奏, 工程侧给出六步实操与跨域配置,两轨并行,任何一步都可单独取用。
① 项目节奏:33 天六阶段
| 阶段 | 时间 | 核心任务 | 关键成果 |
|---|---|---|---|
| 前期准备 | 第 1—3 天 | 环境搭建、工具准备、需求分析与方案设计 | 环境就绪、需求明确、方案落地 |
| 模型部署与测试 | 第 4—13 天 | 4 款模型部署 + 内容生成能力测试 | 1200+ 条测试数据,初步排名 |
| 知识库调用测试 | 第 14—18 天 | 行业知识库构建 + 调用与性能评估 | 10 个一级 / 15 个二级分类语料库 |
| 硬件性能测试 | 第 19—23 天 | 生成速度、并发、资源占用 | 速度 ≥10 token/s,错误率 <1% |
| 部署平台测试 | 第 24—28 天 | 4 个平台安装、跑分、易用性比较 | 平台适用场景结论 |
| 综合评估与确定 | 第 29—33 天 | 数据汇总、加权评分、交付准备 | 最优组合方案 + 技术文档包 |
前期准备(3 天)
搭建操作系统与依赖环境,安装开发工具;同步收集业务场景的典型问题与数据, 确定「内容生成质量、知识库调用能力、硬件适配性、部署成本」四项选择标准,输出测试方案与评估指标。
模型部署与测试(10 天)
依次部署 DeepSeek 8B/14B、Qwen3 8B/14B,记录部署难度与初始资源占用; 针对客户服务、专销协同、内部文档处理三类场景设计用例,按「准确性 / 相关性 / 完整性」量化打分。
知识库调用测试(5 天)
收集法规、政策、产品、服务标准并结构化归档;测试单一检索、复杂整合、模糊查询三类调用; 输出精确率与召回率,识别「知识融合生硬、多源整合逻辑不清」等问题。
硬件性能测试(5 天)
测量生成 100 / 500 / 1000 token 的平均耗时,测试并发响应时间、吞吐量与错误率, 监控 CPU / 内存 / GPU 占用并定位瓶颈。
部署平台测试(5 天)
四平台各跑一遍 4 款模型,从易用性、性能表现、模型支持三个维度比较,形成综合排名。
综合评估与方案确定(5 天)
按 40 / 25 / 20 / 15 权重加权评分,确定最优组合;整理测试报告、数据手册、部署文档、操作指南、维护手册。
② 六步实操(照做即可)
安装推理引擎
Ollama(ollama.com)或 LM Studio(lmstudio.ai)。 Windows 双击安装包一路 Next;验证:ollama --version。
下载并加载模型
按配置选档(8GB→1.5B;16GB→7B;16GB+独显→14B),执行 ollama pull qwen3:14b,并额外拉取嵌入模型 bge-m3:567m(建知识库必需)。
开启 API 服务
Ollama 默认 localhost:11434;LM Studio 在 Server 面板 Start,默认 localhost:1234。先启服务,前端才连得上。
配置交互前端
Cherry Studio / Aingdesk:设置 → 模型提供商 → 选择 Ollama 或 LM Studio → 填 API 地址 → 管理里添加模型 → 测试连接。
建知识库(RAG)
新建知识库 → 选嵌入模型 bge-m3 → 拖入 PDF/Word/TXT/MD 文档 → 系统自动切分、向量化、建索引 → 对话时勾选知识库即可带引用作答。
效果验证与验收
同一问题在「开/关知识库」下各问一次,对比准确性与是否带来源;按速度、并发、错误率、资源占用四项留档。
③ 跨域与代理:个人站点接入本机模型的唯一坑
浏览器有同源策略,页面在 example.com 时直接 fetch http://localhost:11434 会被拦。三种解法,按推荐度排序:
| 方案 | 做法 | 适用 |
|---|---|---|
| A. 放开引擎 CORS | Ollama 设置 OLLAMA_ORIGINS=*;LM Studio 开启服务端跨域 | 个人站点开发、内网使用(最省事) |
| B. 本机反向代理 | 用 Nginx / Caddy 把 /api 反代到 11434,站点与 API 同源 | 正式上线、HTTPS 站点(推荐) |
| C. 浏览器插件放行 | 临时关闭跨域限制 | 仅调试,不可用于交付 |
:: 当前用户环境变量,重启 Ollama 后生效 setx OLLAMA_ORIGINS "*" :: 或临时生效(当前终端) set OLLAMA_ORIGINS=* ollama serve
export OLLAMA_ORIGINS="*" ollama serve
# Caddyfile your-domain.com { handle /api/* { uri strip_prefix /api reverse_proxy localhost:11434 } handle { root * /var/www/llm-hub file_server } }
④ 验收清单与风险应对
验收清单(勾选式)
- 各模型内容生成能力达到预期(准确 / 相关 / 完整)
- 知识库调用:检索准确、融合自然,精确率 ≥90%、召回率 ≥80%
- 指定显卡上性能指标达标:速度 ≥10 token/s、并发 ≤5s、错误率 <1%
- 资源占用合理,无明显瓶颈
- 交付文档齐备:测试报告 / 数据手册 / 部署文档 / 操作指南 / 维护手册
风险与对冲
| 风险 | 概率 | 应对 |
|---|---|---|
| 模型部署失败 | 中 | 详细部署文档 + 3 次预部署测试 |
| 性能不达标 | 高 | 储备 4 个备选模型 + 参数调优 + 知识库补充 |
| 硬件兼容性 | 中 | 提前兼容性测试 + 替代硬件 |
| 进度延迟 | 高 | 每日任务清单 + 每日站会 + 每周总结 |
⑤ 常见故障速查
| 现象 | 原因 | 处理 |
|---|---|---|
| 前端提示连接超时 | 引擎未启动 / 端口不对 | 确认 ollama serve 已运行;Ollama 11434、LM Studio 1234 |
| 模型列表为空 | 未拉取模型 | ollama pull <模型名> 后重试 |
| CORS 报错 | 未放开跨域 | 设置 OLLAMA_ORIGINS=* 或做反向代理 |
| 知识库创建报错 | 缺少嵌入模型 | 先拉取 bge-m3,再新建知识库 |
| 下载极慢 | 网络/源问题 | 换网络(如手机热点);机房提前批量预下载并内网分发 |
| 启动闪退 | 安全软件拦截 | 检查杀毒软件隔离记录,加入白名单 |
| 回答很慢 | CPU 推理或模型过大 | 换更小模型 / 更激进量化;确认 GPU 已启用 |