部署流程:从零到可用

上页解决「选什么」,本页解决「怎么装」。项目侧给出 33 天 6 阶段的推进节奏, 工程侧给出六步实操与跨域配置,两轨并行,任何一步都可单独取用。

33 天 / 6 阶段 六步实操 跨域与代理 验收清单

① 项目节奏:33 天六阶段

阶段时间核心任务关键成果
前期准备第 1—3 天环境搭建、工具准备、需求分析与方案设计环境就绪、需求明确、方案落地
模型部署与测试第 4—13 天4 款模型部署 + 内容生成能力测试1200+ 条测试数据,初步排名
知识库调用测试第 14—18 天行业知识库构建 + 调用与性能评估10 个一级 / 15 个二级分类语料库
硬件性能测试第 19—23 天生成速度、并发、资源占用速度 ≥10 token/s,错误率 <1%
部署平台测试第 24—28 天4 个平台安装、跑分、易用性比较平台适用场景结论
综合评估与确定第 29—33 天数据汇总、加权评分、交付准备最优组合方案 + 技术文档包

前期准备(3 天)

目标:环境就绪 · 需求明确 · 方案落地

搭建操作系统与依赖环境,安装开发工具;同步收集业务场景的典型问题与数据, 确定「内容生成质量、知识库调用能力、硬件适配性、部署成本」四项选择标准,输出测试方案与评估指标。

模型部署与测试(10 天)

目标:4 款模型跑通并完成生成能力验证

依次部署 DeepSeek 8B/14B、Qwen3 8B/14B,记录部署难度与初始资源占用; 针对客户服务、专销协同、内部文档处理三类场景设计用例,按「准确性 / 相关性 / 完整性」量化打分。

知识库调用测试(5 天)

目标:建成行业语料库并验证检索性能

收集法规、政策、产品、服务标准并结构化归档;测试单一检索、复杂整合、模糊查询三类调用; 输出精确率与召回率,识别「知识融合生硬、多源整合逻辑不清」等问题。

硬件性能测试(5 天)

目标:确认硬件无需额外升级

测量生成 100 / 500 / 1000 token 的平均耗时,测试并发响应时间、吞吐量与错误率, 监控 CPU / 内存 / GPU 占用并定位瓶颈。

部署平台测试(5 天)

目标:明确各平台适用边界

四平台各跑一遍 4 款模型,从易用性、性能表现、模型支持三个维度比较,形成综合排名。

综合评估与方案确定(5 天)

目标:加权评分定案 + 交付包

按 40 / 25 / 20 / 15 权重加权评分,确定最优组合;整理测试报告、数据手册、部署文档、操作指南、维护手册。

② 六步实操(照做即可)

安装推理引擎

Ollama(ollama.com)或 LM Studio(lmstudio.ai)。 Windows 双击安装包一路 Next;验证:ollama --version

下载并加载模型

按配置选档(8GB→1.5B;16GB→7B;16GB+独显→14B),执行 ollama pull qwen3:14b,并额外拉取嵌入模型 bge-m3:567m(建知识库必需)。

开启 API 服务

Ollama 默认 localhost:11434;LM Studio 在 Server 面板 Start,默认 localhost:1234先启服务,前端才连得上

配置交互前端

Cherry Studio / Aingdesk:设置 → 模型提供商 → 选择 Ollama 或 LM Studio → 填 API 地址 → 管理里添加模型 → 测试连接。

建知识库(RAG)

新建知识库 → 选嵌入模型 bge-m3 → 拖入 PDF/Word/TXT/MD 文档 → 系统自动切分、向量化、建索引 → 对话时勾选知识库即可带引用作答。

效果验证与验收

同一问题在「开/关知识库」下各问一次,对比准确性与是否带来源;按速度、并发、错误率、资源占用四项留档。

③ 跨域与代理:个人站点接入本机模型的唯一坑

浏览器有同源策略,页面在 example.com 时直接 fetch http://localhost:11434 会被拦。三种解法,按推荐度排序:

方案做法适用
A. 放开引擎 CORS Ollama 设置 OLLAMA_ORIGINS=*;LM Studio 开启服务端跨域 个人站点开发、内网使用(最省事)
B. 本机反向代理 用 Nginx / Caddy 把 /api 反代到 11434,站点与 API 同源 正式上线、HTTPS 站点(推荐)
C. 浏览器插件放行 临时关闭跨域限制 仅调试,不可用于交付
Windows:永久放开 Ollama 跨域
:: 当前用户环境变量,重启 Ollama 后生效
setx OLLAMA_ORIGINS "*"

:: 或临时生效(当前终端)
set OLLAMA_ORIGINS=*
ollama serve
Linux / macOS
export OLLAMA_ORIGINS="*"
ollama serve
Caddy 反向代理示例(同源 + HTTPS 一次解决)
# Caddyfile
your-domain.com {
    handle /api/* {
        uri strip_prefix /api
        reverse_proxy localhost:11434
    }
    handle {
        root * /var/www/llm-hub
        file_server
    }
}
HTTPS 陷阱:站点一旦以 HTTPS 提供,浏览器会以「混合内容」为由拦截到 http://localhost 的请求。要么整站走 http(内网可接受), 要么按方案 B 做同源反代,别指望浏览器例外。

④ 验收清单与风险应对

验收清单(勾选式)

  • 各模型内容生成能力达到预期(准确 / 相关 / 完整)
  • 知识库调用:检索准确、融合自然,精确率 ≥90%、召回率 ≥80%
  • 指定显卡上性能指标达标:速度 ≥10 token/s、并发 ≤5s、错误率 <1%
  • 资源占用合理,无明显瓶颈
  • 交付文档齐备:测试报告 / 数据手册 / 部署文档 / 操作指南 / 维护手册

风险与对冲

风险概率应对
模型部署失败详细部署文档 + 3 次预部署测试
性能不达标储备 4 个备选模型 + 参数调优 + 知识库补充
硬件兼容性提前兼容性测试 + 替代硬件
进度延迟每日任务清单 + 每日站会 + 每周总结

⑤ 常见故障速查

现象原因处理
前端提示连接超时引擎未启动 / 端口不对确认 ollama serve 已运行;Ollama 11434、LM Studio 1234
模型列表为空未拉取模型ollama pull <模型名> 后重试
CORS 报错未放开跨域设置 OLLAMA_ORIGINS=* 或做反向代理
知识库创建报错缺少嵌入模型先拉取 bge-m3,再新建知识库
下载极慢网络/源问题换网络(如手机热点);机房提前批量预下载并内网分发
启动闪退安全软件拦截检查杀毒软件隔离记录,加入白名单
回答很慢CPU 推理或模型过大换更小模型 / 更激进量化;确认 GPU 已启用