本地化部署的大模型 挂到个人网站上

本站是一套可直接托管的静态站点:前端页面负责知识呈现与交互,推理算力留在你自己的机器上。浏览器直连 localhost 的 Ollama / LM Studio / vLLM 端点,数据不出本机,无需为 API 付费,也不存在第三方留存。

Ollama :11434 LM Studio :1234 OpenAI 兼容端点 浏览器端 RAG 零后端依赖
445
知识库片段(浏览器内索引)
12.5
token/s(Qwen3 14B 实测)
91%
知识库检索精确率
9
知识板块

🖥️ 本地推理控制台

填入端点 → 检测 → 对话
在 zgdgt.cn(HTTPS)上打开时的限制:Chrome / Edge 的私有网络访问(PNA)策略会拦截从公共 HTTPS 站点发往 localhost 的请求,即使设置了 OLLAMA_ORIGINS=* 也会被拦。 在线版可作为完整知识库浏览使用;要真正连上本机模型,请下载本地版并用 http://localhost 打开下载本地版 ZIP,解压后执行 python -m http.server 8000
本地使用时的配置:浏览器默认禁止跨域调用本机端口。Ollama 需先设置环境变量 OLLAMA_ORIGINS=* 后重启;LM Studio 在 Server 面板勾选允许跨域。 站点若以 https 打开,浏览器还会拦截到 http://localhost 的请求(混合内容), 此时请用 http 打开本站,或在本机做一层反向代理。详见 部署流程 · 跨域与代理

🚀 三步跑通

本机起一个推理服务

Ollama:ollama pull qwen3:14bollama serve; LM Studio:Discover 下载模型 → Server 面板 Start。生成速度 ≥10 token/s 即可满足日常问答。

放开浏览器跨域

Ollama 设置 OLLAMA_ORIGINS=*;LM Studio 在服务端开启 CORS。 站点用 http 打开,避免 HTTPS 页面请求 localhost 被混合内容策略拦截。

在控制台提问

打开「RAG 增强」,问题会先在浏览器里检索知识片段(TF-IDF + 余弦相似度), 再把片段连同问题一起交给本地模型生成——答案可溯源,幻觉显著下降。