把 本地化部署的大模型 挂到个人网站上
本站是一套可直接托管的静态站点:前端页面负责知识呈现与交互,推理算力留在你自己的机器上。浏览器直连 localhost 的 Ollama / LM Studio / vLLM 端点,数据不出本机,无需为 API 付费,也不存在第三方留存。
🖥️ 本地推理控制台
填入端点 → 检测 → 对话🧭 知识板块
🧠 认识 AI
词元(Token)、参数量与量化、上下文窗口、智能体(Agent)、幻觉(Hallucination)——用可验证的口径讲清概念。
⚙️ 部署方案
4 款模型 × 4 个平台的实测选型矩阵、权重体系、硬件配置清单与成本对照。
🛠️ 部署流程
33 天 6 阶段项目节奏,拆到可执行的命令与检查点,含跨域、并发与验收标准。
🎓 知识库答辩
结题与评审高频追问:指标口径、91% 精确率怎么来的、ROI 522% 是否可信。
🔍 RAG 原理与改进
检索—增强—生成的完整链路,Naive → Advanced → Modular/Agentic 的演进与可落地的改进清单。
💎 数字资产
模型权重、语料、提示词库、教材视频、论文与软著——如何确权、盘点与持续增值。
🔒 隐私保护
本地部署的隐私边界、内网/外网工具红线、数据与日志的最小化处理。
🧩 优质 Skills
可直接复用的技能包清单(文档、检索、写作、科研),附安装路径与调用要点。
📦 站点源码
纯静态 HTML/CSS/JS,无构建步骤,整目录上传即可上线;推理端点随改随用。
🚀 三步跑通
本机起一个推理服务
Ollama:ollama pull qwen3:14b → ollama serve; LM Studio:Discover 下载模型 → Server 面板 Start。生成速度 ≥10 token/s 即可满足日常问答。
放开浏览器跨域
Ollama 设置 OLLAMA_ORIGINS=*;LM Studio 在服务端开启 CORS。 站点用 http 打开,避免 HTTPS 页面请求 localhost 被混合内容策略拦截。
在控制台提问
打开「RAG 增强」,问题会先在浏览器里检索知识片段(TF-IDF + 余弦相似度), 再把片段连同问题一起交给本地模型生成——答案可溯源,幻觉显著下降。