隐私保护:本地部署不是口号,是数据流设计

把模型搬到本地只是第一步。真正决定隐私水平的是数据在哪里被读取、在哪里停留、在哪里留下痕迹。 本页给出可执行的边界划分、红线清单与自查表。

数据不出域 内外网隔离 日志最小化 可审计

① 三个真实痛点,指向同一条路径

Risk 01

数据泄密风险

毕业论文数据、研究方法、问卷与访谈记录一旦上传云端,就不再受你控制。

💡 本地部署的第一价值:数据不出本机
Risk 02

网络依赖与不确定性

校园网/办公网高峰卡顿、免费额度用完、服务突然下线——把关键工作押在外部服务的可用性上。

💡 本地部署的第二价值:断网可用、永久可用。
Risk 03

持续付费成本

订阅制按人按年计费,重度使用者四年累计足以覆盖一台主机。

💡 本地部署的第三价值:边际成本趋零。

② 三种架构的数据流边界

架构输入数据去向模型位置留存风险适用
纯云端 上传至第三方服务器厂商机房 高:对话与文件留存于第三方,受其政策与司法管辖影响 公开信息、通用写作、对外素材
纯本地 仅在本机/内网处理本机或内网服务器 低:数据不出域,痕迹可控可删 ✓ 敏感数据、内部制度、客户信息
混合 本地检索 + 云端生成(或反之)两端 中:需明确哪些字段外发,做脱敏与审批 需要外部知识补充且已脱敏的场景
本项目选择:「RAG + 本地化部署」架构——检索与生成全部在本地完成, 实现数据不出域的安全闭环。这也是知识库检索精确率 91% 的同时,仍能通过合规审查的前提。

③ 红线:这三件事不能做

🚫 红线一:内外网工具混用

绝对禁止将任何含有内部敏感信息、商业秘密、非公开数据的文档上传至在线知识库平台。 在线平台的价值在协作与获取外部信息,本地平台才是处理内部数据的唯一场所。

🚫 红线二:未经核查直接采信

AI 生成内容涉及法规、数据、政策时,必须人工核查。AI 是强大的辅助工具, 但最终决策和责任仍由使用者承担——尤其是对外出具的文书与执法依据。

🚫 红线三:无边界放开服务

为图省事把本机推理端口对全网开放(如 0.0.0.0 + 放行防火墙), 等于把内网模型变成公共接口。开发期可用 OLLAMA_ORIGINS=*, 上线时应限定来源域并置于反向代理之后。

④ 最小化处理清单

对象风险处理动作
对话历史前端本地留存,换机或共用设备时泄露提供清除按钮;默认不持久化;确需保存时加密并设定保留期
端点配置存于浏览器 localStorage,含内网地址仅保存地址与模型名,绝不写入密钥、口令或令牌
上传文档临时目录与缓存残留处理完成后清理临时文件;向量库按知识库隔离,删除知识库即删除索引
服务日志请求内容被完整记录关闭或裁剪请求体日志;只保留时间、模型、耗时、错误码
遥测与更新客户端向厂商回传使用数据按需关闭遥测;离线环境采用离线升级包
知识片段索引站点携带的知识库内容被公开访问公开站点只放 L3 公开级内容;L1/L2 内容不进入静态资源
本站点做法:知识片段索引与检索全部在浏览器内完成,不向任何服务器发送提问内容; 连接参数仅存于本机 localStorage;推理请求只发往你填写的本机/局域网端点。 请注意:若把含内部数据的片段放进站点静态资源,任何能打开站点的人都能下载它——按 L1/L2/L3 分级放置。

⑤ 浏览器端的四个具体风险

  • 跨域放行过宽:OLLAMA_ORIGINS=* 在开发期方便,但意味着任意网页都能调用你本机的模型。 上线时改为限定来源域,或用反向代理收敛入口。
  • 混合内容拦截:HTTPS 页面请求 http://localhost 会被浏览器拦截,切勿为绕过而降级安全设置——应做同源反代。
  • 端口暴露:确认服务只监听 127.0.0.1;需要局域网访问时再绑定内网地址,并配合防火墙白名单。
  • 提示词注入:若页面内容来自不可信来源(如抓取的网页),可能被注入指令操纵模型。 对外部内容做剥离与转义,并限制模型可调用的工具。

⑥ 上线前自查表

  • ☑ 敏感数据只在本地知识库处理,未上传任何在线平台
  • ☑ 数据已按 L1/L2/L3 分级,公开站点只承载 L3 内容
  • ☑ 服务仅监听 127.0.0.1 或内网白名单地址
  • ☑ 跨域策略已从「*」收敛到指定来源域,或置于反向代理之后
  • ☑ 日志不记录请求正文,保留期已设定
  • ☑ 对话历史默认不持久化,提供一键清除
  • ☑ 对外输出(法规、数据、政策)有人工核查环节与责任人
  • ☑ 知识库有季度更新与审核机制,维护责任落实到岗位
  • ☑ 开源模型许可与第三方语料来源已登记,商用范围已确认