知识库答辩:把追问变成加分项

评审真正想确认的只有三件事:这个数是怎么测出来的结论能不能复现风险有没有被低估。以下 15 组追问覆盖技术、指标、财务、合规、推广五个维度, 每组给出应答口径与支撑数据。

15 组追问 五维覆盖 现场问答控制台

① 三分钟陈述骨架

问题(30s)

信息查询平均 15 分钟、跨部门流转靠人工、风险靠事后查处、知识散落在个人经验里——四个痛点,指向同一个根:缺少统一的知识中枢与协同机制。

方案(90s)

33 天实测 4 款模型 × 4 个平台、1200+ 条数据,按 40/25/20/15 加权定案: Qwen3 14B + Aingdesk + RAG 行业知识库(10 个一级 / 15 个二级分类,四阶投喂法)。 数据不出域,硬件零新增。

成效(60s)

14 项指标 100% 达成、12 项超额;咨询响应 15 分钟 → 10 秒内;投诉满意率 94.87% → 98.46%; 年度净经济效益 ≈60 万元,ROI 522%,回收期 6—8 个月。

② 高频追问与应答口径

技术选型类

Q1:为什么最终选 Qwen3 14B,而不是名气更大的 DeepSeek 14B?

口径:不是品牌判断,是加权评分结果。四个维度权重为内容生成质量 40%、知识库调用能力 25%、 硬件性能适配 20%、部署平台易用性 15%。

  • 知识库调用:Qwen3 14B 精确率 93% / 召回率 86%,高于 DeepSeek 14B;
  • 内容生成:Qwen3 14B 在专销协同场景(营销方案生成、专卖法规解读)更贴合行业业务逻辑;
  • 硬件适配:Qwen3 14B 生成速度 12.5 token/s,GPU 60%—80%,内存 <12G;
  • DeepSeek 14B 的长项在文档处理(信息覆盖率 92%),可作为长文摘要场景的备用模型,不构成替换关系。
Q2:91% 精确率和 83% 召回率是怎么测出来的?样本量够吗?

口径:指标来自知识库调用能力测试阶段(第 14—18 天),累计 1200 余条测试数据

  • 测试方法:提出问题 → 模型从知识库检索相关信息 → 评估检索准确性与融合自然度;
  • 场景设计:单一问题检索、复杂需求整合、模糊查询处理三类,多轮次执行;
  • 考核门槛为精确率 ≥85%、召回率 ≥80%,实测 91% / 83%,其中精确率超额;
  • 诚实边界:边缘场景(特殊投诉处理、复杂营销方案定制)用例不足,已在总结报告中列为改进项。
Q3:已有 Ollama,为什么还要 Aingdesk?不是重复建设吗?

口径:二者不是替代关系,是分工。实测结论:Ollama 优势在易用性与部署速度,适合原型验证与临时测试; Aingdesk 优势在高并发下的稳定性与资源调度效率,适合正式业务场景与生产环境。 项目最终确定 Aingdesk 为核心生产平台,Ollama 用于快速验证,LM Studio / Cherry Studio 作为备选与前端。

Q4:模型没有微调,专业性问题靠什么保证?

口径:靠 RAG 而非微调,这是成本与可控性的权衡。用「原始收集 → 结构化处理 → 动态关联 → 智能增强」 的四阶投喂法把行业语料注入知识库,模型回答被限定在检索到的片段内,输出可溯源。

诚实边界:针对行业术语与业务逻辑的微调尚未开展,已列入改进方向—— 这是下一步提升精准度的明确路径,而不是当前的既成事实。

指标与成效类

Q5:ROI 522% 是怎么算出来的?会不会夸大?

口径:拆成「成本节约」与「效能增长」两本账,各自给出计算依据

  • 年度直接成本节约 ≈15 万元:人力释放(2 名客户经理约 30% 工时)≈8 万 + 行政办公 ≈2 万 + 培训成本优化 ≈5 万;
  • 年度效能增长 ≈45 万元:客户保留增收 ≈25 万 + 市场净化效益 ≈15 万 + 效率增益 ≈5 万;
  • 年度净效益 ≈60 万元,项目总投资 11.50 万元 → ROI ≈522%,静态回收期 6—8 个月。

答辩提醒:「客户保留增收」「效率增益」属于测算值而非财务入账值, 应答时明确这是基于满意度提升与流失率下降的推算,并说明测算假设,反而更可信。

Q6:客户满意度 87.88%,低于 90% 的预期目标,怎么解释?

口径:先承认,再给结构。考核目标为 ≥85%,87.88% 已超额完成;90% 是内部更高的期望值。 同时给出过程数据:投诉处理满意率 94.87% → 98.46%(超额),服务效率满意度 80% → 87.88%+, 87.88% 的问题在 5 个工作日内解决、61.36% 在 2 个工作日内解决。

归因:满意度是滞后指标,体系 2025 年 9 月才进入试点,全面推广在 2026 年 1—3 月, 效果的完整显现需要更长观察窗口。

Q7:14 项指标全部达成,是不是指标定得太低?

口径:用「完成率分布」回应。14 项指标达成率 100%,其中 12 项超额(85.7%), 仅 2 项(召回率 83% vs 目标 80%、制度建设 1 项 vs 目标 1 项)为达标而非超额。 关键指标的超额幅度:咨询响应 ≤10 秒(目标 ≤30 秒)、处理周期 2.5—3 日(目标 ≤5 日)、 培训 420+ 人次(目标 ≥400)、论文 3 篇(目标 ≥2 篇)。

合规与安全类

Q8:「数据不出域」怎么证明?有什么硬约束?

口径:架构层面保证 + 制度层面红线

  • 架构:模型与知识库均部署在本地服务器,推理与检索在企业内网完成,不调用任何外部 API;
  • 制度:操作手册明确要求——严禁将含内部敏感信息、商业秘密、非公开数据的文档上传至任何在线知识库平台; 涉密与核心业务数据只能在 LM Studio / Ollama 搭建的本地环境中处理;
  • 复核:AI 生成内容涉及法规、数据、政策时,必须人工核查,最终责任由使用者承担。
Q9:模型会不会输出错误法规条款,导致执法风险?

口径:承认风险存在,给出四道防线:① RAG 限定知识范围并强制标注来源; ② 交叉验证(多模型 / 多来源取交集);③ 追问细节(要求给出具体出处); ④ 人机协同——AI 是辅助,最终判断由人做。并在手册中写明「AI 是强大的辅助工具,但最终决策和责任仍由使用者承担」。

推广与持续类

Q10:其他县级分公司能直接照搬吗?前置条件是什么?

口径:可复制,但有前置条件。项目价值在于在区县一级走通「大模型本地部署 + 行业知识库 + 五联共管模式」全链路, 且数据不出门、成本可控、技术自主。复制需满足:① 硬件达到 16G 显存档位(实测无需额外升级); ② 有可持续维护的行业语料(10 个一级 / 15 个二级分类是骨架,内容需本地化替换); ③ 有跨部门协同的组织授权(五联共管涉及专卖、营销、物流、内管四个条线)。

Q11:知识库建成后怎么保持「新鲜」?

口径:机制比内容更重要。已明确:近期落地知识库季度更新审核机制,中期把知识库维护纳入岗位职责与绩效考核。 当前短板是更新依赖人工、审核流程未完全跑通——这是项目自己指出的问题,不是评审发现的漏洞。 补充:行业案例与实操经验类内容占比偏低,后续需增加案例类、经验类内容。

Q12:培训覆盖率 73.49%,剩下的人怎么办?

口径:目标 ≥70%,实测 73.49%,超额完成。覆盖结构为内部员工 200 人次 + 零售客户 220 人次, 员工对体系理解度 ≥90%。未覆盖部分将通过 20 个知识视频(总时长 >120 分钟)与 4 套教材的线上自学补齐, 这也是年度节约培训成本约 5 万元的来源。

Q13:论文、软著、专利的实际情况?有没有虚报?

口径:如实区分「已取得」与「在准备」

  • 论文:计划 2 篇,实际发表 3 篇(超额 50%);
  • 软著:AIGC 智能助手(项目小助手)已于 2025-11-20 通过采购验收并投入运行, 具备需求、设计、测试、操作手册等登记材料基础(登记在办理中);
  • 专利:经核查全部归档材料,未发现已申请、受理或授权的专利记录——如实说明,不要含糊带过。
Q14:AI 系统与现有业务系统未打通,是不是半成品?

口径:是已知边界,不是遗漏。项目总结中已明确「未针对现有业务系统开展接口开发与定制化适配」, 并将其列为改进方向。当前阶段的价值在于验证了技术路线可行性与业务收益(响应时间、满意率、协同效率的硬数据), 系统集成属于下一期工程范围。

Q15:如果评委只问一个问题——这个项目最值得推广的是什么?

口径:不是模型,是方法。基层单位用有限资源、开源方案,同样能产出看得见、用得上的数字化成果: 11.50 万元经费、零新增硬件、33 天完成选型验证,最终形成可复制的「云岩样本」—— 理论框架(1335 体系)、技术方案(Qwen3 14B + Aingdesk + RAG 知识库)、 管理制度(《卷烟零售客户服务限时制度》)、培训资源(4 套教材 + 20 个视频)四项标准化成果。

③ 现场问答控制台(本地模型 + 本地知识片段)

评委提问可现场检索作答
HTTPS 限制:在 zgdgt.cn 上打开时,Chrome / Edge 的私有网络访问策略会拦截到 localhost 的请求。需要现场检索作答时,请 下载本地版 ZIP,解压后用 python -m http.server 8000 以 http 方式打开。