认识 AI:把黑箱拆成可度量的零件
大模型不难懂,难的是把概念讲成能被验证的口径。这一页把词元、参数量、量化、上下文窗口、智能体、幻觉 六个高频概念拆开,每个都给出定义、量纲、判断依据和常见误区。
① 概念层级:别把 AI 说成一团
人工智能 AI ⊃ 机器学习 ML(从数据中找规律)⊃ 深度学习 DL(多层神经网络)⊃ 大语言模型 LLM(以 Transformer 为骨架、在海量语料上预训练的通用语言模型)。
| 层级 | 要解决的问题 | 典型方法 | 在本项目中的位置 |
|---|---|---|---|
| AI | 让机器完成需要智能的任务 | 规则系统、搜索、学习 | 协同联管体系的总体目标 |
| 机器学习 | 从样本中泛化规律 | 回归、树模型、SVM | 风险指数、客户分群 |
| 深度学习 | 自动学习特征表示 | CNN / RNN / Transformer | 语义向量、Embedding |
| 大语言模型 | 通用语言理解与生成 | 预训练 + 指令微调 + RLHF | Qwen3 14B 作为推理核心 |
② 三个参数:决定模型能干什么、要吃多少硬件
词元
模型“阅读”和“计费”的最小单位,不是字也不是词,而是分词器切出来的片段。中文大致 1 个汉字 ≈ 1 个词元, 英文大致 1 个词元 ≈ 4 个字符 / 0.75 个单词。
- 「黄果树瀑布」→ 约 4 个词元
- 一篇 8000 字的论文 → 约 8000 词元
参数量
模型权重的可学习参数总数,通俗理解为“脑细胞”数量。1B = 10 亿。数字越大能力越强,但对显存/内存的胃口也越大。
- 1.5B / 3B → 轻量,8GB 内存可跑
- 7B / 8B → 日常够用,16GB 内存可跑
- 14B / 32B → 能力强,需 16GB+ 独显
量化
把权重从高精度浮点(FP16)压到低比特整数(如 Q4_K_M、Q2_K),换取更小的体积与更低的显存占用。
- FP16 → 原版,精度最高
- Q4_K_M → 体积约压缩 75%,精度损失很小
- Q2_K → 极致压缩,精度损失明显
③ 动手估算:这段话要花多少词元
纯前端估算,不上传输入一段文字,实时估算词元数与在本项目实测速度下的生成耗时(按 12.5 token/s 计)。
④ 上下文窗口:模型的“短时记忆”
上下文窗口决定一次能塞进多少内容(输入 + 输出合计)。窗口内是“记得住”,窗口外是“没看见”。 早年的 LLaMA 限制为 2048 词元,长文档摘要与长对话容易丢信息;当前主流模型已到 32K—128K 量级。
- 为什么本地部署更要关注它:窗口越大,KV Cache 占用显存越高,同等硬件下生成更慢。
- 工程做法:长文档不要硬塞,用 RAG 切成片段按需检索——这正是本项目把响应压到 10 秒内的关键。
⑤ 智能体 Agent:让模型会「动手」
定义与结构
智能体的核心思想是用大模型选择要执行的一系列动作:模型充当推理引擎,决定“做什么、按什么顺序做”。
- Agent:由模型 + 提示词驱动,决定下一步操作
- Tools:可调用的函数(检索、计算、查询接口)
- Agent Executor:运行时,真正执行被选中的动作
多智能体的两个真实收益
- 能力互补:不同角色分工(检索者、审校者、撰写者),覆盖单一模型的盲区。
- 质量优势:多个智能体对同一问题给出不同观点并互相反馈,可有效减少幻觉与虚假信息,提高回答的可靠性与忠实性。
在本项目的业务映射:知识助手(法规查询)、办公助手(文档撰写)、数据分析助手(风险预警)三个模块, 本质上就是三个分工不同的智能体。
⑥ 幻觉 Hallucination:AI 会说谎吗
三个典型场景
- 编造文献:要求推荐 5 篇某领域论文,模型给出不存在的标题与作者。
- 错误计算:逻辑正确但数字算错,如营收乘法结果偏差。
- 过度自信:对冷门政策条款,用流畅文字给出完全错误的条款编号。
成因
- 统计学习的本质局限:不是“理解”,而是“模式匹配”
- 训练数据问题:过时、偏见、缺失
- 概率采样的随机性:Temperature 越高越发散
四种应对策略
- 交叉验证:同一问题问多个模型 / 多个来源,取交集。
- 追问细节:“给出具体出处”“这个数据的来源是什么?”
- 限定知识范围:用 RAG 知识库把回答限定在上传文档内,并强制标注来源。
- 保持批判性:AI 是“实习助理”,不是“导师”,最终判断由人做。
⑦ 提示词工程:AI 的「遥控器」
❌ 模糊提示
「介绍一下黄果树瀑布」
→ 泛泛三行,无法直接用于工作。
✅ 精准提示
「你是一位资深贵州导游。请用 Markdown 表格列出黄果树瀑布的游览攻略:最佳季节、门票价格、交通方式、游玩时长、注意事项。控制在 200 字以内。」
→ 结构化输出,可直接放进方案。
| 原则 | 做法 | 示例 |
|---|---|---|
| 明确性 | 说清格式、长度、语气、受众 | 「控制在 300 字以内,用表格输出」 |
| 角色扮演 | 给模型一个岗位身份 | 「你是一位大学英语四级写作老师」 |
| 分步推理 | 要求先分析再给结论 | 「请先分析成因,再给出改进建议」 |
| 示例引导 | 给 1—2 个样例(Few-shot) | 「按如下格式:问题 / 依据 / 结论」 |
| 约束条件 | 限定输出边界与引用 | 「仅依据知识库内容作答,标注来源编号」 |