认识 AI:把黑箱拆成可度量的零件

大模型不难懂,难的是把概念讲成能被验证的口径。这一页把词元、参数量、量化、上下文窗口、智能体、幻觉 六个高频概念拆开,每个都给出定义、量纲、判断依据和常见误区。

Token 参数量 / 量化 上下文窗口 Agent Hallucination

① 概念层级:别把 AI 说成一团

人工智能 AI机器学习 ML(从数据中找规律)⊃ 深度学习 DL(多层神经网络)⊃ 大语言模型 LLM(以 Transformer 为骨架、在海量语料上预训练的通用语言模型)。

层级要解决的问题典型方法在本项目中的位置
AI让机器完成需要智能的任务规则系统、搜索、学习协同联管体系的总体目标
机器学习从样本中泛化规律回归、树模型、SVM风险指数、客户分群
深度学习自动学习特征表示CNN / RNN / Transformer语义向量、Embedding
大语言模型通用语言理解与生成预训练 + 指令微调 + RLHFQwen3 14B 作为推理核心

② 三个参数:决定模型能干什么、要吃多少硬件

Token · 词元

词元

模型“阅读”和“计费”的最小单位,不是字也不是词,而是分词器切出来的片段。中文大致 1 个汉字 ≈ 1 个词元, 英文大致 1 个词元 ≈ 4 个字符 / 0.75 个单词。

  • 「黄果树瀑布」→ 约 4 个词元
  • 一篇 8000 字的论文 → 约 8000 词元
💡 类比:词元是模型认字的「识字单位」。它决定了你为一次问答付出多少算力与费用。
Parameters · 参数量

参数量

模型权重的可学习参数总数,通俗理解为“脑细胞”数量。1B = 10 亿。数字越大能力越强,但对显存/内存的胃口也越大。

  • 1.5B / 3B → 轻量,8GB 内存可跑
  • 7B / 8B → 日常够用,16GB 内存可跑
  • 14B / 32B → 能力强,需 16GB+ 独显
💡 选型第一原则:先看自己机器的配置,再决定模型大小
Quantization · 量化

量化

把权重从高精度浮点(FP16)压到低比特整数(如 Q4_K_M、Q2_K),换取更小的体积与更低的显存占用。

  • FP16 → 原版,精度最高
  • Q4_K_M → 体积约压缩 75%,精度损失很小
  • Q2_K → 极致压缩,精度损失明显
💡 类比:量化 ≈ 把高清图转 JPG,体积小、加载快,代价是少量细节。
工程口径:14B 量化模型在 RTX 5060 Ti(16GB)上可流畅运行;32B 量化模型建议 RTX 4090(24GB)级别。 本项目实测 Qwen3 14B + Aingdesk 时,GPU 使用率稳定在 60%—80%,内存占用 < 12GB,生成速度 12.5 token/s。

③ 动手估算:这段话要花多少词元

纯前端估算,不上传

输入一段文字,实时估算词元数与在本项目实测速度下的生成耗时(按 12.5 token/s 计)。

0
字符数
0
中文词元(估)
0
英文词元(估)
0s
生成耗时(估)
估算规则:中文按 1 字 ≈ 1.0—1.6 词元(取 1.3),英文按 1 词元 ≈ 4 字符,标点与数字各计 1。 真实分词以各模型的 tokenizer 为准,此处仅用于建立量级直觉。

④ 上下文窗口:模型的“短时记忆”

上下文窗口决定一次能塞进多少内容(输入 + 输出合计)。窗口内是“记得住”,窗口外是“没看见”。 早年的 LLaMA 限制为 2048 词元,长文档摘要与长对话容易丢信息;当前主流模型已到 32K—128K 量级。

  • 为什么本地部署更要关注它:窗口越大,KV Cache 占用显存越高,同等硬件下生成更慢。
  • 工程做法:长文档不要硬塞,用 RAG 切成片段按需检索——这正是本项目把响应压到 10 秒内的关键。

⑤ 智能体 Agent:让模型会「动手」

定义与结构

智能体的核心思想是用大模型选择要执行的一系列动作:模型充当推理引擎,决定“做什么、按什么顺序做”。

  • Agent:由模型 + 提示词驱动,决定下一步操作
  • Tools:可调用的函数(检索、计算、查询接口)
  • Agent Executor:运行时,真正执行被选中的动作
💡 与「问答」的区别:问答只输出文本;智能体会调用工具、读结果、再决定下一步,形成 ReAct(推理—行动)循环。

多智能体的两个真实收益

  • 能力互补:不同角色分工(检索者、审校者、撰写者),覆盖单一模型的盲区。
  • 质量优势:多个智能体对同一问题给出不同观点并互相反馈,可有效减少幻觉与虚假信息,提高回答的可靠性与忠实性。

在本项目的业务映射:知识助手(法规查询)、办公助手(文档撰写)、数据分析助手(风险预警)三个模块, 本质上就是三个分工不同的智能体。

⑥ 幻觉 Hallucination:AI 会说谎吗

三个典型场景

  • 编造文献:要求推荐 5 篇某领域论文,模型给出不存在的标题与作者。
  • 错误计算:逻辑正确但数字算错,如营收乘法结果偏差。
  • 过度自信:对冷门政策条款,用流畅文字给出完全错误的条款编号。

成因

  • 统计学习的本质局限:不是“理解”,而是“模式匹配”
  • 训练数据问题:过时、偏见、缺失
  • 概率采样的随机性:Temperature 越高越发散

四种应对策略

  • 交叉验证:同一问题问多个模型 / 多个来源,取交集。
  • 追问细节:“给出具体出处”“这个数据的来源是什么?”
  • 限定知识范围:用 RAG 知识库把回答限定在上传文档内,并强制标注来源。
  • 保持批判性:AI 是“实习助理”,不是“导师”,最终判断由人做。
项目实测:未挂知识库时,模型对“天龙屯堡始建于哪个朝代”给出「可能建于明朝……但我不确定」的模糊回答; 挂上知识库后变为「明朝洪武十四年(1381年)……」并附引用来源。知识库 = 给 AI 装上一套专业参考书。

⑦ 提示词工程:AI 的「遥控器」

❌ 模糊提示

「介绍一下黄果树瀑布」

→ 泛泛三行,无法直接用于工作。

✅ 精准提示

「你是一位资深贵州导游。请用 Markdown 表格列出黄果树瀑布的游览攻略:最佳季节、门票价格、交通方式、游玩时长、注意事项。控制在 200 字以内。」

→ 结构化输出,可直接放进方案。

原则做法示例
明确性说清格式、长度、语气、受众「控制在 300 字以内,用表格输出」
角色扮演给模型一个岗位身份「你是一位大学英语四级写作老师」
分步推理要求先分析再给结论「请先分析成因,再给出改进建议」
示例引导给 1—2 个样例(Few-shot)「按如下格式:问题 / 依据 / 结论」
约束条件限定输出边界与引用「仅依据知识库内容作答,标注来源编号」