从经验感知到算法预测——基于 993 份实测样本的外观、物理、化学多维指标,构建机器学习模型体系,量化预测烟叶感官质量分与质量等级,让每一片烟叶的质量都可计算、可解释、可追溯。
烟叶感官质量长期依赖专业评吸——由持证评吸员对香气质、香气量、杂气、余味、刺激性等指标人工打分。这套体系沉淀了深厚的行业经验,但也存在三重结构性瓶颈:
评吸结果依赖专家个体经验与参照系,不同评吸员之间存在尺度差异,跨产区、跨年度数据难以直接比较与积累。
评吸高强度刺激口腔与鼻腔,长时间作业导致感知敏感度下降,同一样本在不同时段可能得到不同结论。
只输出"多少分",缺乏量化的归因分析——无法回答"为什么是这个分数",更难以反向指导种植与调制工艺。
项目整合 2023–2025 年贵州 9 个市州主产区的定点监测数据,覆盖中、上部烟叶与蜜甜、清甜两大香型,每份样本同步采集外观分级、物理检测、化学分析与感官评吸结果。
| 维度 | 构成 |
|---|---|
| 年份 | 2023(163)· 2024(372)· 2025(458) |
| 产区 | 遵义 · 毕节 · 贵阳 · 黔南 · 安顺 · 黔东南 · 铜仁 · 六盘水 · 黔西南 |
| 部位 | 中部(615)· 上部(378) |
| 香型 | 蜜甜(698)· 清甜(295) |
| 感官总分 | 均值 70.62 · 标准差 4.16 · 区间 51.47–81.91 |
每份样本横跨四大指标域,形成"外观 → 物理 → 化学 → 感官"的完整证据链:
从原始表格到可部署模型,全流程覆盖数据治理 → 特征工程 → 模型竞争 → 分区验证 → 分项预测 → 综合判定,每一步均产出可复核的中间产物。
缺失值中位数插补 · IQR 异常值检测 · Z-Score 标准化 · 训练/验证/测试集划分
VIF 共线性检验(<10)· 灰色关联分析 · PCA 降维 · 树模型重要性筛选,最终锁定 15 项核心特征
线性 / 正则化 / 决策树 / 随机森林 / XGBoost / LightGBM / SVR / 神经网络等 12 种模型同台竞技
GridSearch 超参数寻优 · 5 折交叉验证评估稳定性 · 训练集与测试集双指标监控过拟合
按市州 / 年份 / 部位建立独立子模型对比统一模型;对 5 个感官分项分别建模
优 / 良 / 中 / 差四级分类模型 · SHAP 归因分析 · 业务洞察输出
量化各项理化指标与感官质量分的灰色关联度,成熟度、颜色等外观分级指标关联最强:
| 指标 | 关联度 | 指标 | 关联度 |
|---|---|---|---|
| 成熟度 | 0.759 | 含梗率 | 0.646 |
| 颜色 | 0.753 | 单叶重 | 0.626 |
| 身份 | 0.750 | 总氮 | 0.610 |
| 油分 | 0.740 | 烟碱 | 0.599 |
| 总糖 | 0.736 | 糖碱比 | 0.529 |
不同信息输入条件下,模型可达到的预测精度不同。项目以"盲预测 → 融合外观 → 综合评价"三个层次递进验证,诚实界定算法能力边界。
| 模型 | 测试集 R² | 测试集 RMSE | 测试集 MAE | 测试集 R²(网格调参后) | 结论 |
|---|---|---|---|---|---|
| 随机森林 | 0.350 | 3.06 | 2.33 | 0.330 | 基线最优,稳健抗过拟合 |
| SVR | 0.312 | 3.15 | 2.35 | 0.337 | 调参后最优(C=10, γ=0.01) |
| 梯度提升树 | 0.298 | 3.18 | 2.41 | 0.329 | 集成方法稳定居前 |
| 线性回归 / 岭回归 | 0.271 | 3.24 | 2.48 | 0.271 | 可解释性基准 |
| XGBoost | 0.250 | 3.28 | 2.51 | — | 训练集 R²≈1.0,过拟合显著 |
| LightGBM | 0.246 | 3.29 | 2.49 | — | 同类表现 |
| LASSO | 0.204 | 3.38 | 2.59 | — | 正则化压缩部分特征 |
| 决策树 | −0.377 | 4.45 | 3.47 | — | 单树泛化失败 |
| 神经网络 | −3.436 | 7.99 | 6.31 | — | 千级样本下深度模型失效 |
预测之外,模型更重要的价值在于归因——通过置换重要性与 SHAP 分析,量化每项指标对感官质量的贡献方向与强度,让"为什么是这个分数"第一次有了可计算的答案。
置换重要性得分 0.59,超过第 2 至第 10 名总和。提高还原糖能有效提升醇和度并掩盖杂气——这与烟叶化学的经典认知高度一致,也验证了模型归因的可靠性。
烟碱含量处于 2.5%–3.5% 时感官质量最佳;超出该区间(过高)会显著拉低感官分。糖碱比作为协调性指标同样呈现明显的适宜区间效应。
总氮重要性位列第二(0.09),与还原糖共同构成"糖氮协调"主线——适中的氮素水平有利于香气物质的前体积累。
市州、部位、香型等分类特征稳定进入模型,说明产地生态与部位差异在数据中留下了清晰印记,为产区差异化栽培与收购策略提供依据。
总分之外,项目对五个感官分项分别建模,并按市州 / 年份 / 部位验证分区建模价值——回答"哪些感官维度最可预测"与"要不要为每个产区单独建模"两个实战问题。
| 感官分项 | R² | RMSE | 解读 |
|---|---|---|---|
| 刺激性 | 0.464 | 0.286 | 最易由理化指标预测 |
| 杂气 | 0.358 | 0.339 | 化学成分解释力较强 |
| 余味 | 0.335 | 0.370 | 中等,需人工复核 |
| 香气质 | 0.279 | 0.287 | 中等偏难 |
| 香气量 | 0.154 | 0.298 | 最难,建议保留人工评吸 |
应用建议:刺激性、杂气可算法辅助评价;香气量依赖挥发性香气物质图谱,现有常规化学指标信息量不足。
模型不止于报表——项目同步交付两套可用工具,并把四套 Stacking 模型完整移植进了本页面:下方双模式预测器在浏览器本地运行全部推理(与 Python 模型输出偏差 < 0.001 分)——快测模式凭 8 项化学指标秒出结果,完整模式纳入 19 项指标与产区年份,同步预测感官质量分与综合总分。
四套 Stacking 模型全部参数序列化内嵌本页(XGBoost + PLS [+ SVR] → Ridge 融合),与 Python 原始模型输出偏差 < 0.001 分。快测模式对应 1223 交付版配置,完整模式为精度升级版。
拖动指标,预测即时更新。
▲ 全功能预测平台界面演示(登录 · 数据上传 · 批量预测 · 结果查看)
预测体系的价值不止于"算分",而是把质量认知前置到产业链每个环节。
依据关键因子归因(还原糖 / 烟碱区间),反向指导施肥、成熟采收与营养调控
化学检测值实时映射预测质量分,异常批次提前预警,指导调制工艺调整
等级判定 ±1 级一致率 98%(完全一致 68%),为分级与定价提供客观参考,减少评吸负担与争议
993 份多维样本持续积累,构建产区质量画像,支撑品牌与原料保障决策
全流程产出的文档、代码与模型资产(完整资料归档于项目组,本页仅作成果展示):
面向委托方的完整技术方案(2025-12-13 版)
模型构建、评估与业务洞察的详细记录
14 页成果汇报:从经验感知到算法预测
数据治理 / 特征工程 / 模型训练 / SHAP 解释 / 分区与分项建模 / Web 系统
XGBoost / LightGBM / SVR / Stacking / 分项模型 / 等级分类器(joblib 序列化)
外观 / 物理 / 化学 / 感官多维指标(已脱敏,不含个体信息)