本页记录一次完整的项目经理(PM)负责制多 Agent 评审:先按「AI 推荐服务」内核设计 10 个覆盖不同文旅场景的智能体,再由 4 个专项评审 Agent 按统一矩阵独立打分、1 个审核长做方法学挑战与交叉复核,最终选出 3 个产品。本页是评审档案:留存评分矩阵、两种聚合口径与落选理由,使「为什么是这三个」可被检验。
采用项目经理负责制:PM 不参与具体维度打分,只负责制定评价矩阵、分派评审任务、核查打分质量、并在争议席位上做终裁。评审 Agent 各自拥有主责维度,对其余维度只能以推断分数参与汇总,且必须标注证据边界。
前三位换算到第 3 席时,A02 / A03 / A04 的算术均值差距只有 0.10——这个精度差不具备决策意义。审核长的职责不是重跑一遍评审,而是换一套聚合口径(主责维度权重 50%、其余三人各 16.67%)看结论是否翻转,并做一次压力测试:把评审中「学校/政府/民宿会采购会给数据」这一唯一未被检验的假设推翻,看榜单会怎样重排。
结果:两种口径下 A05、A01 稳居前二;第 3 席随口径翻转,最终由压力测试与资产复用性终裁给 A02。
| 维度 | 权重 | 主责 Agent | 核心判据 |
|---|
打分规则:每维度 1–10 分;禁止全员同分;D5 得分越高代表风险越低;每条结论须标注「已确认 / 合理推断 / 暂未确认」。
| 排名 | 方案 | 场景侧 | 算术均值 | 主责口径 | Δ | 推荐内核 | 结论 |
|---|
未入选不等于不成立。每个方案都记录了阻塞性质:「卡在自己工时」与「卡在别人授权」是两类完全不同的问题——前者暑假就能做,后者得先拿到批文。
| 术语 | 一句话 | 出处 |
|---|
审核长在终裁时对三个入选方案各加了硬约束。下面是执行结果,逐条可核:
| 方案 | 上线前置条件 | 落实方式 | 状态 |
|---|