🧹 旅游数据清洗工作台

模拟ETL流程:了解数据问题→执行清洗操作→查看清洗结果→理解数据质量对分析的影响

❶ 原始数据
❷ 数据诊断
❸ 执行清洗
❹ 清洗结果
📋 模拟景区评论原始数据集

以下数据模拟了真实的OTA评论采集结果,包含常见问题:重复值、缺失值、异常值、格式不一致。

ID景区评分评论日期来源
🔍 数据质量诊断报告

💡 旅游数据常见问题:虚假评论刷分、用户重复提交、系统编码错误(如emoji乱码)、日期格式不统一(不同OTA平台格式各异)。

🔧 清洗操作面板

模拟Python数据清洗pipeline:df.drop_duplicates() → df.dropna() → df[df['评分']>=1]

🚫 去除重复行
发现并删除完全相同的评论记录(如ID=2)
❓ 处理缺失值
删除缺少评分或评论内容为空的行(如ID=6)
⚠️ 过滤异常值
评分不在1-5范围内的记录标记为异常(如ID=8评分=99)
📏 格式标准化
统一日期格式为YYYY-MM-DD
✅ 清洗后的干净数据集
ID景区评分评论日期来源

✅ 课程警示:数据清洗通常占数据分析总时间的60%-80%。清洗质量直接决定分析结论的可靠性。

安顺学院旅游管理学院 · 大数据与旅游业课程 · 配套交互式教学资源