模拟ETL流程:了解数据问题→执行清洗操作→查看清洗结果→理解数据质量对分析的影响
以下数据模拟了真实的OTA评论采集结果,包含常见问题:重复值、缺失值、异常值、格式不一致。
| ID | 景区 | 评分 | 评论 | 日期 | 来源 |
|---|
💡 旅游数据常见问题:虚假评论刷分、用户重复提交、系统编码错误(如emoji乱码)、日期格式不统一(不同OTA平台格式各异)。
模拟Python数据清洗pipeline:df.drop_duplicates() → df.dropna() → df[df['评分']>=1]
| ID | 景区 | 评分 | 评论 | 日期 | 来源 |
|---|
✅ 课程警示:数据清洗通常占数据分析总时间的60%-80%。清洗质量直接决定分析结论的可靠性。