🕷️ 旅游数据爬虫原理演示(P06舆情监测)
# 模拟爬取携程黄果树瀑布评论
import requests
from bs4 import BeautifulSoup
url = "https://you.ctrip.com/sight/huangguoshu12.html"
headers = {'User-Agent': 'Mozilla/5.0...'}
resp = requests.get(url, headers=headers)
# 解析评论区
soup = BeautifulSoup(resp.text, 'html.parser')
reviews = soup.find_all('div', class_='commentItem')
# 提取评分和内容
for r in reviews[:5]:
score = r.find('span', class_='score').text
content = r.find('div', class_='content').text
print(f"评分:{score} 评论:{content}")
⚠️ 课程提醒:爬虫需遵守robots.txt协议,控制请求频率,尊重数据版权。建议优先使用公开API和开放数据集。