淘宝爬虫工具是一种用于自动化获取淘宝网站数据的程序。以下是一个简单的淘宝爬虫工具的代码示例:
python
import requests
from bs4 import BeautifulSoup
def get_taobao_data(keyword):
url = f'https://s.taobao.com/search?q={keyword}'
headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3'}
response = requests.get(url, headers=headers)
soup = BeautifulSoup(response.text, 'html.parser')
items = soup.find_all('div', {'class': 'item'})
results = []
for item in items:
title = item.find('a', {'class': 'J_ClickStat'}).text.strip()
price = item.find('strong').text
result = {'title': title, 'price': price}
results.append(result)
return results
keyword = '手机'
data = get_taobao_data(keyword)
for item in data:
print(item['title'], item['price'])
以上代码使用了Python的requests库和BeautifulSoup库来发起HTTP请求并解析HTML页面。它首先定义了一个get_taobao_data
函数,接收一个关键字作为参数,然后构造淘宝搜索页面的URL,并发送HTTP请求来获取页面内容。
接着,它使用BeautifulSoup来解析页面内容,并通过CSS选择器找到所有商品的信息。然后,它抽取每个商品的标题和价格,并将其存储在一个字典中。最后,它返回所有商品的信息列表。
最后,我们可以调用get_taobao_data
函数,传入一个关键字(比如"手机"),并迭代打印出每个商品的标题和价格。
请注意,这只是一个非常简单的示例,实际应用中可能需要处理更多的页面结构和数据处理逻辑,以及添加更多的异常处理和反爬虫措施。