11.22【大数据】

各文件的区别

1. history_starter_jrj.py
  • 爬虫对象JrjSpyder
  • 数据来源:金融界(JRJ)
  • 爬取方式 :调用 get_historical_news 方法,传入网站列表和起始日期。
  • 处理步骤
    1. 爬取历史数据。
    2. 去重清洗。
    3. 去除包含null值的行。
    4. 创建新的数据库,针对每个股票保存涉及该股票的新闻,并贴好标签。
2. history_starter_nbd.py
  • 爬虫对象NbdSpyder
  • 数据来源:每日经济新闻(NBD)
  • 爬取方式 :调用 get_historical_news 方法,传入起始页码。
  • 处理步骤
    1. 爬取历史数据。
    2. 去重清洗。
    3. 去除包含null值的行。
    4. 创建新的数据库,针对每个股票保存涉及该股票的新闻,并贴好标签。
3. history_starter_cnstock.py
  • 爬虫对象CnStockSpyder
  • 数据来源:中国证券网(CNStock)
  • 爬取方式 :循环调用 get_historical_news 方法,传入每个网站的URL和分类。
  • 处理步骤
    1. 爬取历史数据。
    2. 去重清洗。
    3. 去除包含null值的行。
    4. 创建新的数据库,针对每个股票保存涉及该股票的新闻,并贴好标签。
    5. 每次爬取后休眠30秒,防止被封IP。
4. history_starter_stock_price.py
  • 爬虫对象StockInfoSpyder
  • 数据来源:股票价格数据
  • 爬取方式 :调用 get_historical_news 方法,可以指定起始和结束日期,如果不指定则从最新数据时间开始获取直到当前。
  • 处理步骤
    1. 爬取历史股票价格数据。

总结

  • 数据来源:四个文件分别从不同的数据源爬取数据,分别是金融界(JRJ)、每日经济新闻(NBD)、中国证券网(CNStock)和股票价格数据。
  • 爬取方式:爬取方式有所不同,JRJ和CNStock需要传入具体的网站列表和分类,NBD需要传入起始页码,而股票价格数据可以通过指定时间段来爬取。
  • 处理步骤:前三个文件(JRJ、NBD、CNStock)的处理步骤相似,包括爬取数据、去重清洗、去除null值和创建新的数据库。而股票价格数据文件(stock_price)只包含爬取数据的步骤。

这些文件的主要区别在于数据源的不同和爬取方式的差异,但处理步骤在前三个文件中基本一致。

PRO1,tensorFlow版本问题

相关推荐
Gofarlic_OMS12 分钟前
ENOVIA基于Token的许可证消费模式分析与分点策略
java·大数据·开发语言·人工智能·制造
乐迪信息32 分钟前
乐迪信息:智慧港口AI防爆摄像机实现船舶违规靠岸自动抓拍
大数据·人工智能·算法·安全·目标跟踪
小天互连即时通讯1 小时前
政企信创即时通讯选型参考
大数据·网络·人工智能
小飞象—木兮1 小时前
《Power BI数据分析与可视化指南》:从概念到实操的全解析····(附相关材料下载)
大数据·人工智能·python·数据挖掘·数据分析
快递鸟社区1 小时前
快递鸟全球航空航班动态查询
大数据·人工智能
数据皮皮侠AI1 小时前
顶刊同款!中国地级市风灾风险与损失数据集(2000-2022)|灾害 / 环境 / 经济研究必备
大数据·人工智能·笔记·能源·1024程序员节
xiaoduo AI1 小时前
客服机器人自定义报表支持定时发送吗?智能 Agent + 邮件推送,能否自动生成运营日报?
大数据·人工智能·机器人
xcbrand1 小时前
政府事业机构品牌全案公司有哪些
大数据·人工智能·python
无忧智库2 小时前
破局与狂范:大模型上线备案与全栈架构合规深度解构指南(PPT)
大数据·架构
海兰2 小时前
Elasticsearch 容量规划与性能优化完全指南
大数据·elasticsearch·性能优化