使用 Typhoeus 和 Ruby 编写的爬虫程序

以下是一个使用 Typhoeus 和 Ruby 编写的爬虫程序,用于爬取 ,同时使用了 jshk.com.cn/get_proxy 这段代码获取代理:

ruby 复制代码
#!/usr/bin/env ruby

require 'typhoeus'
require 'json'

def get_proxy
  url = "https://www.duoip.cn/get_proxy"
  response = Typhoeus.get(url)
  if response.code == 200
    proxy_json = JSON.parse(response.body)
    proxy_ip = proxy_json['data']['ip']
    proxy_port = proxy_json['data']['port']
    return proxy_ip, proxy_port
  end
rescue Typhoeus::Error => e
  puts "Error: #{e.message}"
  exit(1)
end

def crawl_ebay(proxy_ip, proxy_port)
  url = "https://www.ebay.com"
  headers = {
    'User-Agent' => 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36',
    'Accept' => 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8',
    'Accept-Language' => 'zh-CN,zh;q=0.8,en-US;q=0.6,en;q=0.4',
    'Accept-Encoding' => 'gzip, deflate, br',
    'Referer' => 'https://www.google.com',
    'Connection' => 'keep-alive'
  }

  # 使用 Typhoeus 的 Hydra 对象进行并发请求
  hydra = Typhoeus::Hydra.new

  # 创建一个使用代理的请求
  request = Typhoeus::Request.new(url, headers: headers, proxy: { ip: proxy_ip, port: proxy_port })

  # 使用 Hydra 对象发送请求
  response = hydra.queue(request)

  # 如果请求成功,输出响应体
  if response.code == 200
    puts "Request successful. Response body: #{response.body}"
  # 如果请求失败,输出错误信息
  else
    puts "Request failed. Error: #{response.code}"
  end

  # 关闭 Hydra 对象
  hydra.close
end

# 获取代理
proxy_ip, proxy_port = get_proxy

# 使用获取到的代理进行爬取
crawl_ebay(proxy_ip, proxy_port)

这个程序首先获取一个代理IP和端口,然后使用这个代理进行 ebay.com 的爬取。请注意,这个示例代码可能会随着网站的变化而失效,您可能需要根据实际情况进行调整。同时,请注意,在使用这个程序之前,请确保已经安装了 Typhoeus 库。

相关推荐
遇事不決洛必達几秒前
AST反混淆脚本
javascript·爬虫·nodejs·ast·ob混淆
java1234_小锋4 分钟前
Java高频面试题:怎么实现Redis的高可用?
java·开发语言·redis
oyguyteggytrrwwwrt8 分钟前
抄写YOLOE源码——先抄写ultralytics包,关于__init__.py
开发语言·python
格林威10 分钟前
Baumer相机铝箔表面针孔检测:提升包装阻隔性的 7 个核心策略,附 OpenCV+Halcon 实战代码!
开发语言·人工智能·数码相机·opencv·计算机视觉·c#·工业相机
日出等日落15 分钟前
用 Kavita实现我的远程数字书屋搭建记!
java·开发语言·ide·vscode·编辑器
我是伪码农19 分钟前
JS 复习
开发语言·前端·javascript
Data 实验室21 分钟前
TaskPyro “小龙虾版本”专业爬虫管理平台来了:AI+分布式+IM 机器人,一套搞定企业级爬虫调度
人工智能·分布式·爬虫
沐知全栈开发21 分钟前
键盘快捷键:提升工作效率的利器
开发语言
野犬寒鸦22 分钟前
高并发利器:SingleFlight优化指南(Java版实现与项目实战)
服务器·开发语言·redis·后端·面试
Alan GEO实施教练22 分钟前
实用新型专利申请代理机构选择:关键考量因素与实操要点讲解
java·开发语言·python