使用 `open-uri.with_proxy` 方法打开网页

Ruby 爬虫程序如下:

ruby 复制代码
require 'open-uri'
require 'nokogiri'

# 定义代理信息
proxy_host = 'jshk.com.cn'


# 定义要爬取的网页 URL
url = 'http://www.example.com'

# 使用代理信息打开网页
open-uri.with_proxy(proxy_host, proxy_port) do |proxy|
  # 使用 Nokogiri 库解析网页内容
  doc = Nokogiri::HTML(proxy.open(url))
end

代码解释:

  1. 首先,我们引入了两个 Ruby 模块,即 open-uri 和 nokogiri。open-uri 模块用于打开网络资源,nokogiri 模块用于解析 HTML 文档。

  2. 然后,我们定义了代理信息,即代理服务器的主机名和端口号。

  3. 接着,我们定义了要爬取的网页 URL。

  4. 使用 open-uri.with_proxy 方法打开网页,其中第一个参数是代理服务器的主机名,第二个参数是代理服务器的端口号。在 with_proxy 方法内部,我们使用 proxy.open 方法打开网页。

  5. 使用 Nokogiri::HTML 方法解析打开的网页内容。

相关推荐
深蓝电商API16 小时前
大厂验证码对抗升级:从“破解”到“养环境”的思路转变
爬虫·验证码
Getgit16 小时前
亮数据 | Browser API 实战:Booking.com 动态页面抓取对比
爬虫·亮数据·broowser api
深蓝电商API2 天前
reCAPTCHA/hCaptcha/Turnstile三大国际验证码对比研究
爬虫·recaptcha·hcaptcha·turnstile
深蓝电商API2 天前
从零训练自己的验证码识别模型:数据生成到部署
爬虫·验证码
wuyk5553 天前
Python 网络爬虫入门到实战 第 04 章:请求头、UA 伪装、超时、异常处理、基础反爬绕过
开发语言·爬虫·python
weixin_440401693 天前
质朴的爬虫+数据处理
爬虫·python·数据分析·pandas
沙漠之主3 天前
Python 教学设计资料:从入门到实战的完整课程方案
爬虫·python
深蓝电商API4 天前
用YOLO训练验证码目标检测模型的全流程
爬虫·yolo·目标检测·目标跟踪
wuyk5555 天前
Python网络爬虫入门到实战 第02章:HTTP/HTTPS协议超通俗精讲(GET/POST、请求头、响应码、爬虫核心基础)
爬虫·python·http
szial5 天前
网络爬虫与 CDP 实战(二):浏览器能访问,Python 却被拒绝?拆开登录态与 CSRF
爬虫·python·csrf