【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
民乐团扒谱机7 分钟前
【读论文】Frequency Comb Based Optical Time Transfer基于光频梳的光时间传递
运维·服务器
UP_Continue8 分钟前
Linux--日志的模拟实现
linux·运维·服务器
xlp666hub10 分钟前
深度剖析Linux Input子系统(1):宏观架构与核心原理
linux
东北甜妹22 分钟前
playbook
linux·服务器·网络
YMWM_23 分钟前
docker在jetson thor的应用
运维·docker·容器·jetson thor
我爱学习好爱好爱28 分钟前
Ansible 入门:ad-hoc 临时命令与常用模块
linux·服务器·ansible
s090713628 分钟前
【Zynq 进阶一】深度解析 PetaLinux 存储布局:NAND Flash 分区与 DDR 内存分配全攻略
linux·fpga开发·设备树·zynq·nand flash启动·flash分区
lwx91485232 分钟前
Linux-sftp命令详解
linux·运维·服务器
舒一笑35 分钟前
客户现场没有外网,Docker 服务怎么部署?
运维·后端·自动化运维
奥升新能源平台41 分钟前
奥升充电最小化高可用机房部署方案
运维·安全·开源·能源·springcloud