【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
dshudsnb1 分钟前
4种实用方法,快速完成新旧电脑数据迁移
运维·服务器·电脑
sxdtzhp4 分钟前
定时任务避峰运行:远离整点,保障系统稳定运行
运维·软件工程·定时任务·crontab
benjiangliu6 分钟前
LINUX系统-18-EXT系列文件系统(三)
linux·运维·chrome
无足鸟ICT7 分钟前
【RHCA+】~_.vimrc
linux
zhangfeng11338 分钟前
,在slurm中也能安装ubundu了,Singularity(现叫 Apptainer)不需要root权限的容器方案,对比docker
运维·人工智能·机器学习·docker·容器
皆圥忈12 分钟前
深入理解进程虚拟地址空间
linux
一只鹿鹿鹿19 分钟前
网络安全和安防建设方案(doc文件)
大数据·运维·网络·物联网·安全
LJianK120 分钟前
服务器高 CPU 排查方法
linux·运维·服务器
liu-yonggang20 分钟前
Linux vs QNX 深度对比
linux·qnx
皆圥忈25 分钟前
Linux 进程控制(上):创建、终止与等待
linux·运维·服务器