【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
独钓寒江雨11 分钟前
SRH介绍
运维·网络·srv6
东城绝神13 分钟前
《Linux运维实战:使用脚本模拟服务器CPU内存磁盘使用率》
linux·运维·服务器
染翰14 分钟前
Linux root用户安装配置Git
linux·git·后端
xingyuzhisuan15 分钟前
企业级GPU算力远程部署:标准化访问配置与性能调优手册
服务器·运维开发·远程工作·gpu算力
吃胖点儿15 分钟前
RAG系统优化完整路径:从30%到90%准确率的工程实践
服务器·数据库·windows
Cat_Rocky15 分钟前
k8s-Prometheus的manifests 清单部署
linux·kubernetes·prometheus
剑傲娇18 分钟前
【计算机组成原理】 C与汇编的「对话」
服务器·开发语言·缓存
生活爱好者!19 分钟前
用NAS进行漫画创作!一键部署Open WebUI
java·服务器·开发语言·安全·docker
Realdagongzai21 分钟前
Linux 6.19.10 内核调度器算法详解
linux·学习·算法·spring·kernel
|_⊙24 分钟前
进程间通信(管道)
linux·运维·服务器