【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
TechMasterPlus4 分钟前
Linux U-Boot 与内核启动流程深度解析:从上电到 Shell 的完整之旅
linux·运维·服务器
大白菜和MySQL7 分钟前
Linux下dhcp服务搭建
linux·运维·服务器
大白菜和MySQL9 分钟前
linux系统环境常用命令
android·linux·adb
SPC的存折18 分钟前
1、MySQL故障排查与运维案例
linux·运维·服务器·数据库·mysql
Run_Teenage20 分钟前
Linux:认识信号,理解信号的产生和处理
linux·运维·算法
Deitymoon32 分钟前
linux——TCP服务器获取客户端IP地址
linux·服务器·tcp/ip
CDN36034 分钟前
高防服务器磁盘 / CPU 爆满?攻击引流与资源扩容实战
运维·服务器·网络协议
小贾要学习35 分钟前
【Linux】应用层自定义协议与序列化
linux·服务器·c++·json
white-persist37 分钟前
【vulhub spring CVE-2018-1270】CVE-2018-1270 Spring Messaging 远程命令执行漏洞 完整复现详细分析解释
java·服务器·网络·数据库·后端·python·spring
freewlt38 分钟前
OpenClaw 工作流自动化实战:打造你的智能定时任务中心
运维·servlet·自动化