【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
InfiSight智睿视界7 分钟前
门店智能体技术如何破解美容美发连锁的“标准执行困境”
大数据·运维·人工智能
慕容雪_21 分钟前
运维笔记-网络共享
运维·笔记·网络共享
Florence2323 分钟前
cuFuncSetCacheConfig
linux·运维·服务器
Petal9909121 小时前
内核调试:Linux编译内核源码为deb并更新内核
linux·运维·服务器
用户467244544991 小时前
Linux 进程管理
linux
Wpa.wk1 小时前
性能测试-初识性能测试基础(性能测试流程,计划等)
java·运维·经验分享·测试工具·性能测试
一个平凡而乐于分享的小比特1 小时前
Linux内核构建三剑客:Kconfig、.config与Makefile关系详解
linux·makefile·kconfig·.config
轩轶子1 小时前
【Macbook环境配置】Macbook设置ssh免密登陆服务器
运维·服务器·ssh
Dillon Dong1 小时前
服务器运维:Linux 磁盘查看 & 清理常用命令
linux·运维·服务器
ben9518chen2 小时前
Linux用户管理
linux·运维·服务器