【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
电商API_180079052477 小时前
京东商品详情API技术文章
大数据·运维·人工智能·网络爬虫
三言老师8 小时前
秘诀-如何远程SSN访问家里的八台电脑(frp 实操方案)
linux·运维·ssh
躺不平的理查德8 小时前
ARCH与交叉编译器的关系
服务器·arm
举手9 小时前
Dispatcher模块剖析
linux·c++
BTU_YC10 小时前
Docker Compose 部署 DozerDB 完整教程
运维·docker·容器
谢慧琼10 小时前
2026零基础做企业网站,低成本搭建官方网站
服务器·前端·javascript
allforgood11 小时前
运行容器
linux
Light_It11 小时前
Linux 内核参数 pci-stub.ids=
linux·kernel
RisunJan12 小时前
Linux命令-scriptreplay(终端会话回放)
linux·运维·chrome
spencer_tseng12 小时前
[kylin & linux] install docker
linux·docker·kylin