【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
海里的鱼20221 天前
Ubuntu 服务器部署 Gitea + Ollama 及 VSCode 连接
服务器·ubuntu·gitea
Alphapeople1 天前
isaac sim和isaac lab的安装
linux·运维·服务器
爱学习的程序媛1 天前
Docker 完全指南:从入门到生产级实践
运维·docker·容器
炘爚1 天前
Linux 时间函数、格式化及 printf 相关总结
linux
平常心cyk1 天前
Linux快速复习——常用命令
linux
w6100104661 天前
CKAD-2026-金丝雀部署
linux·运维·服务器·k8s
.小小陈.1 天前
深度拆解 Linux Ext 系列文件系统:从硬件底层到软硬链接全流程
linux·运维·服务器
Geoking.1 天前
GitHub 多账号生存指南:从 SSH 连接到 GPG 签名全流程
运维·ssh·github
Frank_refuel1 天前
Linux操作系统 - > 进程信号(中)
linux·运维·服务器
s听风忆雪1 天前
aliyun 阿里云服务器 mysql 开启安全组 3306 依然访问不了
服务器·安全·阿里云