【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
鸠摩智首席音效师2 小时前
linux 系统中 Shutting Down, Restarting, Halting 有什么区别 ?
linux·运维·服务器
CIb0la2 小时前
Linux 将继续不支持 HDMI 2.1 实现
linux·运维·服务器
吕了了3 小时前
85 微PE吕了了修改版--更新!
运维·windows·电脑·系统
德生coding3 小时前
wifi驱动编译出来的驱动文件怎么做strip
linux
鹿鸣天涯3 小时前
Kali Linux 2025.4 发布:桌面环境增强,新增 3 款安全工具
linux·运维·安全
峥嵘life4 小时前
Android16 EDLA 认证测试CTS问题分析解决
android·java·服务器
学习&笔记4 小时前
MTK(系统篇)user版本无法使用setenforce 0命令关闭selinux权限
linux·运维·服务器
Bdygsl4 小时前
Linux(8)—— 进程优先级与环境变量
linux·运维·服务器
another heaven4 小时前
【软考 磁盘磁道访问时间】总容量等相关案例题型
linux·网络·算法·磁盘·磁道
吕了了4 小时前
87 Windows 系统安装的本质是什么?
运维·windows·电脑·系统