【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
便利店102411 分钟前
TCP 为什么有时故意跑不快?拥塞控制与滑动窗口一次讲清
服务器·网络协议·tcp·拥塞控制
杨某不才1 小时前
如何能让Linux服务器对shell 终端 + sftp 文件传输长期保活
linux·运维·服务器
vance041 小时前
免费Cloudflare隧道隐藏公网IP
linux·tcp/ip·github
三言老师2 小时前
文本工具组合统计服务器日志数据
linux·运维·服务器
m0_743697593 小时前
DNS服务器
运维·服务器
mounter6253 小时前
认识 Tetragon:基于 eBPF 的安全监控与强制执行工具
linux·ebpf·cve·kernel
aixingkong9214 小时前
AI超节点Scale Up域总线各层优化设计
linux·服务器·网络
kidwjb5 小时前
Linux内核-文件系统-文件系统目录和文件操作
linux·内核·文件系统
yj_xqj5 小时前
Docker 基础应用与介绍
运维·docker·容器
_艾伦 耶格尔.5 小时前
进程控制
linux