【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
布局呆星4 小时前
云服务器上部署单项目/多项目
运维·服务器
盐焗鹌鹑蛋5 小时前
【Linux】缓冲区
linux·运维·服务器
祈禾5 小时前
Redis三大缓存问题与分布式锁
运维·数据库·redis·笔记·分布式·缓存
ltl7 小时前
向量库与图 RAG:HNSW、DiskANN 到 GraphRAG
linux
ltl7 小时前
可观测性存储与成本:采样、下采样、冷热分层
运维
学代码的CJY7 小时前
Linux 库制作与原理:静态库、动态库、ELF 与动态链接完全指南
linux·运维·服务器
沸速存储8 小时前
CPU 和 GPU 核心差别在哪?为什么 AI 训练离不开 GPU
服务器·人工智能·科技·嵌入式硬件·电脑
SatanII8 小时前
403 禁地:Nginx 拒绝所有生者进入
运维·nginx
呱呱巨基9 小时前
Linux 查找命令
linux·笔记·学习·查找命令
路由侠内网穿透9 小时前
本地部署企业级快速开发平台芋道管理后台并实现外部访问
运维·服务器·网络·网络协议