【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
Zn_lunar5 分钟前
autodl tizi+codex cli
运维·服务器·网络
@insist12311 分钟前
网络工程师-实战配置篇(一):深入 BGP 与 VRRP,构建高可靠网络
服务器·网络·php·网络工程师·软件水平考试
楼田莉子17 分钟前
同步/异步日志系统:日志器管理器模块\全局接口\性能测试
linux·服务器·开发语言·c++·后端·设计模式
鹅是开哥21 分钟前
XXL-Job Docker 部署中“登录无响应”的排查与解决
运维·docker·容器
奇妙之二进制23 分钟前
zmq源码分析之io_thread_t
linux·服务器
逻极24 分钟前
MySQL 从入门到精通:一个老 DBA 的实战心法
运维·数据库·mysql·从入门到精通·mysql从入门到精通
cui_ruicheng33 分钟前
Linux IO入门(三):手写一个简易的 mystdio 库
linux·运维·服务器
telllong34 分钟前
MCP协议实战:30分钟给Claude接上你公司的内部API
linux·运维·服务器
正在走向自律43 分钟前
KingbaseES 基础 SQL 语法与日常运维实操手册
运维·数据库·sql·kingbasees
㳺三才人子1 小时前
SpringDoc OpenAPI 配置問題
服务器·spring boot