【LINUX】shell中模拟爬虫

url_home="http://localhost:8080"

curl ${url_home} -o 1.html

cat 1.html | grep 'href="' | awk -F"\"" '{ print $2 }' >urls.txt

cat 1.html | grep 'href="' | awk -F"\"" '{ print 3 }' \| awk -F"\<" '{ print 1 }' | sed "s:>::g"|sed "s: :_:g" > titles.txt

打开文件1

exec 3< urls.txt

打开文件2

exec 4< titles.txt

读取文件1和文件2的内容

while read -u 3 url && read -u 4 title

do

echo "url: $url"

echo "title: $title"

curl "{url_home}/url" -o "${title}.html"

done

关闭文件

exec 3<&-

exec 4<&-

相关推荐
潘晓可2 分钟前
Docker部署Bookstack
运维·docker·容器
Serverless社区4 分钟前
阿里云新发的AgentRun 有哪些“大招”,一文详解来了
运维·阿里云·云原生·serverless
誰能久伴不乏7 分钟前
深入理解 `poll` 函数:详细解析与实际应用
linux·服务器·c语言·c++·unix
倔强的石头10618 分钟前
Linux 进程深度解析(二):进程状态、fork 创建与特殊进程(僵尸 与 孤儿)
linux·运维·服务器
小李小李无与伦比31 分钟前
使用Simiki,部署.md文档
linux·运维·服务器
做人不要太理性35 分钟前
【Linux系统】ELF 文件格式的硬核揭秘
java·linux·服务器
草根站起来1 小时前
局域网内网IP能不能申请SSL证书
服务器·tcp/ip·ssl
怀旧,1 小时前
【Linux系统编程】12. 基础IO(下)
linux·运维·服务器
网络小白不怕黑1 小时前
Docker Compose与私有仓库
运维·docker·容器
Winter_Sun灬1 小时前
CentOS 7 编译安卓 arm64-v8a 版 OpenSSL 动态库(.so)
android·linux·centos