Java爬虫抓取B站视频信息

依赖

xml 复制代码
<dependency>
            <groupId>org.jsoup</groupId>
            <artifactId>jsoup</artifactId>
            <version>1.17.2</version> <!-- 最新版可去官网查看 -->
        </dependency>

编码

java 复制代码
public static List<VideoDto> parseSearchPage(String keyword, int page,int lim) throws Exception {
        String url = "https://search.bilibili.com/all?keyword=" + keyword + "&page=" + page;
        Document doc = Jsoup.connect(url)
                .userAgent("Mozilla/5.0")
                .timeout(10000)
                .get();
        List<VideoDto> list = new ArrayList<>();
        Elements pictures = doc.select("picture");
        System.out.println("OK");
        int cnt=0;
        for (Element picture : pictures) {

            String pictureSrc = Objects.requireNonNull(picture.selectFirst("source")).attr("srcset");
            String title = Objects.requireNonNull(picture.selectFirst("img")).attr("alt");

            VideoDto videoDto = new VideoDto();
            videoDto.setPicture(pictureSrc);
            videoDto.setTitle(title);
            list.add(videoDto);
            cnt++;
            if(cnt==lim)break;


        }
        Elements divElements = doc.select("div.bili-video-card__info--right");
        cnt=0;
        for(Element divElement : divElements){
            Element firstLink = divElement.selectFirst("a");
            if(firstLink != null){
                String link= firstLink.attr("href");
                VideoDto videoDto=list.get(cnt);
                videoDto.setUrl(link);
                list.set(cnt,videoDto);
                cnt++;
                if(cnt==lim)break;
            }

        }
        return list;
    }
相关推荐
毕设源码-郭学长3 分钟前
【开题答辩全过程】以 高校自动排课系统的设计与实现为例,包含答辩的问题和答案
java
indexsunny32 分钟前
互联网大厂Java面试实战:从Spring Boot到微服务架构的深度解析
java·spring boot·spring cloud·kafka·prometheus·security·microservices
问道飞鱼38 分钟前
【Tauri框架学习】Windows 11 环境下 Tauri 开发环境安装与问题解决手册
windows·学习·tauri·开发环境
ChoSeitaku1 小时前
NO.2|proto3语法|消息类型|通讯录|文件读取|enum类型
java·服务器·前端
庞轩px1 小时前
MinorGC的完整流程与复制算法深度解析
java·jvm·算法·性能优化
zhouping@1 小时前
JAVA学习笔记day06
java·笔记·学习
毕设源码-郭学长2 小时前
【开题答辩全过程】以 某某协会管理与展示平台为例,包含答辩的问题和答案
java
多云的夏天2 小时前
docker容器部署-windows-ubuntu
java·docker·容器
庞轩px2 小时前
内存区域的演进与直接内存——JVM性能优化的权衡艺术
java·jvm·笔记·性能优化
xiaoliuliu123452 小时前
Autodesk官方卸载工具使用教程(Windows版,含解压+管理员运行+批量卸载)
windows