Java爬虫抓取B站视频信息

依赖

xml 复制代码
<dependency>
            <groupId>org.jsoup</groupId>
            <artifactId>jsoup</artifactId>
            <version>1.17.2</version> <!-- 最新版可去官网查看 -->
        </dependency>

编码

java 复制代码
public static List<VideoDto> parseSearchPage(String keyword, int page,int lim) throws Exception {
        String url = "https://search.bilibili.com/all?keyword=" + keyword + "&page=" + page;
        Document doc = Jsoup.connect(url)
                .userAgent("Mozilla/5.0")
                .timeout(10000)
                .get();
        List<VideoDto> list = new ArrayList<>();
        Elements pictures = doc.select("picture");
        System.out.println("OK");
        int cnt=0;
        for (Element picture : pictures) {

            String pictureSrc = Objects.requireNonNull(picture.selectFirst("source")).attr("srcset");
            String title = Objects.requireNonNull(picture.selectFirst("img")).attr("alt");

            VideoDto videoDto = new VideoDto();
            videoDto.setPicture(pictureSrc);
            videoDto.setTitle(title);
            list.add(videoDto);
            cnt++;
            if(cnt==lim)break;


        }
        Elements divElements = doc.select("div.bili-video-card__info--right");
        cnt=0;
        for(Element divElement : divElements){
            Element firstLink = divElement.selectFirst("a");
            if(firstLink != null){
                String link= firstLink.attr("href");
                VideoDto videoDto=list.get(cnt);
                videoDto.setUrl(link);
                list.set(cnt,videoDto);
                cnt++;
                if(cnt==lim)break;
            }

        }
        return list;
    }
相关推荐
lee_curry5 小时前
第四章 jvm中的垃圾回收器
java·jvm·垃圾收集器
John_ToDebug6 小时前
隐于无形,触手可及:Chrome 互动滚动条的六个设计密码
chrome·windows·ui
九转成圣7 小时前
Java 性能优化实战:如何将海量扁平数据高效转化为类目字典树?
java·开发语言·json
_.Switch7 小时前
东方财富股票数据JS逆向:secids字段和AES加密实战
开发语言·前端·javascript·网络·爬虫·python·ecmascript
思茂信息7 小时前
CST软件如何进行参数化扫描?
运维·开发语言·javascript·windows·ecmascript·软件工程·软件需求
直奔標竿7 小时前
Java开发者AI转型第二十七课!Spring AI 个人知识库实战(六)——全栈闭环收官,解锁前端流式渲染终极技巧
java·开发语言·前端·人工智能·后端·spring
金銀銅鐵7 小时前
[java] 编译之后的记录类(Record Classes)长什么样子(上)
java·jvm·后端
开发者联盟league8 小时前
在windows上安装和运行rocketmq
windows·rocketmq
野生技术架构师9 小时前
金三银四面试总结篇,汇总 Java 面试突击班后的面试小册
java·面试·职场和发展