Java爬虫抓取B站视频信息

依赖

xml 复制代码
<dependency>
            <groupId>org.jsoup</groupId>
            <artifactId>jsoup</artifactId>
            <version>1.17.2</version> <!-- 最新版可去官网查看 -->
        </dependency>

编码

java 复制代码
public static List<VideoDto> parseSearchPage(String keyword, int page,int lim) throws Exception {
        String url = "https://search.bilibili.com/all?keyword=" + keyword + "&page=" + page;
        Document doc = Jsoup.connect(url)
                .userAgent("Mozilla/5.0")
                .timeout(10000)
                .get();
        List<VideoDto> list = new ArrayList<>();
        Elements pictures = doc.select("picture");
        System.out.println("OK");
        int cnt=0;
        for (Element picture : pictures) {

            String pictureSrc = Objects.requireNonNull(picture.selectFirst("source")).attr("srcset");
            String title = Objects.requireNonNull(picture.selectFirst("img")).attr("alt");

            VideoDto videoDto = new VideoDto();
            videoDto.setPicture(pictureSrc);
            videoDto.setTitle(title);
            list.add(videoDto);
            cnt++;
            if(cnt==lim)break;


        }
        Elements divElements = doc.select("div.bili-video-card__info--right");
        cnt=0;
        for(Element divElement : divElements){
            Element firstLink = divElement.selectFirst("a");
            if(firstLink != null){
                String link= firstLink.attr("href");
                VideoDto videoDto=list.get(cnt);
                videoDto.setUrl(link);
                list.set(cnt,videoDto);
                cnt++;
                if(cnt==lim)break;
            }

        }
        return list;
    }
相关推荐
宸津-代码粉碎机1 小时前
LLM 模型部署难题的技术突破:从轻量化到分布式推理的全栈解决方案
java·大数据·人工智能·分布式·python
都叫我大帅哥1 小时前
TOGAF实战解码:六大行业案例解析与成功启示
java
都叫我大帅哥1 小时前
RabbitMQ消息确认机制:从外卖小哥到数据安全的奇幻漂流
java·rabbitmq
周航宇JoeZhou4 小时前
JP3-3-MyClub后台后端(二)
java·mysql·vue·ssm·springboot·项目·myclub
羊锦磊4 小时前
[ java 网络 ] TPC与UDP协议
java·网络·网络协议
找不到、了4 小时前
Java设计模式之<建造者模式>
java·设计模式·建造者模式
Code blocks5 小时前
关于“LoggerFactory is not a Logback LoggerContext but Logback is on ......“的解决方案
java·spring boot·后端
十三浪8 小时前
开源框架推荐:API数据批处理与爬虫集成
爬虫·开源
威桑8 小时前
记一次Windwos非常离谱的系统错误,IPF错误,程序构建卡顿,程序启动卡顿。。。
windows
04Koi.8 小时前
八股训练--Spring
java·后端·spring