百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 编程字典 > 正文

简单的网页图片下载方法Java中的多线程技术

toyiye 2024-06-21 12:18 12 浏览 0 评论

上文讲解一篇简单的单网页下载图片方法。但是实际中的网站,一般都是有多级结构的。如果存在二级网页,可以使用Java中的多线程技术来优化代码。具体来说,可以创建一个线程池,将每个链接的爬取任务提交到线程池中执行,以提高程序的效率和性能。

以下是使用Java语言实现的示例代码:


import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

import java.io.*;
import java.net.URL;
import java.util.ArrayList;
import java.util.List;
import java.util.Objects;
import java.util.UUID;
import java.util.concurrent.ExecutorService;
import java.util.concurrent.Executors;
import java.util.concurrent.TimeUnit;

public class WebCrawler {
    private static final int MAX_DEPTH = 2; // 最大爬取深度
    private static final int NUM_THREADS = 10; // 线程池大小

    public static void main(String[] args) throws InterruptedException {
        String startUrl = "https://www.example.com"; // 起始URL,修改为你的地址
        ExecutorService executor = Executors.newFixedThreadPool(NUM_THREADS); // 创建线程池
        List<String> urlsToCrawl = new ArrayList<>();
        urlsToCrawl.add(startUrl);

        for (int i = 0; i < MAX_DEPTH; i++) {
            List<String> nextUrlsToCrawl = new ArrayList<>();
            for (String url : urlsToCrawl) {
                executor.submit(() -> {
                    try {
                        // 下载当前页面的图片
                        downloadImageFromUrl(url);

                        // 爬取当前URL页面上的所有链接
                        List<String> links = getLinks(url);
                        links.stream().forEach(System.out::println);
                        for (String link : links) {
                            if (!nextUrlsToCrawl.contains(link)) {
                                nextUrlsToCrawl.add(link);
                            }
                        }
                    } catch (IOException e) {
                        e.printStackTrace();
                    }
                });
            }
            urlsToCrawl = nextUrlsToCrawl;

            //暂停几秒,以免给网站造成压力
            TimeUnit.SECONDS.sleep(5);
        }

        executor.shutdown(); // 关闭线程池
        executor.awaitTermination(Long.MAX_VALUE, TimeUnit.NANOSECONDS); // 等待所有任务完成
    }

    private static void downloadImageFromUrl(String url) {
        String html = fetchHtml(url);
        List<String> imageUrls = extractImageUrls(html);
        for (int i = 0; i < imageUrls.size(); i++) {
            String imgUrl = imageUrls.get(i);
            String fileName = "image-" + UUID.randomUUID() + ".jpg"; // 根据需要修改文件名格式
            downloadImage(imgUrl, fileName);

            //暂停几秒,以免给网站造成压力
            try {
                TimeUnit.SECONDS.sleep(1);
            } catch (InterruptedException e) {
                System.out.println(e.getMessage());
            }
        }
    }

    public static void downloadImage(String imgUrl, String fileName) {
        try {
            URL url = new URL(imgUrl);
            InputStream in = url.openStream();
            OutputStream out = new BufferedOutputStream(new FileOutputStream(fileName));
            byte[] buffer = new byte[1024];
            int bytesRead;
            while ((bytesRead = in.read(buffer)) != -1) {
                out.write(buffer, 0, bytesRead);
            }
            in.close();
            out.close();
        } catch (IOException e) {
            e.printStackTrace();
        }
    }

    private static List<String> getLinks(String url) throws IOException {
        // 获取当前URL页面上的所有链接
        String html = fetchHtml(url);

        String protocol = url.split(":")[0];

        return extractUrls(html, protocol);
    }

    public static String fetchHtml(String url) {
        try {
            Document document = Jsoup.connect(url).get();
            return document.html();
        } catch (IOException e) {
            e.printStackTrace();
            return null;
        }
    }

    public static List<String> extractUrls(String html, String protocol) {
        List<String> imageUrls = new ArrayList<>();
        Document document = Jsoup.parse(html);
        Elements imgElements = document.select("a");
        for (Element imgElement : imgElements) {
            String imgUrl = imgElement.absUrl("href");
            if (Objects.nonNull(imgUrl) && imgUrl.trim() != "") {

                if (imgUrl.toLowerCase().startsWith("http")) {
                    imageUrls.add(imgUrl);
                } else {
                    imageUrls.add(protocol + ":" + imgUrl);
                }
            }
        }
        return imageUrls;
    }

    public static List<String> extractImageUrls(String html) {
        List<String> imageUrls = new ArrayList<>();
        Document document = Jsoup.parse(html);
        Elements imgElements = document.select("img");
        for (Element imgElement : imgElements) {
            String imgUrl = imgElement.absUrl("src");
            if (Objects.nonNull(imgUrl) && imgUrl.toLowerCase().startsWith("http")) {
                imageUrls.add(imgUrl);
            }
        }
        return imageUrls;
    }
}

    

在上述代码中,我们首先定义了最大爬取深度和线程池大小等参数。然后,我们创建了一个线程池和一个用于存储待爬取URL的列表。接着,我们使用两层循环遍历所有待爬取的URL,并将每个URL的爬取任务提交到线程池中执行。最后,我们关闭线程池并等待所有任务完成。

相关推荐

为何越来越多的编程语言使用JSON(为什么编程)

JSON是JavascriptObjectNotation的缩写,意思是Javascript对象表示法,是一种易于人类阅读和对编程友好的文本数据传递方法,是JavaScript语言规范定义的一个子...

何时在数据库中使用 JSON(数据库用json格式存储)

在本文中,您将了解何时应考虑将JSON数据类型添加到表中以及何时应避免使用它们。每天?分享?最新?软件?开发?,Devops,敏捷?,测试?以及?项目?管理?最新?,最热门?的?文章?,每天?花?...

MySQL 从零开始:05 数据类型(mysql数据类型有哪些,并举例)

前面的讲解中已经接触到了表的创建,表的创建是对字段的声明,比如:上述语句声明了字段的名称、类型、所占空间、默认值和是否可以为空等信息。其中的int、varchar、char和decimal都...

JSON对象花样进阶(json格式对象)

一、引言在现代Web开发中,JSON(JavaScriptObjectNotation)已经成为数据交换的标准格式。无论是从前端向后端发送数据,还是从后端接收数据,JSON都是不可或缺的一部分。...

深入理解 JSON 和 Form-data(json和formdata提交区别)

在讨论现代网络开发与API设计的语境下,理解客户端和服务器间如何有效且可靠地交换数据变得尤为关键。这里,特别值得关注的是两种主流数据格式:...

JSON 语法(json 语法 priority)

JSON语法是JavaScript语法的子集。JSON语法规则JSON语法是JavaScript对象表示法语法的子集。数据在名称/值对中数据由逗号分隔花括号保存对象方括号保存数组JS...

JSON语法详解(json的语法规则)

JSON语法规则JSON语法是JavaScript对象表示法语法的子集。数据在名称/值对中数据由逗号分隔大括号保存对象中括号保存数组注意:json的key是字符串,且必须是双引号,不能是单引号...

MySQL JSON数据类型操作(mysql的json)

概述mysql自5.7.8版本开始,就支持了json结构的数据存储和查询,这表明了mysql也在不断的学习和增加nosql数据库的有点。但mysql毕竟是关系型数据库,在处理json这种非结构化的数据...

JSON的数据模式(json数据格式示例)

像XML模式一样,JSON数据格式也有Schema,这是一个基于JSON格式的规范。JSON模式也以JSON格式编写。它用于验证JSON数据。JSON模式示例以下代码显示了基本的JSON模式。{"...

前端学习——JSON格式详解(后端json格式)

JSON(JavaScriptObjectNotation)是一种轻量级的数据交换格式。易于人阅读和编写。同时也易于机器解析和生成。它基于JavaScriptProgrammingLa...

什么是 JSON:详解 JSON 及其优势(什么叫json)

现在程序员还有谁不知道JSON吗?无论对于前端还是后端,JSON都是一种常见的数据格式。那么JSON到底是什么呢?JSON的定义...

PostgreSQL JSON 类型:处理结构化数据

PostgreSQL提供JSON类型,以存储结构化数据。JSON是一种开放的数据格式,可用于存储各种类型的值。什么是JSON类型?JSON类型表示JSON(JavaScriptO...

JavaScript:JSON、三种包装类(javascript 包)

JOSN:我们希望可以将一个对象在不同的语言中进行传递,以达到通信的目的,最佳方式就是将一个对象转换为字符串的形式JSON(JavaScriptObjectNotation)-JS的对象表示法...

Python数据分析 只要1分钟 教你玩转JSON 全程干货

Json简介:Json,全名JavaScriptObjectNotation,JSON(JavaScriptObjectNotation(记号、标记))是一种轻量级的数据交换格式。它基于J...

比较一下JSON与XML两种数据格式?(json和xml哪个好)

JSON(JavaScriptObjectNotation)和XML(eXtensibleMarkupLanguage)是在日常开发中比较常用的两种数据格式,它们主要的作用就是用来进行数据的传...

取消回复欢迎 发表评论:

请填写验证码