Python实现抓取HTML网页并以PDF文件形式保存的方法_python生成pdf - CSDN文库

5星 · 超过95%的资源 115 浏览量更新于2023-05-10 评论 3 收藏 73KB PDF 举报

身份认证购VIP最低享 7 折!

领优惠券(最高得80元）

资源详情

资源评论

资源推荐

Python实现抓取实现抓取HTML网页并以网页并以PDF文件形式保存的方法文件形式保存的方法

主要介绍了Python实现抓取HTML网页并以PDF文件形式保存的方法,结合实例形式分析了PyPDF2模块的安装及

Python抓取HTML页面并基于PyPDF2模块生成pdf文件的相关操作技巧,需要的朋友可以参考下

本文实例讲述了Python实现抓取HTML网页并以PDF文件形式保存的方法。分享给大家供大家参考，具体如下：

一、前言一、前言

今天介绍将HTML网页抓取下来，然后以PDF保存，废话不多说直接进入教程。

今天的例子以廖雪峰老师的Python教程网站为

例：http://www.liaoxuefeng.com/wiki/0014316089557264a6b348958f449949df42a6d3a2e542c000

二、准备工作二、准备工作

1. PyPDF2的安装使用（用来合并的安装使用（用来合并PDF）：）：

PyPDF2版本：1.25.1

https://pypi.python.org/pypi/PyPDF2/1.25.1

或

https://github.com/mstamy2/PyPDF2

安装：

pip install PyPDF2

使用示例：

from PyPDF2 import PdfFileMerger

merger = PdfFileMerger()

input1 = open("hql_1_20.pdf", "rb")

input2 = open("hql_21_40.pdf", "rb")

merger.append(input1)

merger.append(input2)

# Write to an output PDF document

output = open("hql_all.pdf", "wb")

merger.write(output)

2. requests、、beautifulsoup 是爬虫两大神器，是爬虫两大神器，reuqests 用于网络请求，用于网络请求，beautifusoup 用于操作用于操作 html 数据。数据。有了这两把梭

子，干起活来利索。scrapy 这样的爬虫框架我们就不用了，这样的小程序派上它有点杀鸡用牛刀的意思。此外，既然是把

html 文件转为 pdf，那么也要有相应的库支持， wkhtmltopdf 就是一个非常的工具，它可以用适用于多平台的 html 到 pdf 的

转换，pdfkit 是 wkhtmltopdf 的Python封装包。首先安装好下面的依赖包

pip install requests

pip install beautifulsoup4

pip install pdfkit

3. 安装安装 wkhtmltopdf

Windows平台直接在 http://wkhtmltopdf.org/downloads.html 下载稳定版的 wkhtmltopdf 进行安装，安装完成之后把该程序的

执行路径加入到系统环境 $PATH 变量中，否则 pdfkit 找不到 wkhtmltopdf 就出现错误 “No wkhtmltopdf executable found”。

Ubuntu 和 CentOS 可以直接用命令行进行安装

$ sudo apt-get install wkhtmltopdf # ubuntu

$ sudo yum intsall wkhtmltopdf # centos

三、数据准备三、数据准备

1. 获取每篇文章的获取每篇文章的url

def get_url_list():

"""

获取所有URL目录列表

:return:

"""

response = requests.get("http://www.liaoxuefeng.com/wiki/0014316089557264a6b348958f449949df42a6d3a2e542c000")

本内容试读结束，登录后可阅读更多

下载后可阅读完整内容，剩余3页未读，立即下载

评论5

陌陌的日记

2023-07-24

：这篇文章提供了一种简洁而有效的方法，能够帮助读者轻松解决抓取网页并保存为PDF的需求。

weixin_38550605

粉丝: 5
资源: 951

会员权益专享

图片转文字

全年可省5，000元立即开通

最新资源

资源上传下载、课程学习等过程中有任何疑问或建议，欢迎提出宝贵意见哦~我们会及时处理！点击此处反馈