首页 > 资讯 > 后端开发 > Python >Python去除PDF水印的实现示例

355

分享到

Python去除PDF水印的实现示例

2024-04-02 19:04:59 355人浏览薄情痞子

Python 官方文档：入门教程 => 点击学习

摘要

今天介绍下用 python 去除 pdf （图片）的水印。思路很简单，代码也很简洁。首先来考虑 Python 如何去除图片的水印，然后再将思路复用到 PDF 上面。这张图片是前

今天介绍下用 python 去除 pdf （图片）的水印。思路很简单，代码也很简洁。

首先来考虑 Python 如何去除图片的水印，然后再将思路复用到 PDF 上面。

这张图片是前几天整理《数据结构和算法》PDF里的一个截图，带着公众号的水印。

从上图可以明显看到，为了不影响阅读正文，水印颜色一般比较浅。因此，我们可以利用颜色差这个特征来去掉水印。即：用 Python 读取图片的颜色，并将浅颜色部分变白。

Python 标准库 PIL 可以获取图片的颜色，Python2 是系统自带的，python3 需要自己安装，我用的 Python 3.8，需要执行以下

命令安装


pip install pillow

安装完成，读取图片，并获取图片的尺寸（宽度和高度）


from PIL import Image

img = Image.open('watermark_pic.png')
width, height = img.size

进行下一步之前，先简单介绍下计算机里关于颜色的知识。光学三原色是红绿蓝（RGB），也就是说它们是不可分解的三种基本颜色，其他颜色都可以通过这三种颜色混合而成，三种颜色等比例混合就是白色，没有光就是黑色。

在计算机中，可以用三个字节表示 RGB 颜色，1个字节能表示的最大数值是 255，所以，(255, 0, 0)代表红色，(0, 255, 0)代表绿色，(0, 0, 255)代表蓝色。相应地，(255, 255, 255)代表白色，(0, 0, 0)代表黑色。从(0, 0, 0) ~ (255, 255, 255) 之间的任意组合都可以代表一个不同的颜色。

接下来我们可以通过下面代码读取图片的 RGB


for i in range(width):
    for j in range(height):
        pos = (i, j)
        print(img.getpixel(pos)[:3])

图片每个位置颜色由四元组表示，前三位分别是 RGB，第四位是 Alpha 通道，我们不需要关心。

有了 RGB ，我们就可以对其修改。

从图中可以发现，水印的 RGB 是 #d9d9d9，这里是用十六进制表示的，其实就是(217, 217, 217)。

这三个颜色值都越靠近 255，颜色就越淡，当它们都变成 255，也就成了白色。所以只要 RGB 都大于 217 的位置，我们都可以给它填成白色。即：RGB 三位数之和大于等于 651。


if sum(img.getpixel(pos)[:3]) >= 651:
    img.putpixel(pos, (255, 255, 255))

完整代码如下：


from PIL import Image

img = Image.open('watermark_pic.png')
width, height = img.size

for i in range(width):
    for j in range(height):
        pos = (i, j)
        if sum(img.getpixel(pos)[:3]) >= 651:
            img.putpixel(pos, (255, 255, 255))

img.save('watermark_removed_pic.png')

有了上面的基础，去除 PDF 的水印就简单了，思路是将每页 PDF 转成图片，然后修改水印的 RGB，最后输出图片即可。

安装 pymupdf 库，用来来操作 PDF


pip install pymupdf

读取 PDF，并转图片


import fitz

doc = fitz.open("数据结构和算法手册@公众号渡码.pdf")
for page in doc:
    pix = page.get_pixmap()

该 PDF 共 480 页，所以需要遍历每一页，并获取每一页对应的图片pix。pix对象类似于我们上面看到的img对象，可以读取、修改它的 RGB。

page.get_pixmap() 这个操作是不可逆的，即能够实现从 PDF 到图片的转换，但修改图片 RGB 后无法应用到 PDF 上，只能输出为图片。

修改水印 RGB 跟刚才一样，区别是这里的 RGB 是一个三元组，没有 Alpha 通道，代码如下：


from itertools import product

for pos in product(range(pix.width), range(pix.height)):
    if sum(pix.pixel(pos[0], pos[1])) >= 651:
        pix.set_pixel(pos[0], pos[1], (255, 255, 255))

完整代码如下：


from itertools import product
import fitz


doc = fitz.open("数据结构和算法手册@公众号渡码.pdf")

page_no = 0
for page in doc:
    pix = page.get_pixmap()

    for pos in product(range(pix.width), range(pix.height)):
        if sum(pix.pixel(pos[0], pos[1])) >= 651:
            pix.set_pixel(pos[0], pos[1], (255, 255, 255))

    pix.pil_save(f"pdf_pics/page_{page_no}.png", dpi=(30000, 30000))

    print(f'第 {page_no} 页去除完成')
    page_no += 1

这种方案是有缺点的，第一，输出并非 PDF 格式；第二，输出的图片比较模糊，后续还有待优化，最好是能直接修改 PDF。

到此这篇关于Python去除PDF水印的实现示例的文章就介绍到这了,更多相关Python去除PDF水印内容请搜索编程网以前的文章或继续浏览下面的相关文章希望大家以后多多支持编程网！

您可能感兴趣的文档:

--结束END--

本文标题: Python去除PDF水印的实现示例

本文链接: https://lsjlt.com/news/156080.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

Python去除PDF水印的实现示例

Python去除PDF水印的实现示例

Python实现为PDF去除水印的示例代码

SpringBoot实现PDF添加水印的示例

十行Python3代码实现去除pdf文件水印

pdf中如何去除水印文字

基于python实现去除视频的水印

【Python】Python 去除图片水印

Python去除图片水印实现方法详解

python怎么为图片和PDF去水印

python为图片和PDF去水印详解

运用python去除图片水印

Python实现为pdf添加水印功能

Java实现超简单抖音去水印的示例详解

python批量加的水印如何去除

1行Python代码实现去除图片水印详解

利用Python+OpenCV三步去除水印

利用python OpenCV去除视频水印

利用Golang和FFmpeg实现视频水印的去除

怎么用1行Python代码实现去除图片水印

Java实现PDF转Word的示例代码(无水印无页数限制)

python分析数据的方法是什么

如何使用Python实现抽奖小程序

python copy函数的作用是什么

python ffmpeg模块怎么安装和使用

python进程池创建队列的方法是什么

python无法运行文件的原因有哪些

python can't open file报错怎么解决

python keyerror错误怎么解决

python字符串处理与应用的方法有哪些

python全局变量如何定义