使用 Python 为 PDF 添加水印

🕗 发布于 2024-12-30 23:23 python pdf 开发语言

概述

安装所需库
创建水印 PDF
将水印应用到你的 PDF

1. 安装所需库

首先，确保你的系统上安装了 Python。然后，使用 pip 安装必要的库：

pip install PyPDF2 reportlab

PyPDF2：一个用于读取和操作 PDF 文件的库。
reportlab：一个用于创建 PDF 文档的库，我们将使用它来创建水印。

2. 创建水印 PDF

我们将创建一个简单的水印 PDF，其中包含“CONFIDENTIAL”（机密）字样，以对角线形式覆盖在页面上。你可以根据需要自定义文本、字体、大小、颜色和位置。

from reportlab.pdfgen import canvas
from reportlab.lib.pagesizes import letter
from reportlab.lib import colors

def create_watermark(watermark_text, watermark_pdf_path):
    c = canvas.Canvas(watermark_pdf_path, pagesize=letter)
    width, height = letter

    # 设置透明度（可选）
    c.setFillColor(colors.grey, alpha=0.3)

    # 设置字体和大小
    c.setFont("Helvetica-Bold", 50)

    # 旋转画布以绘制对角线文本
    c.saveState()
    c.translate(width / 2, height / 2)
    c.rotate(45)
    c.drawCentredString(0, 0, watermark_text)
    c.restoreState()

    c.save()

if __name__ == "__main__":
    create_watermark("CONFIDENTIAL", "watermark.pdf")

解释：

canvas.Canvas：创建一个新的 PDF 画布。
setFillColor：设置文本颜色和透明度。
setFont：设置字体类型和大小。
saveState & restoreState：保存和恢复画布状态，以应用旋转等变换，而不影响后续的绘制。
translate & rotate：移动并旋转画布，以对角线形式定位文本。
drawCentredString：在指定位置居中绘制水印文本。

运行此脚本以生成 watermark.pdf。

3. 将水印应用到你的 PDF

现在，我们将创建的水印应用到目标 PDF 的每一页。

import PyPDF2

def add_watermark(input_pdf_path, output_pdf_path, watermark_pdf_path):
    # 打开原始 PDF
    with open(input_pdf_path, 'rb') as input_file:
        reader = PyPDF2.PdfReader(input_file)
        writer = PyPDF2.PdfWriter()

        # 打开水印 PDF
        with open(watermark_pdf_path, 'rb') as watermark_file:
            watermark = PyPDF2.PdfReader(watermark_file)
            watermark_page = watermark.pages[0]

            # 遍历所有页面并合并水印
            for page_number in range(len(reader.pages)):
                page = reader.pages[page_number]
                page.merge_page(watermark_page)
                writer.add_page(page)

        # 写出带水印的 PDF
        with open(output_pdf_path, 'wb') as output_file:
            writer.write(output_file)

if __name__ == "__main__":
    input_pdf = "input.pdf"          # 替换为你的输入 PDF 路径
    output_pdf = "watermarked.pdf"   # 期望的输出 PDF 路径
    watermark_pdf = "watermark.pdf"  # 我们之前创建的水印 PDF

    add_watermark(input_pdf, output_pdf, watermark_pdf)
    print(f"带水印的 PDF 已保存为 {output_pdf}")

解释：

打开原始 PDF：使用 PyPDF2.PdfReader 读取输入 PDF。
打开水印 PDF：读取我们之前创建的水印 PDF。
将水印与每一页合并：
- 遍历原始 PDF 的每一页。
- 使用 merge_page 将水印叠加到当前页。
- 将合并后的页面添加到 PdfWriter 对象。
写出输出 PDF：将带水印的页面保存到新的 PDF 文件中。

注意事项：

兼容性：确保水印 PDF 的页面大小与输入 PDF 相同，以避免缩放问题。
透明度：水印 PDF 中设置的透明度确保水印不会过度遮挡原始内容。
自定义：你可以通过修改 create_watermark 函数来调整水印的外观（例如更改文本、颜色、旋转角度）。

完整的工作流程示例

为了方便起见，以下是将上述两个步骤组合到一个脚本中的完整示例。此脚本首先创建水印，然后将其应用到目标 PDF。

from reportlab.pdfgen import canvas
from reportlab.lib.pagesizes import letter
from reportlab.lib import colors
import PyPDF2

def create_watermark(watermark_text, watermark_pdf_path):
    c = canvas.Canvas(watermark_pdf_path, pagesize=letter)
    width, height = letter

    # 设置透明度（可选）
    c.setFillColor(colors.grey, alpha=0.3)

    # 设置字体和大小
    c.setFont("Helvetica-Bold", 50)

    # 旋转画布以绘制对角线文本
    c.saveState()
    c.translate(width / 2, height / 2)
    c.rotate(45)
    c.drawCentredString(0, 0, watermark_text)
    c.restoreState()

    c.save()

def add_watermark(input_pdf_path, output_pdf_path, watermark_pdf_path):
    # 打开原始 PDF
    with open(input_pdf_path, 'rb') as input_file:
        reader = PyPDF2.PdfReader(input_file)
        writer = PyPDF2.PdfWriter()

        # 打开水印 PDF
        with open(watermark_pdf_path, 'rb') as watermark_file:
            watermark = PyPDF2.PdfReader(watermark_file)
            watermark_page = watermark.pages[0]

            # 遍历所有页面并合并水印
            for page_number in range(len(reader.pages)):
                page = reader.pages[page_number]
                page.merge_page(watermark_page)
                writer.add_page(page)

        # 写出带水印的 PDF
        with open(output_pdf_path, 'wb') as output_file:
            writer.write(output_file)

if __name__ == "__main__":
    # 参数
    watermark_text = "CONFIDENTIAL"
    watermark_pdf = "watermark.pdf"
    input_pdf = "input.pdf"          # 替换为你的输入 PDF 路径
    output_pdf = "watermarked.pdf"   # 期望的输出 PDF 路径

    # 创建水印
    create_watermark(watermark_text, watermark_pdf)
    print(f"水印 PDF '{watermark_pdf}' 已创建。")

    # 将水印添加到 PDF
    add_watermark(input_pdf, output_pdf, watermark_pdf)
    print(f"带水印的 PDF 已保存为 '{output_pdf}'。")

使用方法：

准备你的输入 PDF：确保在脚本所在的目录中有 input.pdf，或提供正确的路径。
运行脚本：使用 Python 执行脚本。

python add_watermark.py

运行后，你将获得一个名为 watermarked.pdf 的文件，每一页上都带有“CONFIDENTIAL”水印。

额外提示

每页不同的水印：如果你想在不同的页面上使用不同的水印，可以修改 add_watermark 函数以处理多个水印 PDF 或动态生成它们。
定位：通过调整 create_watermark 函数中的 translate 和 rotate 参数，可以改变水印的位置和角度。
多个水印：你可以通过在每个 PDF 页面上合并多个水印页面来叠加多个水印。
错误处理：对于生产环境的脚本，建议添加错误处理，以管理诸如文件缺失或 PDF 格式不兼容等问题。

替代库

虽然 PyPDF2 和 reportlab 功能强大且广泛使用，但你可能还会考虑以下替代库：

PyMuPDF (fitz)：一个快速且多功能的 PDF 操作库。
```
pip install PyMuPDF
```
pdfplumber：主要用于提取信息，但可以与其他库结合使用进行操作。
pdfrw：另一个用于读取和写入 PDF 的库，通常与 reportlab 一起使用。

根据你的项目需求和熟悉程度，选择最适合的库。

结论

通过遵循上述步骤，你可以高效地使用 Python 为 PDF 文档添加水印。这种方法具有高度的可定制性，并且可以根据需要集成到更大的自动化工作流程中。如果你遇到任何问题或有进一步的问题，请随时提问！

原文地址：https://blog.csdn.net/lycwhu/article/details/144717653

免责声明：本站文章内容转载自网络资源，如本站内容侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：Github 2024-12-26 Go开源项目日报 Top10
下一篇：《深入浅出HTTPS》读书笔记（22）：密钥协商算法

迅为瑞芯微RK3562开发板/核心板应用于人脸跟踪、身体跟踪、视频监控、自动语音识别(ASR)、图像分类驾驶员辅助系统(ADAS)、车牌识别、物体识别等
iTOP-3562开发板/核心板采用瑞芯微RK3562处理器，内部集成了四核A53+Mali G52架构，主频2GHZ，内置1TOPSNPU算力，RK809动态调频。支持几乎全格式的H.264解码，支
阅读更多2024-12-31
低精度只适用于未充分训练的LLM？腾讯提出LLM量化的scaling laws
尽管有一些研究声称原生的低比特LLM可以媲美fp16/bf16精度下的表现，但这些研究普遍都是在未充分语言模型上得到的结果从而推出的结论，研究人员认为在充分训练的情况下进行比较的话，低比特LLM也将很
阅读更多2024-12-31
医疗数仓配置Flume
Flume需要将Kafka中各topic的数据传输到HDFS，因此选用KafkaSource以及HDFSSink。对于安全性要求高的数据（不允许丢失）选用FileChannel，允许部分丢失的数据如日
阅读更多2024-12-31
Go中CAS算法
CAS算法常被用作乐观锁的实现方式，用于解决并发问题。例如，在计数器、缓存等场景中，可以使用CAS算法来确保数据的一致性和正确性。CAS操作会检查内存位置V的当前值是否与预期的旧值A相等。这一操作是原
阅读更多2024-12-31
Node.js 记账本项目总结
在使用Node.js结合Express框架构建记账本的过程中，遇到了一些常见的问题，这些问题主要集中在路径处理、包管理工具的选择、开发环境优化以及HTTP响应处理等方面。
阅读更多2024-12-31
Java 处理base64文件上传
在系统内有一个类似于公告的模块，如果里面添加的文章不是选择富文本上传图片的方式，而是选择复制别的文章直接粘贴到系统内的富文本，里面的图片就不会url，而是图片的base64格式，这样会导致数据库存储压
阅读更多2024-12-31
Tailwind CSS 实战：现代登录注册页面开发
基础结构搭建表单组件开发社交登录集成响应式适配深色模式支持动画效果表单验证性能优化可访问性增强通过合理使用 Tailwind CSS 的原子类，我们不仅实现了美观的界面，还确保了良好的用户体验和可维护
阅读更多2024-12-31
node.js下载、安装、设置国内镜像源（永久）（Windows11）
系统：Windows 11。
阅读更多2024-12-31
Slate文档编辑器-Decorator装饰器渲染调度
在这里我们主要讨论了slate中的decoration装饰器的实现，以及在实际使用中可能会遇到的问题，主要是在跨节点的情况下，我们需要将range拆分为多个range，然后分别进行处理，并且还分析了源
阅读更多2024-12-31
python去水印
请注意，这种方法仅适用于简单的水印去除，对于复杂的水印或嵌入到图像纹理中的水印，可能无法达到理想的效果。在实际应用中，还可以考虑使用深度学习的方法，如生成对抗网络（GAN）来去除水印，但需要大量的数据
阅读更多2024-12-31