1. 为什么需要本地PDF处理中心?
在日常工作和学习中,PDF文件处理是个高频需求。无论是合并多个PDF文件、提取特定页面、添加水印,还是OCR文字识别,这些操作如果依赖在线工具,往往会遇到文件隐私泄露、网络不稳定、功能限制等问题。我自己就遇到过上传敏感合同到第三方网站后的焦虑感,也经历过在无网络环境下急需处理PDF的尴尬。
Stirling-PDF作为一款开源工具,完美解决了这些痛点。它提供了超过20种PDF处理功能,全部在本地运行,既保护了数据隐私,又能离线使用。而Docker的加入让部署过程变得极其简单——不需要配置复杂的Java/Python环境,不需要处理依赖冲突,一条命令就能搭建完整的服务。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 环境准备与镜像获取
2.1 基础环境检查
在开始之前,确保你的系统已经安装以下组件:
- Docker Engine 20.10.0及以上版本
- Docker Compose 2.0.0及以上版本
- 至少2GB可用内存(OCR功能需要更多资源)
检查版本的命令如下:
bash复制docker --version
docker compose version
如果尚未安装,可以参考官方文档进行安装。以Ubuntu系统为例:
bash复制# 安装Docker引擎
sudo apt-get update
sudo apt-get install docker-ce docker-ce-cli containerd.io
# 安装Docker Compose插件
sudo apt-get install docker-compose-plugin
2.2 镜像获取的两种方案
官方镜像有时会出现无法拉取的情况,这里提供两个可靠方案:
方案一:使用阿里云镜像(推荐)
bash复制docker pull crpi-k5k93ldwfc7o75ip.cn-hangzhou.personal.cr.aliyuncs.com/tirling-pdf/s-pdf:0.26.1-fat
方案二:自行构建镜像
如果对安全性要求极高,可以从GitHub获取源码构建:
bash复制git clone https://github.com/Stirling-Tools/Stirl
