### [雨云搭建 Paperless-ngx 文档扫描归档系统](https://www.jiyueip.com/article/12300) **Published:** 2026-07-28T10:20:15 **Author:** 斑斓助理 **Excerpt:** 用雨云 KVM 云服务器 Docker 自建 Paperless-ngx 文档扫描归档系统:消费目录自动入库、中文 OCR 配置、全文检索、标签规则与备份,含优惠码 admin01 五折。 抽屉里塞着一摞发票、合同、保修单、体检报告,想找某一张的时候永远翻不到。传统做法是买个文件盒按年份堆,但电子版检索才是正解——可把扫描件丢进网盘,几年后连文件名都忘了。Paperless-ngx 是开源的文档管理工具,专门解决「纸质/扫描件归档」:丢进去自动 OCR、全文检索、打标签、分类整理,让每一张单据都能被秒搜出来。本文用雨云 KVM 云服务器把它部署成私人文档中枢。 ## 为什么是 Paperless-ngx 笔记类工具(如 Wiki.js、BookStack)擅长整理「你写出来的知识」,但应付不了「别人给的纸质件」——发票、合同、回执、说明书,这些不是文章,是扫描件。Paperless-ngx 的定位就在这一格: - **消费目录自动入库**:把扫描件扔进一个文件夹,它自动识别、OCR、提取日期/金额、加标签,全程不用手动建条目; - **全文检索**:OCR 后的文字进索引,搜「2025 房租」直接定位到那张合同,不用翻图; - **标签 + 通讯录式字段**:按「类型/年份/项目」多维度归类,比文件夹灵活; - **去重与版本**:同一张单子多次扫描会提示已存在,避免库里长草。 它和知识库是互补关系:扫描件归档交给 Paperless-ngx,整理好的操作手册、规范再沉淀到 [BookStack 知识库](https://www.jiyueip.com/article/12274) 里,文档工作流才算完整。 ## 服务器与部署 Paperless-ngx 由 Django + 多个消费 worker 组成,OCR 和索引吃内存,建议 2 核 2G 起步(低于 2G 容易 OOM)。我用雨云 KVM 云服务器([官网入口](https://www.jiyueip.com/link/5617)),系统 Debian 12 + Docker,下单优惠码填 **admin01** 五折,7 天无理由退款。没用过雨云的先看 [选购与上手指南](https://www.jiyueip.com/article/12235)。 拉取官方 `docker-compose.yml`,重点改两个地方:把数据库、Redis、媒体目录都挂到宿主机持久卷;在 `paperless` 服务里加中文字体与语言包支持: ```yaml services: paperless: image: ghcr.io/paperless-ngx/paperless-ngx:latest container_name: paperless restart: unless-stopped ports: - "127.0.0.1:8000:8000" depends_on: - db - broker volumes: - ./data:/usr/src/paperless/data - ./media:/usr/src/paperless/media - ./consume:/usr/src/paperless/consume - ./fonts:/usr/src/paperless/fonts # 放中文字体 environment: - PAPERLESS_OCR_LANGUAGE=chi_sim+eng - PAPERLESS_TIME_ZONE=Asia/Shanghai ``` 中文 OCR 必须额外准备:在宿主机 `./fonts` 目录放思源黑体等中文字体(如 `NotoSansCJK-Regular.ttc`),并在容器里 `apt-get install -y tesseract-ocr-chi-sim` 装简体中文语言包,否则扫描出的中文 PDF 只是一张图,搜不到字。Nginx 反代 8000 端口配 HTTPS 后即可访问。 ## 日常使用姿势 - **批量归档**:手机扫描 App(如扫描全能王、Adobe Scan)导出 PDF,传到服务器的 `consume` 目录,Paperless-ngx 几分钟内自动完成 OCR 并入库;进阶可让扫描仪/App 直接 FTP/SMB 投递到该目录,做到「扫完即归档」; - **自动打标签**:在管理后台配「匹配规则」,比如标题含「发票」自动加「财务」标签、含「合同」加「法务」标签,归档后基本不用手动整理; - **检索与导出**:搜关键词跳转到原件,支持按原 PDF 或转换后的文本版下载,报销贴凭证时直接调出来打印; - **备份**:`data`+`media`+`consume` 三个卷打包推对象存储即可(参考 [对象存储备份实践](https://www.jiyueip.com/article/11963)),OCR 索引重建慢,备份原卷比重新索引省事。 ## 踩坑记录 - **中文识别成乱码/空白**:九成是没装 `chi_sim` 语言包或字体缺失。确认 `PAPERLESS_OCR_LANGUAGE` 含 `chi_sim`,且 `fonts` 目录真有中文字体并被加载(后台「系统状态」能看到已识别字体数)。 - **内存爆掉**:默认配置 OCR 大批量 PDF 时会占满内存被杀。把实例升到 2G 以上,或限制并行 worker 数(`PAPERLESS_TASK_WORKERS=1`)缓解。 - **扫描件是「图片 PDF」**:有些扫描仪输出纯图片、不带文本层,Paperless-ngx 的 OCR 步骤正是为这种而生——只要语言包在,照样能抽出文字;但若原图模糊、倾斜,识别率会下降,扫描时尽量摆正、提高 DPI 到 200 以上。 - **日期识别错**:单据没印日期或格式罕见时,系统可能猜错年份。入库后在条目里手动改一下创建日期,后续检索按正确时间排。 ## 合规提醒 Paperless-ngx 仅用于个人及企业内部合法的文档归档。发票、合同、身份凭证等含个人与企业敏感信息,请妥善保管、设置强密码、开启 HTTPS,切勿将含他人信息的文档对外分享或上传至公开环境。依据《网络安全法》《个人信息保护法》《数据安全法》,涉及个人信息的纸质件数字化后应最小范围留存、不被滥用。 ## 小结 纸质文档的终点不该是又一个塞满的抽屉。Paperless-ngx 用一个消费目录把「扫描→识别→检索→归档」串成自动流水线,让每张单据都能被搜出来、随时调出来。雨云 KVM 2 核 2G 起步稳妥,优惠码 admin01 五折,把家里的发票合同、公司的回执单据都收进自己的库里,下次报销、对账、找保修卡,搜一下就有。 **Tags:** 云服务器, 建站教程, 雨云, 雨云优惠码 **Categories:** 行业洞察 ---