PaddleOCR 实战:把 PDF 和图片变成 LLM 能直接读的 Markdown

发布时间:2026/8/29 14:00:23

PaddleOCR 实战:把 PDF 和图片变成 LLM 能直接读的 Markdown
PaddleOCR 实战把 PDF 和图片变成 LLM 能直接读的 Markdown【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR把扫描件合同直接塞进 LLM拿回来的往往是一段乱序文本表格列对不齐、公式变成乱码、页眉跑到正文中间。根子在于普通 OCR 吐出的只是一堆带坐标的文字行不是文档结构。PaddleOCR 的文档解析能力正是补这一环它把 PDF 和图片转成带层级、带表格的 Markdown 或 JSON让 RAG 和 Agent 应用少写一堆脏活。对开发者来说PaddleOCR 现在的定位很清晰本地一条命令跑通 OCRPP-StructureV3流水线做结构化解析PP-OCRv6系列模型负责场景文字识别支持 100 语言核心依赖装完即可用。30 秒跑通第一张图环境只需要 Python 3.8–3.12 和 pip不用 clone 仓库python -m pip install paddleocr[all] paddleocr ocr -i ./general_ocr_002.png \ --use_doc_orientation_classify False \ --use_doc_unwarping False \ --use_textline_orientation False三个False是关掉文档方向矫正和曲面拉直等预处理对摆正拍平的图能省掉一半耗时。跑完你该看到终端逐行打印识别文本和置信度同时生成带检测框的可视化和 JSON 结果。要写进自己代码里Python 侧同样三步from paddleocr import PaddleOCR ocr PaddleOCR() # 不指定模型时默认 PP-OCRv6 medium 档 for res in ocr.predict(./invoice.png): res.save_to_json(output) # 文本、置信度、坐标一次性落盘两个能力点值得单独看PP-OCRv6 为什么不用切语言模型了老版本做多语言 OCR 的麻烦在于每种文字体系要换模型中文一个、拉丁语系一个、西里尔文又一个。PaddleOCR(langfr)这类参数本质是背后换了一套 rec 模型。PP-OCRv6 把这件事做掉了单个识别模型覆盖中文、英文、日文和 46 种拉丁文字语言不再需要维护语言到模型的映射。模型分 tiny1.5M 参数、small、medium34.5M三档按设备选型# 端侧/嵌入式场景换小模型其余用法完全不变 ocr PaddleOCR( text_detection_model_namePP-OCRv6_small_det, text_recognition_model_namePP-OCRv6_small_rec, )官方给出的数据是medium 档比 PP-OCRv5_server 检测精度高 4.6%、识别高 5.1%CPU 端配合 OpenVINO 有 5.2 倍加速。扫描件到 MarkdownPP-StructureV3纯文本行解决不了 RAG 的真实需求——模型需要知道哪些是标题、哪些是表格、哪些是公式。PP-StructureV3是一条完整流水线版面检测先把页面切成标题、正文、表格、公式等区块表格走结构识别输出 HTML最后按阅读顺序拼成 Markdownpaddleocr pp_structurev3 -i ./manual_page.png \ --use_doc_orientation_classify False \ --use_doc_unwarping False相比只输出文字的方案它的 JSON 结果里带更细的坐标表格单元格级、文本区块级做高亮回显或字段抽取时可以直接定位到格子而不只是行。两个文档里不太起眼的用法 第一个是doc2md_convertWord、Excel、PPT 不用先转图片直接进转换函数图片会被抽到images/目录并在 Markdown 里引用from paddleocr import doc2md_convert # 办公文档直转 Markdown省去截图→OCR的中间环节 result doc2md_convert(report.docx, outputoutput.md) print(result.markdown)第二个是多页 PDF 的 Markdown 拼接。逐页 predict 得到的是 N 段 Markdownconcatenate_markdown_pages负责按阅读顺序合并跨页内容的衔接比你自己.join更可靠from paddleocr import PPStructureV3 pipeline PPStructureV3() results pipeline.predict(manual.pdf) markdown pipeline.concatenate_markdown_pages( [r[markdown] for r in results] # 保持页序再合并 )还有一个小开关PaddleOCR(return_word_boxTrue)会返回单字级坐标做印章定位、关键字高亮这类需求时不用再对行内文字二次切割。部署时先砍掉不需要的环节解析类任务的耗时大头往往不在识别而在预处理。⚠️ 默认打开的文档方向分类和曲面拉直对扫描件有用但对摆正拍平的图纯属白跑显式关掉如 30 秒上手一节所示立竿见影。引擎层面二选一即可起步enginepaddle走 PaddlePaddle 推理enginetransformers走 Hugging Face 生态同一套 pipeline 参数不用改。追求更高吞吐时官方支持 OpenVINO、TensorRT、ONNX Runtime 后端以及多 GPU 多进程并行推理详见 高性能推理文档 和 并行推理说明。部署路径按场景递进本地脚本用 Python SDK服务端用 PaddleX 的 serving 方案给 C、Java 等语言发 HTTP 请求集群场景再叠 Kubernetes 编排。一条链路的完整形态是输入扫描件 PDF →PP-StructureV3输出带表格的 Markdown → 切块进向量库 → LLM 按语义问答中间不再需要人工整理文档。更多细节可以看 快速上手、安装与功能选型 和 常见问题。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

牛客2023二模编程题复盘:高频题型与解题思路全解析

牛客2023二模编程题复盘:高频题型与解题思路全解析

2026/8/29 14:00:23

前阵子把牛客2023年二模这套编程题完整刷了一遍,又从出题人的角度做了几轮复盘。这套卷子放在今天看,依然很适合用来校准自己的算法基本功:题目不偏、不炫技,覆盖的全是面试笔试里最高频的几类题型,但每一道都藏了至少…

Vue3进度条(Progress)

Vue3进度条(Progress)

2026/8/29 13:50:22

Vue2进度条(Progress) 可自定义设置以下属性: 进度条宽度(width),单位 px,类型:string | number,默认 undefined;type: line 时,为进度条宽度&am…

Vue3分割线(Divider)

Vue3分割线(Divider)

2026/8/29 13:50:22

可自定义设置以下属性: 分割线标题的位置(orientation),类型:left | center | right,默认 center 标题和最近 left/right 边框之间的距离,去除了分割线,同时 orientation 必须为 le…

InDesign简繁转换插件

InDesign简繁转换插件

2026/8/29 16:30:29

简繁转换用法演示插件支持版本: windows 64位:InDesign 2018—InDesign 2026 macos:InDesign 2019—InDesign 2026 下载地址 通过网盘分享的文件:SimTrad 链接: https://pan.baidu.com/s/1FhSMqXi582bxqGQWMAjr_Q 提取码: rq8v

网易机器学习实习生笔试复盘:核心考点与备战思路

网易机器学习实习生笔试复盘:核心考点与备战思路

2026/8/29 16:30:29

笔试季又到了,每年六七月份,各个大厂的实习生招聘笔试都会准时拉开序幕。当年网易2018实习生招聘的机器学习算法岗位笔试题,在牛客网上被翻来覆去讨论了很久,很多准备校招的同学都把它当成一份重要的复习素材。这篇文章就当一份备…

基于LIS2DW12的超低功耗始终开启运动检测方案详解

基于LIS2DW12的超低功耗始终开启运动检测方案详解

2026/8/29 16:30:29

做低功耗项目的兄弟应该都遇到过这个纠结:设备要长时间待机,但不能完全睡死,得随时感知姿态变化或者震动,这就需要一个“始终在线”的传感器。我之前在改一款用纽扣电池供电的便携设备时,就卡在这个环节上。一开始用普…

【C++类型转换】static_cast、dynamic_cast、const_cast、reinterpret_cast

【C++类型转换】static_cast、dynamic_cast、const_cast、reinterpret_cast

2026/8/29 16:30:29

文章目录一、C 类型转换的背景二、C 类型转换详解▶ static_cast 静态类型转换基本用法实例▶ dynamic_cast 动态类型转换基本用法实例▶ const_cast 去除或添加 const/volatile基本用法实例添加 const/volatile(不常用)▶ reinterpret_cast 低级重解释转…

OpenAI 自研 3nm 芯片引发能效竞赛:AI 规模化的新瓶颈

OpenAI 自研 3nm 芯片引发能效竞赛:AI 规模化的新瓶颈

2026/8/29 16:30:29

OpenAI 首颗 3nm 自研芯片,开发周期只用了 9 个月,并在能效上直接对标 NVIDIA 的下一代平台——这则消息真正让人意外的地方,不是 OpenAI 开始做芯片,而是竞争维度变了:从“谁的模型更强”,变成了“谁的电费…

LIS2DW12低功耗加速度计实战:选型、功耗优化与中断唤醒详解

LIS2DW12低功耗加速度计实战:选型、功耗优化与中断唤醒详解

2026/8/29 16:20:29

这颗芯片我是在做一个纽扣电池供电的便携式运动记录设备时开始认真摸的,当时项目的硬指标是整机待机电流必须压到 5μA 以下,而传感器作为唯一一颗永远不休眠的器件,直接决定了系统的功耗天花板。市面上号称“超低功耗”的加速度计不少&#…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/27 11:10:02

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/29 10:22:10

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/28 7:34:42

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

四款热门降AI工具测评:研究生和本科生怎么选?

四款热门降AI工具测评:研究生和本科生怎么选?

2026/8/29 0:09:39

马上要交论文了,最近真的被论文ai率折磨的够呛。 明明查重都没问题了,但是ai率就是居高不下,崩溃了,明明都是我自己写的,天杀的,明明都是我亲生的啊 改来改去,终于给我搞出一套完美的降ai方案…

论文降AI率免费攻略:自查、提示词与工具推荐

论文降AI率免费攻略:自查、提示词与工具推荐

2026/8/29 0:09:39

马上要交论文了,最近真的被论文ai率折磨的够呛。 明明查重都没问题了,但是ai率就是居高不下,崩溃了,明明都是我自己写的,天杀的,明明都是我亲生的啊 改来改去,终于给我搞出一套完美的降ai方案…

北京GEO优化服务商推荐:预算型企业如何选北京GEO优化服务商?

北京GEO优化服务商推荐:预算型企业如何选北京GEO优化服务商?

2026/8/29 0:09:39

前言:预算有限的企业更关心投入能否形成可持续的品牌资产。评估北京GEO优化服务商时,不能只比较单篇内容或单月报价,还要看是否能够把问题词、官网、信源和监测串成完整链路。本期重点放在预算配置、试点范围和交付边界,帮助企业先…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/28 7:35:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/28 7:34:51

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/28 7:34:35

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…