如何用 PaddleOCR 文档转 Markdown(doc2md)把 Word、Excel、PowerPoint 转成 Markdown

发布时间:2026/9/9 14:04:14

如何用 PaddleOCR 文档转 Markdown(doc2md)把 Word、Excel、PowerPoint 转成 Markdown
如何用 PaddleOCR 文档转 Markdowndoc2md把 Word、Excel、PowerPoint 转成 Markdown【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR如果你有原始的 Office 文件.docx、.xlsx、.pptx需要把它们变成结构化的 Markdown 文本——用于知识库构建、文档检索或内容提取——PaddleOCR 内置的 doc2md文档转 Markdown功能可以直接完成这件事。它不需要 OCR 推理而是直接解析 Office 文档的 XML 结构输出规范的 Markdown零 GPU 依赖。使用前需要已完成 PaddleOCR 基础安装paddleocr本体与doc2md依赖组支持 Python 3.8 及以上。本文只覆盖三种 Office 格式的转换操作没有原始文档、只有图片或扫描件时应使用 PaddleOCR 的 OCR 功能而非 doc2md。1. 准备安装 doc2md 依赖组先确保已按安装教程完成 PaddleOCR 基础安装然后安装 doc2md 可选依赖pip install paddleocr[doc2md]该依赖组包含四个解析库各自对应一种能力包名版本约束用途python-docx0.8.11Word (.docx) 文档解析python-pptx0.6.21PowerPoint (.pptx) 文档解析openpyxl3.0.0Excel (.xlsx) 文档解析pylatexenc2.10,3数学公式 Unicode → LaTeX 符号映射doc2md 采用延迟导入缺少某个格式的解析库时转换对应格式会抛出RuntimeError: python-docx is required之类的错误。此时按提示单独安装对应包即可例如pip install python-docx或一次性装齐pip install paddleocr[doc2md]。2. 执行转换命令行主路径以下命令中的report.docx、data.xlsx、slides.pptx是文档示例中的文件名替换为你自己的文件路径# 转换 Word 文档输出到文件 paddleocr doc2md -i report.docx -o output.md # 转换 Excel 表格输出到文件 paddleocr doc2md -i data.xlsx -o output.md # 转换 PowerPoint 演示文稿输出到文件 paddleocr doc2md -i slides.pptx -o output.md两条使用规则-i/--input是必填参数支持.docx、.xlsx、.pptx三种格式。不指定-o/--output时转换结果直接打印到终端stdout不落盘paddleocr doc2md -i report.docx不确定某个文件是否受支持时可以先用--formats查看当前支持的文件扩展名列表该参数会列出格式后直接退出无需提供-ipaddleocr doc2md --formats3. 验证转换结果指定-o后成功的判定方式很直接输出目录中生成指定的 Markdown 文件如output.md文档中的图片自动保存到输出文件同目录的images/文件夹Markdown 中的图片引用路径会相应更新为相对路径默认会打印耗时、保存路径等提示信息加上-q/--quiet可静默这些信息适合放在脚本里。转换后打开 Markdown 文件可按以下预期核对各格式的输出特征摘自doc2md 文档Word内置 Heading 1–6 样式映射为#–######一、识别为 H2、一识别为 H3表格输出为 HTMLtable并保留rowspan/colspan合并结构OMML 公式转为 LaTeX行内$...$、显示$$...$$等宽字体段落自动识别为 fenced code block。Excel每个 sheet 输出为一个以## sheet名称开头的章节自动裁剪尾部空行空列浮动图片OneCellAnchor/TwoCellAnchor两种锚定会被提取。PowerPoint每张幻灯片内容以---分隔图表14 种类型转为 HTML table 输出演讲者备注附加在每张幻灯片内容末尾。4. 按格式调整输出内容命令行提供了一批格式专属参数默认值均为「提取全部」按需收紧即可。这些参数只作用于对应格式对其他格式无效参数适用格式作用--no-drawings.docx、.xlsx跳过文本框docx和 drawing 层数学公式xlsx的提取--no-headers-footers.docx不提取页眉和页脚内容--sheet-name.xlsx仅转换指定名称的 sheet不设置则转换全部 sheet--max-rows.xlsx限制每个 sheet 的最大转换行数用于控制大表格的输出长度典型用法示例# 只转换 Excel 中名为 Sheet1 的 sheet paddleocr doc2md -i data.xlsx -o output.md --sheet-name Sheet1 # Excel 输出太长每个 sheet 最多转换 100 行 paddleocr doc2md -i data.xlsx -o output.md --max-rows 100 # Word 文档不需要页眉页脚 paddleocr doc2md -i report.docx -o output.md --no-headers-footers5. 可选路径Python API 调用除命令行外也可以在脚本中通过convert函数调用。返回的ConvertResult包含四个字段markdown转换后的 Markdown 文本str、images图片字典key 为相对路径如images/image1.pngvalue 为图片字节、title文档标题可能为None、metadata元信息如格式类型、sheet 数量from paddleocr._doc2md import convert # 转换文档返回结果对象 result convert(report.docx) # 访问 Markdown 文本 print(result.markdown) # 查看提取的图片字典key 为相对路径value 为图片字节 print(list(result.images.keys())) # 查看文档标题 print(result.title) # 查看元信息格式、sheet 数等 print(result.metadata)指定output参数后Markdown 写入文件、图片自动保存到同目录images/下行为与命令行-o一致result convert(report.docx, outputoutput/report.md)格式专属的 kwargs 参数与命令行参数一一对应extract_drawingsdocx/xlsx默认True、extract_headers_footersdocx默认True、sheet_namexlsx默认None表示转换全部 sheet、max_rowsxlsx默认None# Word不提取文本框和页眉页脚 result convert(report.docx, extract_drawingsFalse, extract_headers_footersFalse) # Excel仅转换名为 Sheet1 的 sheet最多 100 行 result convert(data.xlsx, sheet_nameSheet1, max_rows100)6. 常见问题与边界转换时报ValueError格式不支持运行paddleocr doc2md --formats查看当前支持的扩展名。doc2md 仅支持.docx、.xlsx、.pptx不支持.doc旧版 Word、.csv、.pdf等格式。转换时报RuntimeError: xxx is required说明缺少对应格式的解析库按提示安装对应包python-docx/python-pptx/openpyxl/pylatexenc或直接pip install paddleocr[doc2md]装齐全部依赖。Excel 转换后输出太长用--max-rows限制每个 sheet 的行数见第 4 节示例。最后注意适用边界doc2md 面向「有原始 Office 文件」的场景不做任何 OCR 模型推理如果你的输入是图片或扫描件doc2md 无法处理需要使用 PaddleOCR 的 OCR 产线。更多参数细节可参考文档转 Markdown 使用教程。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Office密码问题全解析:文档密码、账号密码与激活校验的区别与解决

Office密码问题全解析:文档密码、账号密码与激活校验的区别与解决

2026/9/9 14:04:14

简介:OFFICE文档密码遗忘是办公中常见困境,这份资源即针对这一痛点提供轻量级密码恢复工具,适用于Word、Excel、PowerPoint等常用Office组件,面向日常办公人员、行政文员及临时需要紧急取回文档的普通用户。压缩包仅2.77MB&#x…

Starship Bracketed Segments 预设实战:用方括号统一模块排版并看懂 format 字符串语法

Starship Bracketed Segments 预设实战:用方括号统一模块排版并看懂 format 字符串语法

2026/9/9 14:04:14

Starship Bracketed Segments 预设实战:用方括号统一模块排版并看懂 format 字符串语法 【免费下载链接】starship ☄🌌️ The minimal, blazing-fast, and infinitely customizable prompt for any shell! 项目地址: https://gitcode.com/GitHub_Tren…

Scrapy分布式爬虫实战:Redis队列与动态iframe处理全解析

Scrapy分布式爬虫实战:Redis队列与动态iframe处理全解析

2026/9/9 14:04:14

做爬虫的朋友应该都有这种感觉:单机 Scrapy 跑得再快,量一上来就卡在 CPU、带宽、反爬封 IP 这些事儿上。于是大家很自然地想到加机器,但加机器不是简单把爬虫复制一遍,关键是怎么让多台机器协同工作。今天这篇就聊聊我用 Scrapy …

具身智能与Agent Memory:长程任务规划中的记忆机制解析

具身智能与Agent Memory:长程任务规划中的记忆机制解析

2026/9/9 14:34:15

具身智能系列已经写到了第 4 篇,前几篇我们聊过具身智能的基本概念,也聊过机械臂/机器人怎么感知环境、怎么规划动作。但有一个问题很多人会忽略:机器人在真实世界里执行任务,不是“看一眼做一步”这么简单。真实的家庭环境里&…

Overleaf 快捷键完全指南:内置映射、自定义配置与效率技巧

Overleaf 快捷键完全指南:内置映射、自定义配置与效率技巧

2026/9/9 14:34:15

Overleaf 快捷键完全指南:内置映射、自定义配置与效率技巧 【免费下载链接】overleaf A web-based collaborative LaTeX editor 项目地址: https://gitcode.com/GitHub_Trending/ov/overleaf 写一篇论文,每次编译要点三四次菜单,加个批…

长程任务总失败?具身智能的 Agent Memory 才是关键

长程任务总失败?具身智能的 Agent Memory 才是关键

2026/9/9 14:34:15

这次我们聊的不是又跑通一个新模型,而是具身智能里最容易被讲玄、也最影响落地的一件事:长程任务为什么总在执行到一半时失败,以及 Agent Memory 到底在中间起了什么作用。你如果已经看过前面几篇具身智能入门科普,应该对“感知 -…

旧Mac升级最新macOS:OpenCore Legacy Patcher 3阶段实操指南

旧Mac升级最新macOS:OpenCore Legacy Patcher 3阶段实操指南

2026/9/9 14:34:15

旧Mac升级最新macOS:OpenCore Legacy Patcher 3阶段实操指南 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 打开"系统设置"想升级时&a…

Nginx安装全指南:源码编译、包管理器、Docker与离线部署一次讲透

Nginx安装全指南:源码编译、包管理器、Docker与离线部署一次讲透

2026/9/9 14:34:15

做过几年服务器运维和Java后端的人,对Nginx应该都不陌生。前一阵同事在给测试环境搭新服务,照着网上教程吭哧吭哧装Nginx,结果configure那一步就报缺PCRE库,装完PCRE又发现没带SSL模块,反反复整了半天,最后…

机盖重拓扑P2阶段:硬表面建模布线细节与工程实践指南

机盖重拓扑P2阶段:硬表面建模布线细节与工程实践指南

2026/9/9 14:24:15

很多做硬表面建模的同学,应该都有过这种体验:高模雕刻阶段很爽,细节怎么加都行,一到重拓扑就头疼,尤其是机盖这种“看似平整、实则到处都是曲面转折”的部件。前面 P1 阶段可能已经解决了大型和整体布线框架&#xff0…

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

2026/9/9 1:14:29

本文首发于“生态学者”!从“湿地面积”到“土壤碳密度”:为什么需要重新认识潮汐湿地蓝碳变化?潮汐湿地位于陆地与海洋的交汇地带,包括红树林、盐沼和潮滩,是全球重要的蓝碳生态系统。其土壤能够长期储存大量有机碳&a…

adb抓包

adb抓包

2026/9/8 4:55:53

前言 本文介绍如何通过 tcpdump 在 Android 手机上抓取网络数据包,并在电脑端使用 Wireshark 进行分析。适用于需要排查 App 网络请求、分析接口调用或调试网络问题的开发与测试场景。1. 手机要有 root 权限2. 下载 tcpdump3. adb push C:\Users\zhangkuixun\Downlo…

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

2026/9/8 22:37:26

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战 在云原生基础设施中,容器镜像体积直接决定了服务的部署速度与弹性扩容敏捷度。对于传统的 Go / Java 微服务,镜像体积通常被严格控制在 50MB 到 200MB 以内,拉取镜像只…

扩散模型图像恢复实战:从DDPM原理到PyQt5可视化系统

扩散模型图像恢复实战:从DDPM原理到PyQt5可视化系统

2026/9/9 0:03:36

简介:面向毕业设计场景的PyQt5扩散模型图像恢复项目,提供完整Python源码与项目说明,适合图像处理、深度学习方向的高年级本科生与研究生参考。项目在模块设计上覆盖图像处理、扩散模型、参数配置、用户界面与结果评估五部分,具体涉…

开关电源环路裕量测试实战:相位裕量与增益裕量详解

开关电源环路裕量测试实战:相位裕量与增益裕量详解

2026/9/9 0:03:36

1. 项目概述:为什么环路裕量测试是电子工程师绕不开的“体检项目”“从零开始的电子工程师生活(6)——环路裕量测试”,这个标题一出来,老电源工程师可能已经下意识摸了摸示波器探头,新同事则大概率在想&…

定时插座芯片怎么选?专用定时IC与单片机MCU选型对比

定时插座芯片怎么选?专用定时IC与单片机MCU选型对比

2026/9/9 0:03:36

拆开市面上不同价位的定时插座,你会发现一个有意思的现象:有的里面躺着一颗黑色的软封装芯片,丝印都看不清;有的则是一块小小的蓝色或绿色PCB,上面赫然印着STM8或者STC的字样。同样叫"定时插座",…

远程协作的工作台整理

远程协作的工作台整理

2026/9/8 4:23:39

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/8 3:19:39

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/8 4:00:23

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…