
MarkItDown 实战3 分钟把 PDF、Word、PPT 批量转成 LLM 能读的 Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown手头 20 份 PDF 报告要喂给大模型逐页复制粘贴谁受得了。MarkItDown 是个免费 Python 工具把 PDF、Word、Excel、PPT、HTML 乃至图片音频一键转成 Markdown输出尽量保留标题、列表、表格和链接。一句话文件进Markdown 出直接丢给 LLM 做分析。哪些文件能转、转出来长什么样说白了它就是“输入→输出”的映射内部怎么解析你不用管。输入转出来的 Markdown对你意味着什么PDF、扫描件带标题、表格的结构化文本发票合同里的表格不再糊成一团Word、PPT保留层级标题与要点列表幻灯片结论可直接引用Excel、CSV、JSON、XMLMarkdown 表格数据能直接喂给模型做统计图片、音频EXIF 元数据可选 OCR / 转写照片里的字、录音里的话也读得出HTML、EPUB、Notebook正文 Markdown网页正文去掉导航和广告噪音ZIP 压缩包遍历内部文件逐个转一个压缩包整包处理上面这张 PDF 页面就是典型输入标题层级和正文段落都会保留想看真实产物参考仓库里的转换输出样例。它的定位是“喂给文本分析”要逐像素还原版式就别指望它。pip 一行装全格式一条命令出结果 ✅环境要 Python 3.10 及以上。直接带[all]装几乎全格式开箱即用想从源码装clone 仓库后执行pip install -e packages/markitdown[all]即可其他格式按需单独装markitdown[pdf]这类包。pip install markitdown[all]装完一条命令转换-o落盘跑通后report.md里应看到保留标题和表格的 Markdown。写进代码时最小调用就是下面这几行。markitdown report.pdf -o report.mdfrom markitdown import MarkItDown md MarkItDown() result md.convert(report.xlsx) print(result.text_content)convert接受本地文件、远程地址或字节流结果从result.text_content读只处理本地文件就换更窄的convert_local()少很多多余的文件与网络访问。各格式解析逻辑都在转换模块排查格式异常可从这入手。LLM 配图、OCR 插件、云服务怎么开进阶能力默认都关着只挑多数人会用的三个。LLM 配图给MarkItDown(llm_client..., llm_modelgpt-4o)传一个大模型客户端转 PPT 或图片时会自动为每张图生成文字描述写进结果。适合图片承载核心信息的场景纯文字文档用不上。OCR 插件装上markitdown-ocr后复用同一套llm_client把 PDF、Word、PPT、Excel 里图片内的文字识别出来。适合扫描件和“图里藏字”的文档不识别图片内文字就别开。云服务传cu_endpoint或docintel_endpoint走 Azure 云端抽取质量更高还能拿结构化字段。适合高保真需求但每次调用都计费本地够用就别开。上面这张就是 LLM 配图的样例输入模型会把它描述成文字写进最终 Markdown。转不出结果先查这三处 ⚠️如果你遇到某格式报错或压根识别不出大概率是缺该格式的可选依赖处理方式是按需补一行比如只装markitdown[pdf]。如果你从管道读入却识别不出类型原因是缺扩展名或字符集线索加-x pdf、-c utf-8给个提示即可。如果结果结构失真大概率是源排版太复杂先抽一份核对复杂版式再走云服务。说白了它适合把大批非结构化文档变成干净 Markdown 供 LLM 或检索管道消费不适合要求高保真版式还原的场景处理不可信文件时先校验输入、优先调convert_local()这类窄接口。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考