资讯中心

MarkItDown 快速上手教程:一条命令把 10 多种办公文件转成 Markdown

📅 2026/8/28 11:33:17
MarkItDown 快速上手教程:一条命令把 10 多种办公文件转成 Markdown
MarkItDown 快速上手教程一条命令把 10 多种办公文件转成 Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdownMarkItDown 是一个把各种文件转换成 Markdown 的 Python 开源工具一条命令就能把 PDF、Word、PPT、Excel、图片、音频甚至网页变成 Markdown 文本方便直接喂给大语言模型LLM或文本分析管道。 什么时候需要它要读一堆文档的时候假设你正遇到这类情况在做 LLM 应用需要把一目录的 PDF 合同读进模型写文本分析管道得先把混杂的 Word、Excel、HTML 统一成一种格式拿到一个 ZIP 资料包想把里面的文档批量转出来归档这些场景要的其实是同一件事一个能读懂原始格式、又输出干净 Markdown、还能保住标题、列表和表格的工具。MarkItDown 就是干这个的内置的转换器覆盖办公文档、PDF、图片、音频、网页、压缩包等常见输入。 三步跑通你的第一次转换第一步准备 Python 3.10 和虚拟环境MarkItDown 要求 Python 3.10 及以上版本。先建虚拟环境再安装避免依赖冲突python -m venv .venv source .venv/bin/activate执行后终端提示符前会多出(.venv)前缀Linux/macOS说明环境已激活。第二步一条命令装好 MarkItDown用 pip 安装[all]会把各格式的可选依赖一次装齐pip install markitdown[all]输出最后一行出现Successfully installed markitdown-...并列出依赖包说明装好了。需要改源码时才从源码安装先克隆仓库再指定主包目录安装。git clone https://gitcode.com/GitHub_Trending/ma/markitdown cd markitdown pip install -e packages/markitdown[all]第三步跑第一次转换并验证先用版本号命令确认工具就位markitdown --version屏幕上出现markitdown 0.x.x这样的版本号说明安装成功。接着拿手头任意一个 PDF 做第一次转换markitdown path-to-file.pdf document.md打开 document.md你应该看到正文变成了 Markdown标题是#、列表是-、表格保留行列。也可以改用-o document.md参数直接写文件或者用cat path-to-file.pdf | markitdown从管道读入。 四个高频使用场景场景一办公文档——Word、PPT、Excel 一把梭这些格式依赖可选依赖extras按需补装后同样一条命令转换Word.docxpip install markitdown[docx]PPT.pptxpip install markitdown[pptx]Excel.xlsx/.xlspip install markitdown[xlsx,xls]装好之后运行markitdown report.docx report.md输出的 Markdown 会保留原文的标题、表格与列表可以直接 diff 对比或投喂给 LLM。场景二PDF 文本提取本地文本 PDF 直接转不需要额外配置markitdown contract.pdf contract.md输出里出现按顺序排列的段落、标题和表格内容就说明转换成功。注意这是针对有文字层的 PDF扫描件图片型 PDF请看进阶章节的 Azure 方案。场景三图片和音频——元数据、转录、LLM 描述图片和音频的处理更智能一些图片默认输出 EXIF 元数据拍摄设备等成 Markdown想让模型看懂图需传入 LLM 客户端见进阶章节音频支持 wav、mp3 等装[audio-transcription]可选依赖后可以把语音转成文字项目仓库里这张测试图就是给 LLM 图片描述用的典型输入对它跑一次带 LLM 的转换得到的输出是模型生成的文字描述而不是图片二进制。场景四网页内容与压缩包MarkItDown 还能处理 URL 类输入和打包文件HTML 文件或网页 → MarkdownYouTube 视频 URL → 字幕文本ZIP 压缩包 → 逐个转换包内文件后整体输出EPUB 电子书 → 正文文本markitdown blog.html blog.md输出出现文章标题加 Markdown 正文即可确认转换生效。⚙️ 进阶玩法把 MarkItDown 接进你的工作流进阶一Python API 接进自己的程序写管道时不必依赖命令行Python 接口几行就够from markitdown import MarkItDown md MarkItDown(enable_pluginsFalse) # 设为 True 可启用插件 result md.convert(test.xlsx) print(result.text_content)终端打印出 Excel 内容的 Markdown 版本说明集成成功。提示.text_content是兼容旧代码的别名新代码建议直接用result.markdown。进阶二用 LLM 生成图片描述配好 OpenAI API 密钥先pip install openai后转换图片时让模型顺带生成描述from markitdown import MarkItDown from openai import OpenAI client OpenAI() md MarkItDown(llm_clientclient, llm_modelgpt-4o, llm_prompt可选的自定义提示) result md.convert(example.jpg) print(result.text_content)输出变成对图片内容的文字描述而不只是元数据列表。进阶三插件、Azure、Docker 与 MCP四条深水区路线按需选用插件系统先跑markitdown --list-plugins查看已装插件没装会显示No 3rd-party plugins installed.转换时加-p即--use-plugins才生效。比如仓库自带示例插件packages/markitdown-sample-plugin在其目录执行pip install -e .后即可markitdown --use-plugins path-to-file.rtf转换 RTFAzure 文档智能markitdown scan.pdf -o scan.md -d -e endpoint适合扫描件等离线转换搞不定的文件Docker 部署docker build -t markitdown:latest .构建后docker run --rm -i markitdown:latest your-file.pdf output.md镜像已内置 ffmpeg 和 exiftoolMCP 服务器pip install markitdown-mcp后运行markitdown-mcp默认 STDIO 模式对外暴露convert_to_markdown(uri)一个工具AI 客户端可直接调用⚠️ 新手最容易踩的 5 个坑转换时报缺少依赖—— docx/pptx/xlsx/pdf 等格式靠可选依赖工作裸装pip install markitdown只包含文本、HTML、CSV 等基础支持。补装对应 extras如pip install markitdown[docx]或直接重装[all]。管道输入识别不出格式—— 从 stdin 读文件时没有文件名可猜用-x给扩展名提示如markitdown -x pdfMIME 类型、字符集分别用-m、-c提示。图片 EXIF 元数据为空、音频转不出文字—— 图片元数据依赖系统的exiftool音频依赖ffmpeg官方 Docker 镜像两个都预装好了本机使用需自行安装。插件装了却不生效—— 插件默认是禁用的。先用markitdown --list-plugins确认它被识别再在转换命令上加-p或--use-plugins。不支持的格式抛UnsupportedFormatException—— 两条路自己写插件可参考packages/markitdown-sample-plugin的写法或改走 Azure 文档智能通道。谁适合用它如果你的日常就是把文件变成 LLM 或管道能读的文本MarkItDown 值得先试命令行一条命令搞定Python 三行代码集成。更多参数与细节见项目根目录及packages/markitdown下的README.md或在社区搜相关讨论。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考