MarkItDown:微软开源的万能转换器,PDF/Word/PPT 一键变 Markdown
喂给 AI 的文档格式不对,模型读起来就会丢内容。微软开源的 MarkItDown 专治这件事:把 PDF、Word、Excel、PPT、图片、音频、HTML 统统转成干净的 Markdown,结构、标题、表格都保留下来,直接就能塞给大模型。

为什么转换这一步不能省
直接让模型读 PDF,常见两种翻车:一是扫描版根本没有文字层,模型只能看到空白;二是版面复杂时,表格被打散成一串乱码字符。
MarkItDown 的思路是先做结构化解析,输出带标题层级、列表和表格的 Markdown,模型的阅读效果明显好于原始二进制流。
它同时保留了文档元信息,例如标题、作者等,做知识库入库时这些字段直接可用。

支持的输入格式
办公文档:Word(docx)、Excel(xlsx)、PowerPoint(pptx)、PDF。
网页与数据:HTML、CSV、JSON、XML、ZIP 压缩包(可递归处理内部文件)。
多媒体与其它:图片(可接 OCR)、音频(可接语音转写)、Jupyter 笔记本、EPUB 电子书,以及 YouTube 视频链接(需要额外组件)。

三步上手
到本站「AI工具」栏目下载 tar.gz 源码包,解压后进入目录执行安装命令:pip install .
转单个文件:在命令行里指定输入文件与输出文件,例如把季度报告.pdf 转成 report.md。
批量转整个文件夹:写个几行的循环脚本遍历目录,一次性把一柜子文档转成 Markdown,再统一切片入库到你的知识库。

实战搭配建议
配合本地知识库工具使用:先用它把资料转成 Markdown,再交给检索工具建索引,命中率和答案质量都更稳。
转换前先抽查两三份复杂文档,确认表格没有错位,再批量处理,避免白跑一遍。
扫描件记得先接 OCR 组件,否则转出来只有空白内容。

使用提醒
本文整理自公开资料并附上配套资源;涉及产品的功能与价格以官方页面为准。资源仅供学习交流,请遵循来源许可。
⬇ 点击下载:MarkItDown v0.1.8(Python 源码包 tar.gz)(67KB)
微软官方开源(MIT)。解压后执行 pip install . 安装;PDF 等格式的额外解析支持可用 pip install markitdown[all] 一并装齐。