AI资讯大全AIPPXP.CN搜索 ↗
工具介绍 · 附下载文件

MarkItDown:微软开源的万能转换器,PDF/Word/PPT 一键变 Markdown

喂给 AI 的文档格式不对,模型读起来就会丢内容。微软开源的 MarkItDown 专治这件事:把 PDF、Word、Excel、PPT、图片、音频、HTML 统统转成干净的 Markdown,结构、标题、表格都保留下来,直接就能塞给大模型。

2026-09-24 更新 · 免费
MarkItDown:微软开源的万能转换器,PDF/Word/PPT 一键变 Markdown

为什么转换这一步不能省

直接让模型读 PDF,常见两种翻车:一是扫描版根本没有文字层,模型只能看到空白;二是版面复杂时,表格被打散成一串乱码字符。

MarkItDown 的思路是先做结构化解析,输出带标题层级、列表和表格的 Markdown,模型的阅读效果明显好于原始二进制流。

它同时保留了文档元信息,例如标题、作者等,做知识库入库时这些字段直接可用。

为什么转换这一步不能省

支持的输入格式

办公文档:Word(docx)、Excel(xlsx)、PowerPoint(pptx)、PDF。

网页与数据:HTML、CSV、JSON、XML、ZIP 压缩包(可递归处理内部文件)。

多媒体与其它:图片(可接 OCR)、音频(可接语音转写)、Jupyter 笔记本、EPUB 电子书,以及 YouTube 视频链接(需要额外组件)。

支持的输入格式

三步上手

到本站「AI工具」栏目下载 tar.gz 源码包,解压后进入目录执行安装命令:pip install .

转单个文件:在命令行里指定输入文件与输出文件,例如把季度报告.pdf 转成 report.md。

批量转整个文件夹:写个几行的循环脚本遍历目录,一次性把一柜子文档转成 Markdown,再统一切片入库到你的知识库。

三步上手

实战搭配建议

配合本地知识库工具使用:先用它把资料转成 Markdown,再交给检索工具建索引,命中率和答案质量都更稳。

转换前先抽查两三份复杂文档,确认表格没有错位,再批量处理,避免白跑一遍。

扫描件记得先接 OCR 组件,否则转出来只有空白内容。

实战搭配建议

使用提醒

本文整理自公开资料并附上配套资源;涉及产品的功能与价格以官方页面为准。资源仅供学习交流,请遵循来源许可。

资源下载

⬇ 点击下载:MarkItDown v0.1.8(Python 源码包 tar.gz)(67KB)

微软官方开源(MIT)。解压后执行 pip install . 安装;PDF 等格式的额外解析支持可用 pip install markitdown[all] 一并装齐。