想把一份 PDF 报告或者 Word 文档的内容发给大模型分析,结果直接复制粘贴过来全是乱码、错位,甚至连表格都糊成一团。
为了解决这个"文档转文本"的最后一步,我开发了 Document to Markdown。它不是一个臃肿的文档编辑器,而是一个专注"结构化提取"的转换工具。
主要功能特点
-
多格式全覆盖:支持 PDF, DOCX, PPTX, XLSX, HTML, CSV, TXT, JSON, XML 以及 EPUB。
-
结构化保留:转换过程中会尽量保留原文档的标题层级、列表和表格,生成的 Markdown 非常干净,无需二次手动排版。
-
适配 AI 工作流:生成的 .md 文件非常适合直接喂给 LLM(大模型)、放入 RAG 知识库,或者导入 Obsidian、Notion 等笔记软件。
-
隐私保护:采用 Request-only 处理模式,转换完成后不保存文件内容,不记录转换历史。
-
注册说明:无需注册即可直接使用(游客模式)。如果需要更高的每日额度,可以选择注册登录。
-
付费情况:本项目包含免费额度与付费订阅。
-
免费(游客):每日支持 3 次转换,单文件限制 20MB。
-
免费(登录):每日支持 10 次转换,单文件限制 20MB。
-
Pro 订阅:$9.9/月,支持每日 200 次转换,并计划支持更大文件和 API 接入。
-
请求建议
目前工具还在持续迭代中,非常希望听听大家的意见:
-
在转换复杂的多栏 PDF 时,排版是否符合预期?
-
对于 XLSX 转 Markdown 表格,有没有更精细的过滤需求?
-
大家更希望看到浏览器插件版还是本地客户端版?
