PDF To Markdown — Documentation skill for Claude Code
PDF 转 Markdown / PDF to Markdown,专治复杂排版:多栏、图文混排、图表识别一次搞定.
How to install PDF To Markdown
This entry records only its repository, not the path inside it, so there is no
exact command to give. Open chacesclaw/pdf-to-markdown and copy the folder into
~/.claude/skills/, or the file into ~/.claude/agents/.
What PDF To Markdown does
PDF 转 Markdown / PDF to Markdown,专治复杂排版:多栏、图文混排、图表识别一次搞定。学生论文/竞赛作品/项目报告实测,Claude Code Skill。
Alternatives in Documentation
- PDF — Extract text, create PDFs, merge/split documents, and handle forms 94.1k ★
- 会话管理(Session Manager)需求文档(PRD / Markdown) — 目标:对 Codex / Claude Code 的本地会话记录进行可视化管理,并提供“一键复制 / 一键终端恢复”能力 31.7k ★
- Repo Recap — Generate a structured recap of the repository state: open PRs, open issues, recent releases, and executive sum 11.9k ★
README
📄 PDF to Markdown(PDF 转 Markdown)复杂排版识别工具
专治多栏、图文混排、复杂图表这类「一般工具转出来就乱」的 PDF,老老实实变成能读、能核对、不丢内容的 Markdown
[](./CHANGELOG.md) [](./LICENSE) [](#快速开始) [](#作为-claude-code--workbuddy-skill-使用)
一个专门解决 **PDF 转 Markdown(PDF to Markdown)** 里最难啃部分(复杂排版)的 [Claude Code](https://claude.com/claude-code) / WorkBuddy Skill,配一套 PyMuPDF 抽取脚本。 专治学生论文、竞赛作品、项目报告这类**版式比标准学术期刊杂乱得多**的 PDF:多栏、图文混排、 各种图表都能处理,不是只会转规规矩矩的单栏文档。
🚀 一键安装:复制这段话给你的 Agent
不用手动下载文件、不用自己建目录,把下面这一整段复制粘贴给 Claude Code(或其他支持装技能的 Agent),照着做就行:
请帮我安装这个 PDF 转 Markdown 的 Skill:把 `https://github.com/chacesclaw/pdf-to-markdown` 这个仓库用 `git clone` 到 `~/.claude/skills/pdf-to-markdown/`(如果这个目录已经存在,改用 `git -C ~/.claude/skills/pdf-to-markdown pull` 更新,不要用文件覆盖的方式,要保留 `.git` 目录)。装完之后跟我确认一下 `SKILL.md` 里 `version:` 字段显示的版本号。
**为什么要用 `git clone` 而不是直接复制文件内容**:这个 skill 还在持续更新(新发现的排版场景、修复的 bug 都会不断加进来),用 `git clone` 装的话,以后只要在用之前执行一句 `git -C ~/.claude/skills/pdf-to-markdown pull`,Agent 就能自动拿到仓库里的最新版本,不需要重新装一遍,也不会一直停留在装的那一刻的旧版本上。想知道现在是不是最新版,看 [SKILL.md](./SKILL.md) 里的 `version:` 字段或者 [CHANGELOG.md](./CHANGELOG.md) 最上面一条对不对得上。
🎯 目前覆盖 26 个真实踩过的复杂排版场景
不是理论上列出来的清单,是真的拿几十份学生提交的 PDF 一份一份啃出来的——每一条背后都有真实文档、真实 bug、真实修复记录。下面用大白话讲清楚每一条具体是什么问题(想看技术细节和对应代码章节,翻到后面的[详细对照表](#我们覆盖哪些复杂排版详细对照表))。
📝 第一类:文字部分能不能"读对"(9 条)
- 纯英文写的文档也能正确认出有几栏,不是只会处理中文
- 封面上"姓名""日期"这类单独居中的短行,不会被误粘进正文段落里
- 图片里嵌的小图标,不会在正文里留下看不见的乱码字符
- 标题用了花哨字体导致认成乱码时,会换一种方式重新识别,不会将错就错
- 认得出三种不同的换段习惯(首行缩进 / 空一行 / 一行没写满就提前换行),不只认第一种
- 一张图片正好插在一句话或一个标题中间时,前后内容不会被这张图拆成两截
- 找不到明确位置归属的一行字,不会被直接丢掉、凭空消失还不报错
- 页面边缘留白的过滤范围不会切得太紧,不会把正文最后一句话也一起切没
- 能认出被加密保护、正常打不开的 PDF,不会误判成文件本身坏了
🖼️ 第二类:图和表能不能"看懂"(12 条)
- 每张图都会写清楚"图里印的文字是什么""图本身画了什么内容""图旁边配的说明文字是什么",三部分分开写,不
Related Skills
Ars Format Convert
ARS academic-paper format-convert mode — convert to LaTeX / DOCX / PDF / Markdown
Token Goat
Token burn reducer and focus keeper for Claude Code, Codex, Copilot, Gemini CLI, and more: surgical read hints
Create Patent
Draft a complete patent application from invention disclosure through assembly of a draft filing package (mark
Pdf2md
Convert PDF to Markdown using marker tool with minimal modifications - preserves original content
Novel Outline
Convert a raw outline or source material (PDF, text, markdown) into a structured OUTLINE.md optimized for chap
Multipov
Review a document by dispatching multiple persona agents against it. The document can be a PDF, markdown, or t
Related Agents
Patent Creator
Drafts complete patent applications autonomously through 6-phase workflow (estimated 55-80 min). Produces mark
Python Document Processor
Production-grade Python document processor for PDF/DOCX/Markdown/TXT extraction with robust error handling, te
Resume Builder
Builds a resume from scratch by scanning user-specified folders/files for work history, gathering missing info