Deepseek V4 Flash Vision RAG — AI skill for Claude Code
DeepSeek V4-Flash Vision RAG 让 AI 真正"看懂" 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, 并把那一页的原图展示出来给你核对.
How to install Deepseek V4 Flash Vision RAG
This entry records only its repository, not the path inside it, so there is no
exact command to give. Open liangdabiao/deepseek-v4-flash-vision-rag and copy the folder into
~/.claude/skills/, or the file into ~/.claude/agents/.
What Deepseek V4 Flash Vision RAG does
DeepSeek V4-Flash Vision RAG 让 AI 真正"看懂" 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, 并把那一页的原图展示出来给你核对。 基于 DeepSeek 视觉大模型 deepseek-v4-flash-vision-exp 的 PDF 深度问答与检索 (vision RAG)agent skill。支持文字版 PDF,也支持扫描版;能看懂 图表、表格、代码块、公式,而不只是认字。
Alternatives in AI
- System Prompts Leaks — Extracted system prompts from ChatGPT (GPT-5.4, GPT-5.3, Codex), Claude (Opus 4.6, Sonnet 4.6, Claude Code), G 38.6k ★
- Claude Cookbook — Official notebooks and recipes for common patterns (RAG, tool use, Skills, MCP) 35.3k ★
- Repomix — 📦 Repomix is a powerful tool that packs your entire repository into a single, AI-friendly file 22.7k ★
README
DeepSeek V4-Flash Vision RAG
让 AI **真正"看懂"** 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, 并把那一页的原图展示出来给你核对。
基于 DeepSeek 视觉大模型 `deepseek-v4-flash-vision-exp` 的 PDF 深度问答与检索 (vision RAG)agent skill。支持文字版 PDF,也支持**扫描版**;能看懂 **图表、表格、代码块、公式**,而不只是认字。
一、它能做什么
| 你说 | 它做 |
|---|---|
| "帮我读一下这份 120 页的手册" | 逐页视觉阅读,建立可检索的索引(约 2 分钟,只需一次) |
| "审批策略出厂默认是什么?" | 给出答案,标注 [第6页],并把第 6 页原图给你看 |
| "§05 在第几页?讲了什么?" | 定位章节起止页码 + 内容总结 |
| "这个概念在哪几页被提到?" | 找齐全书所有相关页(跨页召回) |
| "给我看看第 72 页" | 高清渲染该页图片 |
| "对比一下 XX 和 YY" | 基于相关页内容做深度对比分析 |
每次回答都会生成一个**自包含 HTML 预览页**(答案 + 全部引用页原图内嵌其中), 双击浏览器打开即可查看,无需联网。
二、实测效果(120 页中文书,test.pdf)
| 环节 | 结果 |
|---|---|
| 建索引(一次性) | 135 秒:上传 120 页图 18s + 仅 5 次模型调用完成全书阅读 |
| 提问响应 | 每次仅 2 次 API 调用,秒级~十几秒出答案 |
| 定位准确性 | 章节定位与人工核对的大纲完全吻合(§05→p33 起,§06→p42 起) |
| 跨页召回 | "审批策略"找齐分散在 p5/6/14/15/16 的全部 5 处提及 |
| 重复提问 | 索引缓存命中,零重建成本 |
三、工作原理(通俗版)
整个系统就做两件事,像人读一本书:
第一阶段:读一遍书,做笔记(ingest,一次性)
PDF ──渲染──> 每页一张图片 ──上传──> DeepSeek 文件服务器
│ │
└──抽取文字层──┐ ↓
│ 视觉模型逐页"阅读"
│ (25 页打包进 1 个请求,
│ 吃满 100 万 token 上下文)
↓ ↓
index.json(每页一张"读书卡片")
模型每读一页,就写一张卡片——**这就是 `index.json`**。第 22 页的真实卡片长这样:
{"page": 22,
"type": "正文",
"headings": [{"level": 1, "text": "§03 四种模式,人话版"}],
"summary": "介绍四种模式:标准、PTC、极简、创造,并指出它们不在同一维度上,标准模式是默认。",
"keywords": ["四种模式", "标准", "PTC", "极简", "创造"]}
120 张卡片 + 每页文字层 + 由标题派生的全书大纲,一起存进缓存。 **从此这本书就被"读过了",这个步骤永远不用再做。**
第二阶段:按笔记翻书,回答问题(ask,每次提问)
你的问题
↓ ① 查卡片 本地在 index.json 里筛出最可能的 12 页(毫秒级,零费用)
↓ ② 看图确认 模型看这 12 页截图,挑出真正相关的 4 页(第 1 次 API 调用)
↓ ③ 深读作答 这 4 页 ± 前后邻页原图摊开,开推理模式仔细读(第 2 次 API 调用)
↓
答案(每个论点标 [第N页])+ 引用页图片 + 自包含 HTML 预览
**为什么是三层漏斗?**——便宜的方法粗定位、贵的眼睛做确认、最贵的推理只用在 刀刃上。120 页 → 12 页(免费)→ 4 页(关推理,快)→ 深读(开推理,质量)。
① "查卡片"具体怎么查(本地检索,零 API 成本)
用经典的 TF-I
Related Skills
Deepseek V4 Flash Vision Video RAG
DeepSeek V4-Flash Vision Video RAG 让 AI 真正"看懂" 一段视频,然后你对它提问:它告诉你答案、答案发生在 第几分几秒,并切出那一段的可播放片段和关键帧给你核对。 基于 DeepSe
Ecom Video Seedance Prompt
这是一个基于deepseek-v4-flash-vision 视觉deepseek大模型的复刻带货爆款视频Skill, 会生成复刻效果的seedance提示词! 你刷到一条带货爆款视频,想让 AI 照着再来一条——本 s
Pdf2md Skill
A Claude Code / Cursor skill that converts any PDF into clean, structured Markdown using LLM vision.
PDF Read
Baca PDF/Word document — extract text, struktur (headings/tables), summarize, atau chunk untuk RAG. Default lo
Multimodal Vision Skill
One image-recognition engine for any AI agent — 3 protocols (OpenAI Chat/Responses, Anthropic Messages), multi
AI Guide
程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude)、最新 AI 资讯、Prompt 提
Related Agents
Ds Flash
DSH (DeepSeek Harness) worker on the flash tier - fast and cheap. Delegate simple, well-scoped subtasks: mecha
PDF Reader
Гольмстен — читатель скан-PDF (route=scan) по OCR-тексту Apple Vision из сайдкаров ocr_dir/page_NNN.txt, сегме
ChatGPT On Wechat
CowAgent是基于大模型的超级AI助理,能主动思考和任务规划、访问操作系统和外部资源、创造和执行Skills、拥有长期记忆并不断成长,比OpenClaw更轻量和便捷。同时支持微信、飞书、钉钉、企微、QQ、公众号、网页