liangdabiao

Deepseek V4 Flash Vision RAG — AI skill for Claude Code

AI community

DeepSeek V4-Flash Vision RAG 让 AI 真正"看懂" 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, 并把那一页的原图展示出来给你核对.

How to install Deepseek V4 Flash Vision RAG

This entry records only its repository, not the path inside it, so there is no exact command to give. Open liangdabiao/deepseek-v4-flash-vision-rag and copy the folder into ~/.claude/skills/, or the file into ~/.claude/agents/.

What Deepseek V4 Flash Vision RAG does

DeepSeek V4-Flash Vision RAG 让 AI 真正"看懂" 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, 并把那一页的原图展示出来给你核对。 基于 DeepSeek 视觉大模型 deepseek-v4-flash-vision-exp 的 PDF 深度问答与检索 (vision RAG)agent skill。支持文字版 PDF,也支持扫描版;能看懂 图表、表格、代码块、公式,而不只是认字。

Alternatives in AI

  • System Prompts Leaks — Extracted system prompts from ChatGPT (GPT-5.4, GPT-5.3, Codex), Claude (Opus 4.6, Sonnet 4.6, Claude Code), G 38.6k ★
  • Claude Cookbook — Official notebooks and recipes for common patterns (RAG, tool use, Skills, MCP) 35.3k ★
  • Repomix — 📦 Repomix is a powerful tool that packs your entire repository into a single, AI-friendly file 22.7k ★

README

DeepSeek V4-Flash Vision RAG

让 AI **真正"看懂"** 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, 并把那一页的原图展示出来给你核对。

基于 DeepSeek 视觉大模型 `deepseek-v4-flash-vision-exp` 的 PDF 深度问答与检索 (vision RAG)agent skill。支持文字版 PDF,也支持**扫描版**;能看懂 **图表、表格、代码块、公式**,而不只是认字。


一、它能做什么

你说 它做
"帮我读一下这份 120 页的手册" 逐页视觉阅读,建立可检索的索引(约 2 分钟,只需一次)
"审批策略出厂默认是什么?" 给出答案,标注 [第6页],并把第 6 页原图给你看
"§05 在第几页?讲了什么?" 定位章节起止页码 + 内容总结
"这个概念在哪几页被提到?" 找齐全书所有相关页(跨页召回)
"给我看看第 72 页" 高清渲染该页图片
"对比一下 XX 和 YY" 基于相关页内容做深度对比分析

每次回答都会生成一个**自包含 HTML 预览页**(答案 + 全部引用页原图内嵌其中), 双击浏览器打开即可查看,无需联网。

二、实测效果(120 页中文书,test.pdf)

环节 结果
建索引(一次性) 135 秒:上传 120 页图 18s + 仅 5 次模型调用完成全书阅读
提问响应 每次仅 2 次 API 调用,秒级~十几秒出答案
定位准确性 章节定位与人工核对的大纲完全吻合(§05→p33 起,§06→p42 起)
跨页召回 "审批策略"找齐分散在 p5/6/14/15/16 的全部 5 处提及
重复提问 索引缓存命中,零重建成本

三、工作原理(通俗版)

整个系统就做两件事,像人读一本书:

第一阶段:读一遍书,做笔记(ingest,一次性)

PDF ──渲染──> 每页一张图片 ──上传──> DeepSeek 文件服务器
                │                        │
                └──抽取文字层──┐         ↓
                               │   视觉模型逐页"阅读"
                               │   (25 页打包进 1 个请求,
                               │    吃满 100 万 token 上下文)
                               ↓         ↓
                          index.json(每页一张"读书卡片")

模型每读一页,就写一张卡片——**这就是 `index.json`**。第 22 页的真实卡片长这样:

{"page": 22,
 "type": "正文",
 "headings": [{"level": 1, "text": "§03 四种模式,人话版"}],
 "summary": "介绍四种模式:标准、PTC、极简、创造,并指出它们不在同一维度上,标准模式是默认。",
 "keywords": ["四种模式", "标准", "PTC", "极简", "创造"]}

120 张卡片 + 每页文字层 + 由标题派生的全书大纲,一起存进缓存。 **从此这本书就被"读过了",这个步骤永远不用再做。**

第二阶段:按笔记翻书,回答问题(ask,每次提问)

你的问题
   ↓ ① 查卡片     本地在 index.json 里筛出最可能的 12 页(毫秒级,零费用)
   ↓ ② 看图确认   模型看这 12 页截图,挑出真正相关的 4 页(第 1 次 API 调用)
   ↓ ③ 深读作答   这 4 页 ± 前后邻页原图摊开,开推理模式仔细读(第 2 次 API 调用)
   ↓
答案(每个论点标 [第N页])+ 引用页图片 + 自包含 HTML 预览

**为什么是三层漏斗?**——便宜的方法粗定位、贵的眼睛做确认、最贵的推理只用在 刀刃上。120 页 → 12 页(免费)→ 4 页(关推理,快)→ 深读(开推理,质量)。

① "查卡片"具体怎么查(本地检索,零 API 成本)

用经典的 TF-I