Deepseek V4 Flash Vision Video Rag
Description
DeepSeek V4-Flash Vision Video RAG 让 AI 真正"看懂" 一段视频,然后你对它提问:它告诉你答案、答案发生在 第几分几秒,并切出那一段的可播放片段和关键帧给你核对。 基于 DeepSeek 视觉大模型 deepseek-v4-flash-vision-exp 的视频理解与问答 (video RAG)agent skill。先按时间轴抽帧阅读、建立索引(一次性),再对问题做 本地粗筛 → 视觉精排 → 深读回答;回答带 [MM:SS] 时间戳引用,自动生成 自包含 HTML 预览页(内嵌可播放片段 + 关键帧 + 答案),双击浏览器即看。
Installation
This entry records only its repository, not the path inside it, so there is no
exact command to give. Open the source below and copy the folder into
~/.claude/skills/, or the file into ~/.claude/agents/.
README
DeepSeek V4-Flash Vision Video RAG
让 AI **真正"看懂"** 一段视频,然后你对它提问:它告诉你答案、答案发生在 **第几分几秒**,并切出那一段的**可播放片段**和关键帧给你核对。
基于 DeepSeek 视觉大模型 `deepseek-v4-flash-vision-exp` 的视频理解与问答 (video RAG)agent skill。先按时间轴抽帧阅读、建立索引(一次性),再对问题做 本地粗筛 → 视觉精排 → 深读回答;回答带 `[MM:SS]` 时间戳引用,自动生成 **自包含 HTML 预览页**(内嵌可播放片段 + 关键帧 + 答案),双击浏览器即看。
模型没有音频模态:一切理解基于画面,音轨会被忽略。
使用方法简单: 直接在 codex/workbuddy等下载,然后发送视频给 skill技能,命令完成理解视频 和回答各种问题则可以!
一、它能做什么
| 你说 | 它做 |
|---|---|
| "帮我看看这段录像" | 抽帧阅读全片,建立时间轴索引(一次性,30 秒视频约 30 秒) |
| "这段视频讲了什么?" | 按时间顺序总结剧情/事件 |
| "爆炸是几点几分发生的?"(00:15) | 定位事件时刻 + 切出该时刻前后 5 秒可播放片段 |
| "玩家瞄准有什么问题?" | 深读 + 自动升级微观层(12fps 中心放大)逐帧分析动作 |
| "画面里出现过哪些文字?" | 帧级 OCR 汇总(招牌/字幕/HUD) |
| "给我看 00:07 那一帧" | 高清渲染该时刻帧图 |
二、实测效果(两个自带 ground truth 的视频)
| 测试 | 结果 |
|---|---|
| 猫和老鼠 31.5s:"猫为什么被炸?" | 完整还原因果链:老鼠从 GLUE 罐刮胶水涂在炸药上→放到猫身边→猫点燃→爆炸。与人工确认的剧情一致 |
| 猫和老鼠:"最后一幕猫什么状态?" | "被'种'在花盆里、头埋土中、顶着花、房子墙根草地上"——与 ground truth 吻合 |
| CS2 27s:"有几次击杀?" | 3 次,与该仓库 coach_report.md 的人工结论一致;时刻 [00:03][00:13](1fps 估计 ±2s) |
| CS2:"瞄准细节有什么问题?" | 微观层自动触发,输出逐帧动作链:敌人 1.67s 露头→2.50s 开火→2.58s 击杀,并给出预瞄偏移、无目标扫射、移动开枪、弹匣管理 4 项问题 |
| 索引速度 | 32 帧/26 秒、27 帧/30 秒(含上传与 2 次批量分析) |
| 提问成本 | 常规 2 次调用;动作类问题 3 次(+微观) |
三、工作原理(通俗版)
和 PDF 版同一个思想:**先读一遍做笔记,之后按笔记翻书**——只是"页"变成了 "时间段","页码"变成了"时间戳"。
第一阶段:看一遍视频,做卡片(ingest,一次性)
视频 ──ffmpeg 抽帧──> 按时间顺序的 JPEG 序列 ──上传──> DeepSeek 文件服务器
│
↓
视觉模型逐帧"观看"(25 帧/批,prompt 声明采样率与时间轴)
↓
index.json:每帧一张卡片 + 段卡片 + 场景切换时间点
第 2 秒的真实卡片:
{"t": 2.0, "scene": "室内鼠洞",
"summary": "老鼠正伸手去够一个绿色胶水罐,罐子上写着GLUE,旁边有一根红色蜡烛。",
"keywords": ["老鼠", "胶水", "GLUE"], "ocr": "GLUE",
"event": "老鼠开始触碰胶水罐", "motion": "中"}
每帧 6 个字段:场景、画面摘要、关键词、可见文字(OCR)、相对前帧的事件、 **运动强度**。卡片按 30 秒一段聚合成"段卡片",加上本地 ffmpeg 场景切换检测, 构成整个索引。**从此这段视频就被"看过了",不用再看第二遍全片。**
第二阶段:按卡片定位,回答问题(ask,每次 2~3 次调用)
你的问题
↓ ① 查卡片 本地 TF-IDF 筛出最可能的段(毫秒级、零费用)
↓ ②
Related Skills
Agency Agents
A complete AI agency at your fingertips - From frontend wizards to Reddit community ninjas, from whimsy inject
AI Awesome Llm Apps
100+ AI Agents, Agent Skills and RAG Apps - Free and Open Source.
AI Firecrawl
🔥 The API to search, scrape, and interact with the web for AI
AI Artifacts Builder
Suite of tools for creating elaborate, multi-component claude.ai HTML artifacts using modern frontend web tech
AI Headroom
Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agen
AI CrewAI
Framework for orchestrating role-playing, autonomous AI agents. By fostering collaborative intelligence, CrewA
AI