Deepseek V4 Flash Vision Video Rag banner
liangdabiao liangdabiao

Deepseek V4 Flash Vision Video Rag

AI community

Description

DeepSeek V4-Flash Vision Video RAG 让 AI 真正"看懂" 一段视频,然后你对它提问:它告诉你答案、答案发生在 第几分几秒,并切出那一段的可播放片段和关键帧给你核对。 基于 DeepSeek 视觉大模型 deepseek-v4-flash-vision-exp 的视频理解与问答 (video RAG)agent skill。先按时间轴抽帧阅读、建立索引(一次性),再对问题做 本地粗筛 → 视觉精排 → 深读回答;回答带 [MM:SS] 时间戳引用,自动生成 自包含 HTML 预览页(内嵌可播放片段 + 关键帧 + 答案),双击浏览器即看。

Installation

This entry records only its repository, not the path inside it, so there is no exact command to give. Open the source below and copy the folder into ~/.claude/skills/, or the file into ~/.claude/agents/.

README

DeepSeek V4-Flash Vision Video RAG

让 AI **真正"看懂"** 一段视频,然后你对它提问:它告诉你答案、答案发生在 **第几分几秒**,并切出那一段的**可播放片段**和关键帧给你核对。

基于 DeepSeek 视觉大模型 `deepseek-v4-flash-vision-exp` 的视频理解与问答 (video RAG)agent skill。先按时间轴抽帧阅读、建立索引(一次性),再对问题做 本地粗筛 → 视觉精排 → 深读回答;回答带 `[MM:SS]` 时间戳引用,自动生成 **自包含 HTML 预览页**(内嵌可播放片段 + 关键帧 + 答案),双击浏览器即看。

模型没有音频模态:一切理解基于画面,音轨会被忽略。

使用方法简单: 直接在 codex/workbuddy等下载,然后发送视频给 skill技能,命令完成理解视频 和回答各种问题则可以!


一、它能做什么

你说 它做
"帮我看看这段录像" 抽帧阅读全片,建立时间轴索引(一次性,30 秒视频约 30 秒)
"这段视频讲了什么?" 按时间顺序总结剧情/事件
"爆炸是几点几分发生的?"(00:15) 定位事件时刻 + 切出该时刻前后 5 秒可播放片段
"玩家瞄准有什么问题?" 深读 + 自动升级微观层(12fps 中心放大)逐帧分析动作
"画面里出现过哪些文字?" 帧级 OCR 汇总(招牌/字幕/HUD)
"给我看 00:07 那一帧" 高清渲染该时刻帧图

二、实测效果(两个自带 ground truth 的视频)

测试 结果
猫和老鼠 31.5s:"猫为什么被炸?" 完整还原因果链:老鼠从 GLUE 罐刮胶水涂在炸药上→放到猫身边→猫点燃→爆炸。与人工确认的剧情一致
猫和老鼠:"最后一幕猫什么状态?" "被'种'在花盆里、头埋土中、顶着花、房子墙根草地上"——与 ground truth 吻合
CS2 27s:"有几次击杀?" 3 次,与该仓库 coach_report.md 的人工结论一致;时刻 [00:03][00:13](1fps 估计 ±2s)
CS2:"瞄准细节有什么问题?" 微观层自动触发,输出逐帧动作链:敌人 1.67s 露头→2.50s 开火→2.58s 击杀,并给出预瞄偏移、无目标扫射、移动开枪、弹匣管理 4 项问题
索引速度 32 帧/26 秒、27 帧/30 秒(含上传与 2 次批量分析)
提问成本 常规 2 次调用;动作类问题 3 次(+微观)

三、工作原理(通俗版)

和 PDF 版同一个思想:**先读一遍做笔记,之后按笔记翻书**——只是"页"变成了 "时间段","页码"变成了"时间戳"。

第一阶段:看一遍视频,做卡片(ingest,一次性)

视频 ──ffmpeg 抽帧──> 按时间顺序的 JPEG 序列 ──上传──> DeepSeek 文件服务器
                                │
                                ↓
              视觉模型逐帧"观看"(25 帧/批,prompt 声明采样率与时间轴)
                                ↓
              index.json:每帧一张卡片 + 段卡片 + 场景切换时间点

第 2 秒的真实卡片:

{"t": 2.0, "scene": "室内鼠洞",
 "summary": "老鼠正伸手去够一个绿色胶水罐,罐子上写着GLUE,旁边有一根红色蜡烛。",
 "keywords": ["老鼠", "胶水", "GLUE"], "ocr": "GLUE",
 "event": "老鼠开始触碰胶水罐", "motion": "中"}

每帧 6 个字段:场景、画面摘要、关键词、可见文字(OCR)、相对前帧的事件、 **运动强度**。卡片按 30 秒一段聚合成"段卡片",加上本地 ffmpeg 场景切换检测, 构成整个索引。**从此这段视频就被"看过了",不用再看第二遍全片。**

第二阶段:按卡片定位,回答问题(ask,每次 2~3 次调用)

你的问题
   ↓ ① 查卡片    本地 TF-IDF 筛出最可能的段(毫秒级、零费用)
   ↓ ②