DDDFXYqiming

Dsh Vision Skill — Development skill for Claude Code

Development community

Vision skill plugin for DeepSeek Harness (image analysis and OCR).

How to install Dsh Vision Skill

This entry records only its repository, not the path inside it, so there is no exact command to give. Open DDDFXYqiming/dsh-vision-skill and copy the folder into ~/.claude/skills/, or the file into ~/.claude/agents/.

What Dsh Vision Skill does

Vision skill plugin for DeepSeek Harness (image analysis and OCR).

Alternatives in Development

  • Product Vision — Brainstorm inspiring, achievable product vision statements 7.8k ★
  • IPolloWork — Enterprise-grade, local-first Agent Workbench for people and agent teams 4.9k ★
  • Petdex — A public gallery of animated pets for Codex, Claude Code, DeepSeek Harness, Hermes, OpenCode, Gemini CLI, and 4k ★

README

简体中文 | [English](README.en.md)

dsh-plugins / dsh-vision-skill

**DeepSeek Harness(DSH)标准插件版识图技能**。它把本仓库 `General_skills/vision-skill`(源自 Qwen 官方动态分辨率方法)包装成 DSH 原生插件,让不支持图片的纯文本模型也能看图、OCR、定位目标。

零框架补丁。插件只使用官方扩展接缝(`ctx.skills.register` / `ctx.tools.register` / `ctx.credentials` / `ctx.sessions` / `ctx.webServer` / client 注入)。v0.4 起直接贴图走 paste-to-path,不再需要 pi-ai 补丁。旧补丁仅作兼容保留,附还原脚本。

能力(8 工具 + 1 运行时 skill)

名称 说明
vision(runtime skill) 模型按需加载的识图指令。加载后自动激活下列工具(渐进式暴露)
vision_analyze 识别本地图片,共 6 种模式(general / ocr / table / code / error / evidence 结构化证据),budgetmega 档 16M 像素
vision_ocr 独立 OCR,保留原始排版
vision_ground 目标定位(比如找「微信图标」),返回像素坐标和归一化坐标
vision_detect 枚举一类元素,给出编号和像素坐标框
vision_dominant_colors 主色分析(本地像素算法,不耗视觉 API)
vision_long_screenshot_ocr 超长截图分块 OCR。先跑本地 tesseract,不行再交给 VLM 兜底,最后合并
vision_clipboard 剪贴板图片兜底识别(paste-to-path 失败或特殊场景的手动通道)
vision_activate 渐进式暴露的兜底。skill 加载后工具没自动出现时调用一次

工程化要点

  • 渐进式工具暴露。全局只挂 1 个轻量激活工具,完整工具集等 skill 加载后再按 Agent 挂载,省上下文。progressive: false 可回退为全局注册。
  • paste-to-path 直贴(v0.4.2 起输入框显示 📎 chip)。client 在 capture 阶段截获粘贴的图片,发送时同源 POST 落盘到 .dsh-vision/pasted/。消息里没有 image 块,DSH 因此不再报 MODEL_DOES_NOT_SUPPORT_IMAGES。旧版宿主没有 reference 能力时,自动回退为插入路径文本。
  • 多 provider failover 和 429 退避visionProviders 数组按顺序 failover,每个 provider 配 apiUrl/model/apiKey/credential。遇到 429 就按 Retry-After 退避重试一次。
  • 结构化证据vision_analyzemode=evidence 返回一段 JSON,包含 summary / ocr_full_text / layout(阅读顺序)/ semantics(entities+relations)/ uncertainty / visual
  • 本地 OCR 快路径。长截图每一块先跑 tesseract,跑不了才调 VLM,省 token 也更快。
  • 图像记忆缓存。按图片 SHA-256 加 mode/budget/crop/prompt 做缓存,TTL 内命中直接返回 cached:true
  • 路径围栏。图片路径必须位于会话工作区 / DSH 附件目录 / allowedDirs 之一,经 realpath 校验,防止路径穿越。
  • 密钥 Credential 化。config 支持 credential: VISION_API_KEY(DSH Credential 引用,每操作解析,推荐),也兼容 apiKey 明文(不推荐)。

识图核心方法

Qwen 官方动态分辨率预处理打头,`smart_resize` 负责像素预算和 patch 网格吸附,随后交给任意