Pseudo Vision Skill — Development skill for Claude Code
Local OCR, color-statistics, pixel-scan, and metadata bridge as a cross-framework skill for text-only agent models; no external vision API.
How to install Pseudo Vision Skill
This entry records only its repository, not the path inside it, so there is no
exact command to give. Open DDDFXYqiming/pseudo-vision-skill and copy the folder into
~/.claude/skills/, or the file into ~/.claude/agents/.
What Pseudo Vision Skill does
Local OCR, color-statistics, pixel-scan, and metadata bridge as a cross-framework skill for text-only agent models; no external vision API. Algorithm-identical to dsh-pseudo-vision / pi-pseudo-vision.
Alternatives in Development
- Screenshot — Capture desktop, app windows, or pixel regions across OS platforms 14.6k ★
- Product Vision — Brainstorm inspiring, achievable product vision statements 7.8k ★
- JWT Scan — JWT attack toolkit (offline) — alg:none forgery, RS256→HS256 algorithm confusion, weak-secret crack, static cl 4.5k ★
README
简体中文 | [English](README.en.md)
pseudo-vision-skill
一个跨框架的"工具层视觉" skill。图片在本机被拆成四路证据,OCR 文字、颜色统计、像素扫描和元信息,纯文本模型的智能体拿到这包证据就能读图。同一套算法层可以装进 Claude Code / pi / Hermes / WorkBuddy 等任何支持 skill 的框架,**无需逐个开发插件**。计算全程发生在本机,**无外部视觉 API**。
**算法与 [dsh-pseudo-vision](https://github.com/DDDFXYqiming/dsh-pseudo-vision) / [pi-pseudo-vision](https://github.com/DDDFXYqiming/pi-pseudo-vision) 插件完全同源**。算法只有一份权威源(pi 仓库),改完用 `sync-from-pi.mjs` 一键同步过来。
**实机验证通过**。pi 加 kimi-for-coding 这样的纯文本模型,配上本 skill,完整读图成功。OCR 全对(含中文),深色主题判断正确,布局定位到了行级。
为什么是 skill 而不是插件
- dsh 的准入校验极严,粘贴图片时直接拒绝发给 text-only 模型,要接住这条路只能靠插件级路由接管,所以 dsh-pseudo-vision 保留插件形态
- 其他框架(pi / Claude Code / Hermes 等)不拦截。text-only 模型能感觉到面前有一张图,只是自己读不出来,这种情况一个 skill 就够了
- 一份实现,装遍所有框架。算法改动只发生在算法源仓库,跑一次
sync就分发到位
提供的能力(CLI 模式 ↔ 插件工具对照)
| CLI 模式 | 等价插件工具 | 作用 | 实现 |
|---|---|---|---|
full(默认) |
pseudo_vision_convert |
四件套聚合为单一 证据块(缓存 + 32K 封顶 + 分块 + OCR 失败写回) |
sharp + tesseract.js |
--mode ocr |
vision_ocr |
预算预处理 OCR + 低置信度重试 + 数字复核通道(IP/URL/端口 0↔6/9/8 字形重识别) |
tesseract.js(chi_sim + eng) |
--mode colors |
vision_color_stats |
9 桶(白/黑/灰/红/绿/蓝/黄/青/品红/其他)像素占比 + 平均亮度 | sharp + 直方图 |
--mode scan |
vision_pixel_scan |
target 找指定颜色行;universal 输出全部非背景色行/列(背景豁免 + 部分带 surfaced) |
sharp raw pixel |
--mode meta |
vision_meta |
尺寸、格式、色彩空间、四角/中心采样 | sharp metadata |
文件护栏(v0.1.0)。所有入口先过一道 64MB 大小上限加 PNG/JPEG/WebP/GIF magic-number 嗅探,任意二进制或文本文件进不了 OCR 管线。
离线 OCR(v0.1.0)。`tessdata/` 内置语言包,配合 `PV_TESSDATA` 环境变量(`langPath + gzip:false`),首次运行不再从 CDN 拉语言包,完全离线可用。
安装
git clone https://github.com/DDDFXYqiming/pseudo-vision-skill.git
cd pseudo-vision-skill && node setup.mjs # 一键:npm 依赖 + 离线语言包
**装进你的框架**,任选其一。目录结构本身就符合 skill 规范,`SKILL.md`、`scripts/` 和 `src/` 一样不缺。
# 通用(pi / Claude Code 等支持 ~/.agents/skills 约定的框架)
cp -r pseudo-vision-skill ~/.agents/skills/pseudo-vision
# pi
cp -r pseudo-vision-skill ~/.pi/agent/skills/pseudo-vision
Related Skills
Dsh Vision Skill
Vision skill plugin for DeepSeek Harness (image analysis and OCR)
Vision Skill
Claude Code 技能:让无原生视觉的模型通过外部多模态 API 看懂图片 Skill that adds vision to models via external multimodal APIs
Match Reference
Rebuild a frontend pixel-identical to a reference image. Coding-agent skill (Claude Code, Codex, Cursor) that
Findmy
Look up Find My friend locations on macOS (name, location, staleness, distance) via Vision OCR of FindMy.app
OCR
Run OCR on existing book page captures (Vision + agent re-reading)
Comic OCR
OCR comic strips on macOS using Apple Vision, then clean up transcripts with Claude
Related Agents
PDF Reader
Гольмстен — читатель скан-PDF (route=scan) по OCR-тексту Apple Vision из сайдкаров ocr_dir/page_NNN.txt, сегме
Hdr
Handles HDR color workflows end-to-end — HDR10 static metadata, HDR10+ dynamic metadata, Dolby Vision profiles
OCR Reader
Batch OCR re-reader for low-confidence book pages. Reads page screenshot images via multimodal Read tool and e