DDDFXYqiming

Pseudo Vision Skill — Development skill for Claude Code

Development community

Local OCR, color-statistics, pixel-scan, and metadata bridge as a cross-framework skill for text-only agent models; no external vision API.

How to install Pseudo Vision Skill

This entry records only its repository, not the path inside it, so there is no exact command to give. Open DDDFXYqiming/pseudo-vision-skill and copy the folder into ~/.claude/skills/, or the file into ~/.claude/agents/.

What Pseudo Vision Skill does

Local OCR, color-statistics, pixel-scan, and metadata bridge as a cross-framework skill for text-only agent models; no external vision API. Algorithm-identical to dsh-pseudo-vision / pi-pseudo-vision.

Alternatives in Development

  • Screenshot — Capture desktop, app windows, or pixel regions across OS platforms 14.6k ★
  • Product Vision — Brainstorm inspiring, achievable product vision statements 7.8k ★
  • JWT Scan — JWT attack toolkit (offline) — alg:none forgery, RS256→HS256 algorithm confusion, weak-secret crack, static cl 4.5k ★

README

简体中文 | [English](README.en.md)

pseudo-vision-skill

一个跨框架的"工具层视觉" skill。图片在本机被拆成四路证据,OCR 文字、颜色统计、像素扫描和元信息,纯文本模型的智能体拿到这包证据就能读图。同一套算法层可以装进 Claude Code / pi / Hermes / WorkBuddy 等任何支持 skill 的框架,**无需逐个开发插件**。计算全程发生在本机,**无外部视觉 API**。

**算法与 [dsh-pseudo-vision](https://github.com/DDDFXYqiming/dsh-pseudo-vision) / [pi-pseudo-vision](https://github.com/DDDFXYqiming/pi-pseudo-vision) 插件完全同源**。算法只有一份权威源(pi 仓库),改完用 `sync-from-pi.mjs` 一键同步过来。

**实机验证通过**。pi 加 kimi-for-coding 这样的纯文本模型,配上本 skill,完整读图成功。OCR 全对(含中文),深色主题判断正确,布局定位到了行级。

为什么是 skill 而不是插件

  • dsh 的准入校验极严,粘贴图片时直接拒绝发给 text-only 模型,要接住这条路只能靠插件级路由接管,所以 dsh-pseudo-vision 保留插件形态
  • 其他框架(pi / Claude Code / Hermes 等)不拦截。text-only 模型能感觉到面前有一张图,只是自己读不出来,这种情况一个 skill 就够了
  • 一份实现,装遍所有框架。算法改动只发生在算法源仓库,跑一次 sync 就分发到位

提供的能力(CLI 模式 ↔ 插件工具对照)

CLI 模式 等价插件工具 作用 实现
full(默认) pseudo_vision_convert 四件套聚合为单一 证据块(缓存 + 32K 封顶 + 分块 + OCR 失败写回) sharp + tesseract.js
--mode ocr vision_ocr 预算预处理 OCR + 低置信度重试 + 数字复核通道(IP/URL/端口 0↔6/9/8 字形重识别) tesseract.js(chi_sim + eng)
--mode colors vision_color_stats 9 桶(白/黑/灰/红/绿/蓝/黄/青/品红/其他)像素占比 + 平均亮度 sharp + 直方图
--mode scan vision_pixel_scan target 找指定颜色行;universal 输出全部非背景色行/列(背景豁免 + 部分带 surfaced) sharp raw pixel
--mode meta vision_meta 尺寸、格式、色彩空间、四角/中心采样 sharp metadata

文件护栏(v0.1.0)。所有入口先过一道 64MB 大小上限加 PNG/JPEG/WebP/GIF magic-number 嗅探,任意二进制或文本文件进不了 OCR 管线。

离线 OCR(v0.1.0)。`tessdata/` 内置语言包,配合 `PV_TESSDATA` 环境变量(`langPath + gzip:false`),首次运行不再从 CDN 拉语言包,完全离线可用。

安装

git clone https://github.com/DDDFXYqiming/pseudo-vision-skill.git
cd pseudo-vision-skill && node setup.mjs   # 一键:npm 依赖 + 离线语言包

**装进你的框架**,任选其一。目录结构本身就符合 skill 规范,`SKILL.md`、`scripts/` 和 `src/` 一样不缺。

# 通用(pi / Claude Code 等支持 ~/.agents/skills 约定的框架)
cp -r pseudo-vision-skill ~/.agents/skills/pseudo-vision

# pi
cp -r pseudo-vision-skill ~/.pi/agent/skills/pseudo-vision