alandaitch

Imagen Adversarial — Development skill for Claude Code

Development community

Agrega un ruido casi imperceptible a una foto para que una IA de visión la lea como otra cosa.

How to install Imagen Adversarial

This entry records only its repository, not the path inside it, so there is no exact command to give. Open alandaitch/imagen-adversarial and copy the folder into ~/.claude/skills/, or the file into ~/.claude/agents/.

What Imagen Adversarial does

Agrega un ruido casi imperceptible a una foto para que una IA de visión la lea como otra cosa. Material educativo (ChatGPT/Claude/Gemini).

Alternatives in Development

  • TalkingHeads — A library to communicate with ChatGPT, Claude, Copilot, Gemini, HuggingChat, and Pi 322 ★
  • Foundry Ingest — Ingest raw material into the Foundry vault 99 ★
  • O Que é Isso? What Is This? — 15 habilidades Claude especializadas projetadas para Seedance 2.0 (Higgsfield) 54 ★

README

Imagen adversarial: hacé que una IA vea otra cosa

Este script agrega un ruido calculado, **casi imperceptible**, a una foto para que un modelo de visión (ChatGPT, Claude, Gemini) la lea como **otra cosa**. Un perro que la IA jura que es un gato. Vos seguís viendo el perro.

Es material educativo. Sirve para entender una idea incómoda: **las IAs no ven como nosotros**. Traducen la imagen a números y miden distancias en un mapa interno. Ese mapa se puede empujar sin que tu ojo lo note.

Demo en vivo (deslizás el ruido y ves el punto donde cae): **https://perro-o-pantera.vercel.app**

Lo armé pidiéndoselo a Claude Code, sin escribir una línea de código a mano. Esa es la otra mitad del punto: la herramienta está al alcance de cualquiera.


Cómo funciona (en criollo)

La IA convierte tu foto en una lista de números (un **embedding**) y la ubica como un puntito en un mapa gigante (un **espacio vectorial**), donde "perro" y "gato" son zonas vecinas. Reconocer, para ella, es medir a qué zona cae más cerca.

El ataque calcula, píxel por píxel, el empujón mínimo que corre ese puntito desde "perro" hasta "gato". Tres detalles lo hacen funcionar:

  • Caja negra por transferencia. No toca el modelo que querés engañar. Ataca modelos abiertos (CLIP), que cualquiera baja gratis y puede abrir por dentro. Como casi todas las IAs aprendieron a ver parecido, la trampa que funciona en una se contagia a las demás.
  • PGD + momento (MI-FGSM). Optimiza el ruido de a pasitos, con un límite duro (ε) de cuánto puede cambiar cada píxel, para que la foto siga igual a la vista.
  • EOT (Expectation over Transformation). En cada paso pasa la imagen por resize/blur/ruido al azar, para que el empujón sobreviva la compresión que aplica el servidor del modelo real.

Detalle técnico y datos medidos: [`method.md`](method.md).


Instalación

Necesitás Python 3.10+.

git clone https://github.com/alandaitch/imagen-adversarial.git
cd ima