Scaffold Inspect — Data & AI agent for Claude Code
Sets up inspect-ai evaluation configurations for all runs in a designed experiment.
How to install Scaffold Inspect
Installs to ~/.claude/agents/niznik-dev-cruijff_kit-scaffold-inspect.md
mkdir -p ~/.claude/agents && curl -fsSL https://raw.githubusercontent.com/niznik-dev/cruijff_kit/HEAD/.claude/agents/scaffold-inspect.md -o ~/.claude/agents/niznik-dev-cruijff_kit-scaffold-inspect.md Restart Claude Code, or start a new session, for it to be picked up.
What Scaffold Inspect does
name: scaffold-inspect description: Sets up inspect-ai evaluation configurations for all runs in a designed experiment. Reads experiment_summary.yaml and generates one cell directory per (run, task, epoch), each containing eval.yaml and cell.slurm. tools: Read, Edit, Write, Grep, Glob, Bash permissionMode: default
You help automatically set up inspect-ai evaluation configurations for all runs in a designed experiment. Your task is to read an `experiment_summary.yaml` file and generate a
Alternatives in Data & AI
- Multi Agent Review — A sophisticated AI-powered code review system designed to provide comprehensive, multi-perspective a... - wsho 31.9k ★
- Specialized AI Agents — This directory contains specialized AI agent definitions used by Claude Code to handle complex, domain-specifi 357 ★
- AI Eval Engineer — Builds and maintains the eval pipeline for ai-system / agent-product archetypes 83 ★
Full documentation available on GitHub
View Source RepositoryRelated Agents
Sf ML Engineer
ML/DL Engineer of the Software Factory cell. Use for machine learning and deep learning work - data contracts,
Aif Init
Generate a draft .ai-factory/DESCRIPTION.md and .ai-factory/ARCHITECTURE.md for a consumer repo. Reads package
AI Context
Compresses discovery output into the single structured task-context document every later agent reads instead o
Gsd Eval Planner
Designs a structured evaluation strategy for an AI phase. Identifies critical failure modes, selects eval dime
Ferrox Eval Planner
Designs a structured evaluation strategy for an AI phase. Identifies critical failure modes, selects eval dime
Askit Quality Grader
Judges whether a skill triggers and behaves correctly by running it against its eval-set and grading the outpu
Related Skills
Quick Eval
Quick job evaluation. Paste a JD and get a score plus one-paragraph summary. Faster than a full evaluate. Use
Hermesbench
Reliability-first benchmark and evaluation harness for Hermes Agent runtime configurations
Tilth
A local-first garden almanac & planner — but really an experiment in agent-first, no-hand-coding development: