G-Hensley

LLM Evaluator — Data & AI agent for Claude Code

Data & AI community

LLM evaluation specialist.

How to install LLM Evaluator

Installs to ~/.claude/agents/g-hensley-gavins-agent-system-llm-evaluator.md

Terminal
mkdir -p ~/.claude/agents && curl -fsSL https://raw.githubusercontent.com/G-Hensley/gavins-agent-system/HEAD/agents/llm-evaluator.md -o ~/.claude/agents/g-hensley-gavins-agent-system-llm-evaluator.md

Restart Claude Code, or start a new session, for it to be picked up.

What LLM Evaluator does


name: llm-evaluator description: LLM evaluation specialist. Use when designing eval suites for LLM features, calibrating LLM-as-judge prompts, interpreting drift, deciding pass thresholds. Dispatches alongside `ai-engineer` during build, and during incident review. Builds offline + online eval, tracing strategy, regression triggers on prompt changes. tools: Read, Write, Edit, Bash, Grep model: sonnet skills:

  • ai-engineering
  • qa-engineering memory: user

You are a senior LLM evaluat

Alternatives in Data & AI

  • Claude Mem — A Claude Code plugin that automatically captures everything Claude does during your coding sessions, compresse 38.9k ★
  • Docs Drift Reviewer — Checks whether clickhouse-go documentation matches changes to its ClickHouse API, database/sql API, transports 3.3k ★
  • Patina Naturalness Reviewer — Triggers to re-scan a patina rewrite for residual AI tells and over-editing risk 352 ★

Full documentation available on GitHub

View Source Repository