# LLM output evaluation (/ai--llm-eval)

/ai--llm-eval is a Claude Code skill in the AI & Agents section. Sets up an evaluation suite for an AI feature: test cases, rubrics, code-based checks, LLM-as-judge with bias controls and a CI gate.

- Web version: https://skills.sgomez.dev/en/s/ai--llm-eval
- Section: [AI & Agents](https://skills.sgomez.dev/en/ai.md)
- Author: Santiago Gómez de la Torre
- License: MIT
- Source: https://github.com/sgomez-dev/claude-skills/blob/main/skills/ai/llm-eval.md
- Updated 10 Jul 2026

## How to ask for it

- `/ai--llm-eval create a rubric to score my assistant's answers`
- `/ai--llm-eval set up an LLM-as-judge with bias controls`
- `/ai--llm-eval wire model evals into our CI pipeline`

## Install

macOS · Linux:

```
curl -fsSL https://raw.githubusercontent.com/sgomez-dev/claude-skills/main/install.sh | bash
```

Windows:

```
irm https://raw.githubusercontent.com/sgomez-dev/claude-skills/main/install.ps1 | iex
```

Claude Code plugin:

```
/plugin marketplace add sgomez-dev/claude-skills
/plugin install ai-skills@claude-skills-collection
```

## Permissions

- Reads: `**/*`
- Writes: `**/*`
- Runs: `project test/eval runners`, `CI config`
- Network: No
- Destructive: No

## Author's description

LLM output evals - rubrics, LLM-as-judge with bias controls, CI integration

- [How we review this](https://skills.sgomez.dev/en/methodology.md)
