# Evaluar un sistema RAG (/ai--rag-eval)

/ai--rag-eval es una skill de Claude Code de la sección IA y Agentes. Crea un banco de pruebas para medir un pipeline RAG: conjunto de preguntas de referencia, métricas de recuperación, fidelidad y control de regresiones.

- Versión web: https://skills.sgomez.dev/es/s/ai--rag-eval
- Sección: [IA y Agentes](https://skills.sgomez.dev/es/ai.md)
- Autor: Santiago Gómez de la Torre
- Licencia: MIT
- Código: https://github.com/sgomez-dev/claude-skills/blob/main/skills/ai/rag-eval.md
- Actualizada el 10 jul 2026

## Úsala cuando

- Ya tienes un RAG y no sabes si responde bien
- Vas a cambiar el troceado, los embeddings o el prompt y quieres medir el efecto
- Quieres detectar respuestas inventadas y fallos de recuperación

## No es para

- Construir el pipeline RAG desde cero (para eso existe ai--embeddings)
- Sustituir la revisión humana de un experto en tu contenido

## Qué obtienes

Un conjunto de preguntas de referencia versionado en el repo y un comando que imprime un cuadro de mando con recall@k, MRR, fidelidad, corrección, abstención, coste y latencia.

## Cómo pedírselo

- `/ai--rag-eval mide si mi sistema RAG recupera los documentos correctos`
- `/ai--rag-eval crea un golden set para evaluar las respuestas del RAG`
- `/ai--rag-eval detecta si un cambio reciente ha empeorado el RAG`

## Instalar

macOS · Linux:

```
curl -fsSL https://raw.githubusercontent.com/sgomez-dev/claude-skills/main/install.sh | bash
```

Windows:

```
irm https://raw.githubusercontent.com/sgomez-dev/claude-skills/main/install.ps1 | iex
```

Plugin de Claude Code:

```
/plugin marketplace add sgomez-dev/claude-skills
/plugin install ai-skills@claude-skills-collection
```

## Permisos

- Lee: `**/*`
- Escribe: `**/*`
- Ejecuta: `project test/eval runners`
- Red: No
- Destructiva: No

## Descripción del autor (traducida)

Evalúa un pipeline de RAG: métricas de recuperación, fundamentación (groundedness), golden set y regresiones

## Encaja con

- [Chatbot listo para producción (/ai--chatbot-scaffold)](https://skills.sgomez.dev/es/s/ai--chatbot-scaffold.md): Monta un chatbot sobre tu stack actual: respuestas en streaming, historial guardado, conexión opcional a RAG y un bucle de feedback.
- [Embeddings y búsqueda semántica (/ai--embeddings)](https://skills.sgomez.dev/es/s/ai--embeddings.md): Implementa embeddings vectoriales en tu aplicación para búsqueda semántica, RAG o similitud: ingesta, troceado, consulta y optimización.
- [Barreras de seguridad para LLM (/ai--guardrails)](https://skills.sgomez.dev/es/s/ai--guardrails.md): Añade filtros de entrada y salida, defensa contra inyección de prompts y manejo de datos personales a una función de IA, con pruebas adversarias.
- Receta: [/pipeline--llm-app](https://github.com/sgomez-dev/claude-skills/blob/main/pipelines/llm-app.yaml): LLM App

## Preguntas sobre esta skill

### ¿Cuántas preguntas necesita el conjunto de referencia?

Entre 30 y 100, con la respuesta esperada y los fragmentos que contienen la evidencia. Incluye preguntas que el corpus no puede responder, para comprobar que el sistema admite que no lo sabe.

### ¿Por qué mide primero la recuperación?

Porque suele ser el cuello de botella: si el recall@k es bajo, ningún ajuste del prompt arreglará las respuestas. Según la propia skill, la mayoría de las alucinaciones son fallos de recuperación.

### ¿Usa un modelo como juez?

Sí, para comprobar la fidelidad: un modelo lista las afirmaciones sin respaldo en el contexto recuperado. Aplica controles de sesgo del juez, como una rúbrica fija y contraste con etiquetas humanas.


- [Cómo revisamos esto](https://skills.sgomez.dev/es/methodology.md)
