Hecha aquí
Evaluar un sistema RAG
/ai--rag-eval
/ai--rag-eval es una skill de Claude Code de la sección IA y Agentes. Crea un banco de pruebas para medir un pipeline RAG: conjunto de preguntas de referencia, métricas de recuperación, fidelidad y control de regresiones.
Descripción del autor (traducida)
Evalúa un pipeline de RAG: métricas de recuperación, fundamentación (groundedness), golden set y regresiones
Úsala cuando
- Ya tienes un RAG y no sabes si responde bien
- Vas a cambiar el troceado, los embeddings o el prompt y quieres medir el efecto
- Quieres detectar respuestas inventadas y fallos de recuperación
No es para
- Construir el pipeline RAG desde cero (para eso existe ai--embeddings)
- Sustituir la revisión humana de un experto en tu contenido
Qué obtienes
Un conjunto de preguntas de referencia versionado en el repo y un comando que imprime un cuadro de mando con recall@k, MRR, fidelidad, corrección, abstención, coste y latencia.
Cómo pedírselo
/ai--rag-eval mide si mi sistema RAG recupera los documentos correctos/ai--rag-eval crea un golden set para evaluar las respuestas del RAG/ai--rag-eval detecta si un cambio reciente ha empeorado el RAG
Instalar
curl -fsSL https://raw.githubusercontent.com/sgomez-dev/claude-skills/main/install.sh | bashTras instalar con el script, escribe /ai--rag-eval. ¿Usas Cursor, Windsurf o Codex? Guías por plataforma
Preguntas sobre esta skill
- ¿Cuántas preguntas necesita el conjunto de referencia?
- Entre 30 y 100, con la respuesta esperada y los fragmentos que contienen la evidencia. Incluye preguntas que el corpus no puede responder, para comprobar que el sistema admite que no lo sabe.
- ¿Por qué mide primero la recuperación?
- Porque suele ser el cuello de botella: si el recall@k es bajo, ningún ajuste del prompt arreglará las respuestas. Según la propia skill, la mayoría de las alucinaciones son fallos de recuperación.
- ¿Usa un modelo como juez?
- Sí, para comprobar la fidelidad: un modelo lista las afirmaciones sin respaldo en el contexto recuperado. Aplica controles de sesgo del juez, como una rúbrica fija y contraste con etiquetas humanas.
Demo en camino
Encaja con
- Receta: /pipeline--llm-app LLM App