Saltar al contenido
Hecha aquí

Evaluar un sistema RAG

/ai--rag-eval

/ai--rag-eval es una skill de Claude Code de la sección IA y Agentes. Crea un banco de pruebas para medir un pipeline RAG: conjunto de preguntas de referencia, métricas de recuperación, fidelidad y control de regresiones.

Descripción del autor (traducida)

Evalúa un pipeline de RAG: métricas de recuperación, fundamentación (groundedness), golden set y regresiones

Úsala cuando

  • Ya tienes un RAG y no sabes si responde bien
  • Vas a cambiar el troceado, los embeddings o el prompt y quieres medir el efecto
  • Quieres detectar respuestas inventadas y fallos de recuperación

No es para

  • Construir el pipeline RAG desde cero (para eso existe ai--embeddings)
  • Sustituir la revisión humana de un experto en tu contenido

Qué obtienes

Un conjunto de preguntas de referencia versionado en el repo y un comando que imprime un cuadro de mando con recall@k, MRR, fidelidad, corrección, abstención, coste y latencia.

Cómo pedírselo

  • /ai--rag-eval mide si mi sistema RAG recupera los documentos correctos
  • /ai--rag-eval crea un golden set para evaluar las respuestas del RAG
  • /ai--rag-eval detecta si un cambio reciente ha empeorado el RAG

Instalar

curl -fsSL https://raw.githubusercontent.com/sgomez-dev/claude-skills/main/install.sh | bash

Tras instalar con el script, escribe /ai--rag-eval. ¿Usas Cursor, Windsurf o Codex? Guías por plataforma

Preguntas sobre esta skill

¿Cuántas preguntas necesita el conjunto de referencia?
Entre 30 y 100, con la respuesta esperada y los fragmentos que contienen la evidencia. Incluye preguntas que el corpus no puede responder, para comprobar que el sistema admite que no lo sabe.
¿Por qué mide primero la recuperación?
Porque suele ser el cuello de botella: si el recall@k es bajo, ningún ajuste del prompt arreglará las respuestas. Según la propia skill, la mayoría de las alucinaciones son fallos de recuperación.
¿Usa un modelo como juez?
Sí, para comprobar la fidelidad: un modelo lista las afirmaciones sin respaldo en el contexto recuperado. Aplica controles de sesgo del juez, como una rúbrica fija y contraste con etiquetas humanas.

Demo en camino

Encaja con

↑↓ moverte · Enter abrir · Esc cerrar