Saltar al contenido
Hecha aquí

Evaluar respuestas de un LLM

/ai--llm-eval

/ai--llm-eval es una skill de Claude Code de la sección IA y Agentes. Monta un conjunto de evaluación para una función de IA: casos, rúbricas, comprobaciones por código, jueces LLM con control de sesgos y puerta en CI.

Descripción del autor (traducida)

Evaluación de salidas de LLM: rúbricas, LLM como juez con controles de sesgo, e integración en CI

Cómo pedírselo

  • /ai--llm-eval crea una rúbrica para evaluar las respuestas de mi asistente
  • /ai--llm-eval monta un LLM-as-judge que controle el sesgo
  • /ai--llm-eval integra las evaluaciones del modelo en el pipeline de CI

Instalar

curl -fsSL https://raw.githubusercontent.com/sgomez-dev/claude-skills/main/install.sh | bash

Tras instalar con el script, escribe /ai--llm-eval. ¿Usas Cursor, Windsurf o Codex? Guías por plataforma

Demo en camino

↑↓ moverte · Enter abrir · Esc cerrar