ES EN
Cómo se usa

Evaluar las respuestas

Las dos capas de evaluación y los 17 evaluadores LLM calibrados que puntúan cada respuesta de tu chatbot.

Las dos capas de evaluación

Cada respuesta del chatbot pasa por dos filtros independientes:

🔧
1. Asserts determinísticos
Verificaciones programáticas: contains, regex, JSON Schema, response_time, etc. No usan IA. Son baratas, instantáneas y reproducibles 100%.
🧠
2. Evaluadores LLM
Un modelo califica cada respuesta en una dimensión específica. Devuelven score 0–1 (decimal) + justificación textual. 17 evaluadores calibrados.

Las dos capas son complementarias:

Los 17 evaluadores LLM

Cada evaluador es un prompt afinado más un modelo. Devuelven internamente un score decimal entre 0 y 1, que la plataforma te muestra en pantalla como porcentaje (0–100%), junto con una explicación textual.

SlugQué mide
comparisonComparación entre la respuesta obtenida y la respuesta esperada (similitud semántica).
completenessSi la respuesta cubre todo lo que pide la pregunta.
concisenessSi la respuesta es lo suficientemente breve sin perder lo esencial.
formalityAdecuación del registro formal/informal al contexto.
biasPresencia de sesgo (de género, racial, etario, etc.).
toneTono apropiado al canal y al usuario.
empathyNivel de empatía cuando el usuario expresa frustración o vulnerabilidad.
securityRiesgos de seguridad (filtración de datos, prompt injection, etc.).
inappropriate_contentContenido inapropiado, ofensivo o fuera de scope.
error_handlingCómo maneja errores, ambigüedad del usuario o inputs inesperados.
ambiguitySi la respuesta resuelve o introduce ambigüedad.
fluencyNaturalidad y fluidez del lenguaje.
data_accuracyExactitud de los datos puntuales mencionados (precios, fechas, números).
hallucinationInformación inventada o no respaldada por contexto.
escalationSi escala correctamente a humano cuando corresponde.
languageQue la respuesta esté en el idioma esperado.
consistencyCoherencia interna y a lo largo de la conversación.

Cómo se evalúa una corrida

Después de ejecutar un Test Plan, el Run queda en estado Ready to Evaluate. Para evaluar:

  1. Ve a Execution → Evaluations.
  2. Selecciona el Run.
  3. Clic en Evaluate.
  4. Elige qué evaluadores activar (no necesariamente todos los 17 — usa los que tengan sentido para tu dominio).
  5. Clic en Start Evaluation.

Cada respuesta del Run se le pasa a cada evaluador seleccionado, en paralelo. Cuando termina, el Run pasa a estado Evaluated y el reporte queda disponible.

💰 Tokens. La fase de evaluación consume tokens del pool de tu plan. Cuanto más evaluadores activos × más respuestas a evaluar, más consumo.

Score por evaluador y umbral pass/fail

Cada evaluador tiene un umbral configurable que define a partir de qué score se considera "pass" para ese evaluador. Por default cada evaluador trae un threshold razonable; tú puedes ajustarlo desde Configuration → Evaluators/Judges (por evaluador, a nivel organización).

Evaluation Report con scores por evaluador
Vista de evaluación — pass rate, threshold, performance por test case y un círculo por cada uno de los 17 evaluadores (Consistency 100%, Inappropriate Content 100%... Hallucination 16%).

Cada respuesta + cada evaluador genera:

Los evaluadores vienen calibrados

Un evaluador LLM no es confiable por default — distintos modelos, prompts y temperaturas dan puntajes distintos. Por eso, los 17 evaluadores que usas en ArtificialQA vienen pre-calibrados por nuestro equipo: validamos cada uno contra datasets de referencia para garantizar que sus scores sean confiables y consistentes. Tú no tienes que calibrar nada — viene listo para usar.

Más detalle del proceso de calibración interna en Seguridad y compliance.

Detección automática de PII

Independiente de los evaluadores LLM, ArtificialQA detecta automáticamente PII (información personal identificable) en las respuestas:

Si una respuesta contiene PII donde no debería, queda marcada como observación crítica en el reporte.

Cuándo usar qué evaluador

Como referencia y a modo de orientación, estos son combos típicos por dominio. No son obligatorios ni exclusivos — tú eliges qué evaluadores activar según las dimensiones que te importen para tu chatbot:

Puedes combinar de cualquier manera, e ir ajustando con la experiencia de tus primeras corridas.

Re-evaluar y Score Overrides

Sobre un mismo Run puedes correr varias evaluaciones a lo largo del tiempo — con distintos evaluadores activos, o simplemente para volver a calificar. Cada evaluación queda guardada como snapshot independiente. Como hay un LLM detrás de cada evaluador, dos evaluaciones del mismo run pueden dar scores distintos.

Si no estás de acuerdo con un score puntual, puedes editarlo manualmente (Score Override). La plataforma marca el score como "modificado", conserva el original en el historial y registra quién, cuándo y por qué. La auditoría queda intacta. El listado de todos los overrides está en Execution → Score Overrides.

Próximo paso

Una vez evaluado el Run, lo siguiente es interpretar los resultados. Eso lo cubre la sección de Reportes y dashboard.