Ataski
Registrarse gratis
Espacio de muestra — datos de ejemplo, no los tuyos. Regístrate gratis para ejecutarlo con los tuyos.

Calidad

Cada respuesta la escribe una IA y la audita una IA rival, fundamentada frase por frase en sus documentos. Esta es la auditoría — incluidas las veces en que nuestra propia IA fue detectada y detenida antes de enviar.

Invenciones bloqueadas esta semana

7

Respuestas que citaban algo que sus documentos no dicen — bloqueadas antes de enviar por la verificación textual.

Últimos 14 días

Bloqueado recientemente antes de enviar

Respuestas reales que el supervisor o el validador de citas detuvo antes de llegar a un cliente: la afirmación de la IA junto a lo que dicen sus documentos.

  • Crítico · Alucinación refund_request
    La IA escribió
    You're entitled to a full 100% refund any time within 60 days of purchase, no questions asked.
    Sus documentos dicen
    Refunds are pro-rated for the unused portion of the current billing period and must be approved by a human teammate; there is no blanket 60-day money-back guarantee.
    Rechazado antes de enviar Ver ticket →
  • Crítico · Invención integration_broken
    La IA escribió
    Just turn on the 'Scheduled auto-export to Google Sheets' toggle in Settings and your data will sync every hour.
    Sus documentos dicen
    The platform supports manual CSV export and a webhook feed; there is no native scheduled Google Sheets export.
    Marcado para revisión Ver ticket →
  • Advertencia · Discrepancia KB gdpr_deletion_request
    La IA escribió
    Once you close the account, all of your data is permanently deleted from our systems within 24 hours.
    Sus documentos dicen
    Customer-owned data is purged 30 days after offboarding is initiated (automatic purge on day 31); audit-log rows are retained 7 years.
    Marcado para revisión Ver ticket →

Veredictos del supervisor

La decisión del supervisor de familia cruzada sobre cada respuesta que revisó. Las respuestas omitidas se elidieron en un tema de calibración confiable — no es un veredicto de calidad.

Aprobado
121
Marcado
13
Rechazado
4
Omitido
29

Lo que detectó el supervisor

Problemas que el supervisor marcó o rechazó, agrupados por categoría y gravedad.

  • Crítico Alucinación
    3
  • Advertencia Discrepancia KB
    6
  • Advertencia Discrepancia de cita
    4
  • Info Discrepancia de tono
    5
  • Info Fuera de alcance
    2

Tasa de rechazo del supervisor

2.9%

4 de 138

Fracción de respuestas que el supervisor de IA de otra familia rechazó por completo. Excluye las respuestas omitidas por calibración. Cuanto más baja, más sana.

Tasa de discrepancia de fragmentos

4.8%

7 de 146

Fracción de respuestas en las que el validador determinista de fragmentos detectó una cita que no aparece en el artículo de la base de conocimiento citado. Aproximación de V1 para la tasa de afirmaciones sin respaldo; la evaluación con juez LLM queda fuera de alcance.

Tasa de escalado

7.2%

11 de 152

Fracción de tickets entrantes que el empleado de IA / validador rechazó por completo (reembolso, cancelación, legal, coincidencia de PII, fuera de alcance). Que tienda a cero en un corpus con solicitudes de reembolso / cancelación significa que la barrera de rechazo estricto está rota.

Tasa de fundamentación en la base de conocimiento

84.9%

124 de 146

Fracción de respuestas que el empleado de IA decidió fundamentar en un artículo de la base de conocimiento. Que tienda a cero en un inquilino con la base de conocimiento poblada significa que la recuperación está fallando o que los artículos no coinciden con la redacción real de los tickets.

CSAT previsto

92%

basado en 474 muestras de calidad

Tasa de aceptación
90%
40% de peso
Aprobación del supervisor
97%
30% de peso
Fundamentación KB
85%
15% de peso
Sin escalación
93%
15% de peso

Combinación ponderada transparente: 40 % tasa de aceptación humana de las respuestas de IA, 30 % tasa de aprobación del supervisor, 15 % tasa de fundamentación en la base de conocimiento, 15 % tasa de no escalado. Las señales sin datos se excluyen y los pesos se renormalizan: nada se inventa. Es una aproximación, no una encuesta.

Puntuaciones QA por tema

Cada tema de soporte medido por el proceso de calibración: la misma evidencia que lee la compuerta de resolución automática. La tasa de aceptación es la proporción de respuestas de IA que su equipo envió sin cambios.

Tema Tasa de aceptación Tendencia Revisados Escalación Fundamentación Estado
billing.invoice 94% 64 3% (2/66) 92% (61/66) De confianza
auth.login 92% 48 2% (1/50) 88% (44/50) De confianza
shipping.tracking 87% 22 12% (3/24) 71% (17/24) En calibración
integration.webhook 83% 37 15% (6/39) 54% (21/39) Falta conocimiento
security.sharing 90% 19 10% (2/21) 86% (18/21) En calibración

Temas que necesitan conocimiento

Hay evidencia suficiente, pero la tasa de aceptación está por debajo del umbral de resolución automática: normalmente es una laguna de conocimiento, no un problema del modelo. Añada o mejore artículos de la base de conocimiento para estos temas.

Fuente: audit_log + sus tickets, con alcance RLS a este espacio. Se muestra cada denominador para que una tasa con N=1 se lea distinto que con N=500.