Qualität
Jede Antwort wird von einer KI verfasst und von einer rivalisierenden KI geprüft, Satz für Satz in Ihren Dokumenten verankert. Dies ist die Prüfung — inklusive der Fälle, in denen unsere eigene KI ertappt und vor dem Senden gestoppt wurde.
Diese Woche blockierte Erfindungen
7
Antworten, die etwas zitierten, das in Ihren Dokumenten nicht steht — vor dem Senden durch die wörtliche Span-Prüfung blockiert.
Kürzlich vor dem Senden blockiert
Echte Antworten, die der Supervisor oder der Span-Validator abfing, bevor sie einen Kunden erreichten — die Aussage der KI neben dem, was Ihre Dokumente sagen.
-
Kritisch · Halluzination refund_request
- Die KI schrieb
- You're entitled to a full 100% refund any time within 60 days of purchase, no questions asked.
- Ihre Dokumente sagen
- Refunds are pro-rated for the unused portion of the current billing period and must be approved by a human teammate; there is no blanket 60-day money-back guarantee.
Vor dem Senden abgelehnt Ticket ansehen → -
Kritisch · Erfindung integration_broken
- Die KI schrieb
- Just turn on the 'Scheduled auto-export to Google Sheets' toggle in Settings and your data will sync every hour.
- Ihre Dokumente sagen
- The platform supports manual CSV export and a webhook feed; there is no native scheduled Google Sheets export.
Zur Prüfung markiert Ticket ansehen → -
Warnung · KB-Abweichung gdpr_deletion_request
- Die KI schrieb
- Once you close the account, all of your data is permanently deleted from our systems within 24 hours.
- Ihre Dokumente sagen
- Customer-owned data is purged 30 days after offboarding is initiated (automatic purge on day 31); audit-log rows are retained 7 years.
Zur Prüfung markiert Ticket ansehen →
Supervisor-Urteile
Das Urteil des familienübergreifenden Supervisors zu jeder geprüften Antwort. Übersprungene Antworten wurden bei einem kalibrierungs-vertrauten Thema ausgelassen — kein Qualitätsurteil.
- Genehmigt
- 121
- Markiert
- 13
- Abgelehnt
- 4
- Übersprungen
- 29
Was der Supervisor erkannt hat
Vom Supervisor markierte oder abgelehnte Probleme, nach Kategorie und Schweregrad gruppiert.
-
Kritisch Halluzination3
-
Warnung KB-Abweichung6
-
Warnung Span-Abweichung4
-
Info Ton-Abweichung5
-
Info Außerhalb des Rahmens2
Ablehnungsrate des KI-Supervisors
2.9%
4 von 138
Anteil der Antworten, die der familienübergreifende Supervisor rundheraus abgelehnt hat. Exklusive kalibrierungsbedingt übersprungener Antworten. Niedriger ist gesünder.
Span-Mismatch-Rate
4.8%
7 von 146
Anteil der Antworten, bei denen der deterministische Span-Validator ein Zitat erkannt hat, das nicht im zitierten KB-Artikel vorkommt. V1-Proxy für die Rate nicht belegter Behauptungen; LLM-Judge-Eval ist nicht im Umfang.
Eskalationsrate
7.2%
11 von 152
Anteil der eingehenden Tickets, die der KI-Mitarbeiter / Validator rundheraus abgelehnt hat (Erstattung, Kündigung, Recht, PII-Treffer, außerhalb des Umfangs). Eine Drift gegen null bei einem Korpus mit Erstattungs- / Kündigungsanfragen bedeutet, dass der Schutz für harte Ablehnungen defekt ist.
KB-Verankerungsrate
84.9%
124 von 146
Anteil der Antworten, die der KI-Mitarbeiter in einem KB-Artikel verankert hat. Eine Drift gegen null bei einem Tenant mit befüllter KB bedeutet, dass das Retrieval versagt oder die Artikel nicht zur tatsächlichen Ticket-Formulierung passen.
Prognostizierte CSAT
92%
basierend auf 474 Qualitätsstichproben
- Annahmequote
- 90%
- 40% Gewicht
- Supervisor-Freigabe
- 97%
- 30% Gewicht
- KB-Verankerung
- 85%
- 15% Gewicht
- Keine Eskalation
- 93%
- 15% Gewicht
Transparente gewichtete Mischung: 40 % menschliche Annahmequote der KI-Antworten, 30 % Freigabequote des Supervisors, 15 % KB-Verankerungsrate, 15 % Quote ohne Eskalation. Signale ohne Daten werden ausgeschlossen und die Gewichte neu normiert — nichts wird erfunden. Ein Näherungswert, keine Umfrage.
QA-Scores pro Thema
Jedes Support-Thema, das der Kalibrierungsjob gemessen hat — dieselbe Datengrundlage, die das Auto-Lösen-Gate liest. Die Annahmequote ist der Anteil der KI-Antworten, die Ihr Team unverändert versendet hat.
| Thema | Annahmequote | Trend | Geprüft | Eskalation | Verankerung | Status |
|---|---|---|---|---|---|---|
| billing.invoice | 94% | 64 | 3% (2/66) | 92% (61/66) | Vertrauenswürdig | |
| auth.login | 92% | 48 | 2% (1/50) | 88% (44/50) | Vertrauenswürdig | |
| shipping.tracking | 87% | 22 | 12% (3/24) | 71% (17/24) | Kalibrierung läuft | |
| integration.webhook | 83% | 37 | 15% (6/39) | 54% (21/39) | Wissen fehlt | |
| security.sharing | 90% | 19 | 10% (2/21) | 86% (18/21) | Kalibrierung läuft |
Themen, denen Wissen fehlt
Genug Daten, aber die Annahmequote liegt unter der Auto-Lösen-Schwelle — meist eine Wissenslücke, kein Modellproblem. Ergänzen oder verbessern Sie die Wissensdatenbank-Artikel zu diesen Themen.
-
integration.webhook 83 % angenommen über 37 geprüfte TicketsWissensdatenbank verbessern
Quelle: audit_log + Ihre Tickets, RLS-beschränkt auf diesen Workspace. Jeder Nenner wird angezeigt, damit eine Rate bei N=1 anders gelesen wird als bei N=500.