Ataski
Kostenlos registrieren
Beispiel-Arbeitsbereich — Beispieldaten, nicht Ihre eigenen. Registrieren Sie sich kostenlos, um es mit Ihren Daten auszuführen.

Qualität

Jede Antwort wird von einer KI verfasst und von einer rivalisierenden KI geprüft, Satz für Satz in Ihren Dokumenten verankert. Dies ist die Prüfung — inklusive der Fälle, in denen unsere eigene KI ertappt und vor dem Senden gestoppt wurde.

Diese Woche blockierte Erfindungen

7

Antworten, die etwas zitierten, das in Ihren Dokumenten nicht steht — vor dem Senden durch die wörtliche Span-Prüfung blockiert.

Letzte 14 Tage

Kürzlich vor dem Senden blockiert

Echte Antworten, die der Supervisor oder der Span-Validator abfing, bevor sie einen Kunden erreichten — die Aussage der KI neben dem, was Ihre Dokumente sagen.

  • Kritisch · Halluzination refund_request
    Die KI schrieb
    You're entitled to a full 100% refund any time within 60 days of purchase, no questions asked.
    Ihre Dokumente sagen
    Refunds are pro-rated for the unused portion of the current billing period and must be approved by a human teammate; there is no blanket 60-day money-back guarantee.
    Vor dem Senden abgelehnt Ticket ansehen →
  • Kritisch · Erfindung integration_broken
    Die KI schrieb
    Just turn on the 'Scheduled auto-export to Google Sheets' toggle in Settings and your data will sync every hour.
    Ihre Dokumente sagen
    The platform supports manual CSV export and a webhook feed; there is no native scheduled Google Sheets export.
    Zur Prüfung markiert Ticket ansehen →
  • Warnung · KB-Abweichung gdpr_deletion_request
    Die KI schrieb
    Once you close the account, all of your data is permanently deleted from our systems within 24 hours.
    Ihre Dokumente sagen
    Customer-owned data is purged 30 days after offboarding is initiated (automatic purge on day 31); audit-log rows are retained 7 years.
    Zur Prüfung markiert Ticket ansehen →

Supervisor-Urteile

Das Urteil des familienübergreifenden Supervisors zu jeder geprüften Antwort. Übersprungene Antworten wurden bei einem kalibrierungs-vertrauten Thema ausgelassen — kein Qualitätsurteil.

Genehmigt
121
Markiert
13
Abgelehnt
4
Übersprungen
29

Was der Supervisor erkannt hat

Vom Supervisor markierte oder abgelehnte Probleme, nach Kategorie und Schweregrad gruppiert.

  • Kritisch Halluzination
    3
  • Warnung KB-Abweichung
    6
  • Warnung Span-Abweichung
    4
  • Info Ton-Abweichung
    5
  • Info Außerhalb des Rahmens
    2

Ablehnungsrate des KI-Supervisors

2.9%

4 von 138

Anteil der Antworten, die der familienübergreifende Supervisor rundheraus abgelehnt hat. Exklusive kalibrierungsbedingt übersprungener Antworten. Niedriger ist gesünder.

Span-Mismatch-Rate

4.8%

7 von 146

Anteil der Antworten, bei denen der deterministische Span-Validator ein Zitat erkannt hat, das nicht im zitierten KB-Artikel vorkommt. V1-Proxy für die Rate nicht belegter Behauptungen; LLM-Judge-Eval ist nicht im Umfang.

Eskalationsrate

7.2%

11 von 152

Anteil der eingehenden Tickets, die der KI-Mitarbeiter / Validator rundheraus abgelehnt hat (Erstattung, Kündigung, Recht, PII-Treffer, außerhalb des Umfangs). Eine Drift gegen null bei einem Korpus mit Erstattungs- / Kündigungsanfragen bedeutet, dass der Schutz für harte Ablehnungen defekt ist.

KB-Verankerungsrate

84.9%

124 von 146

Anteil der Antworten, die der KI-Mitarbeiter in einem KB-Artikel verankert hat. Eine Drift gegen null bei einem Tenant mit befüllter KB bedeutet, dass das Retrieval versagt oder die Artikel nicht zur tatsächlichen Ticket-Formulierung passen.

Prognostizierte CSAT

92%

basierend auf 474 Qualitätsstichproben

Annahmequote
90%
40% Gewicht
Supervisor-Freigabe
97%
30% Gewicht
KB-Verankerung
85%
15% Gewicht
Keine Eskalation
93%
15% Gewicht

Transparente gewichtete Mischung: 40 % menschliche Annahmequote der KI-Antworten, 30 % Freigabequote des Supervisors, 15 % KB-Verankerungsrate, 15 % Quote ohne Eskalation. Signale ohne Daten werden ausgeschlossen und die Gewichte neu normiert — nichts wird erfunden. Ein Näherungswert, keine Umfrage.

QA-Scores pro Thema

Jedes Support-Thema, das der Kalibrierungsjob gemessen hat — dieselbe Datengrundlage, die das Auto-Lösen-Gate liest. Die Annahmequote ist der Anteil der KI-Antworten, die Ihr Team unverändert versendet hat.

Thema Annahmequote Trend Geprüft Eskalation Verankerung Status
billing.invoice 94% 64 3% (2/66) 92% (61/66) Vertrauenswürdig
auth.login 92% 48 2% (1/50) 88% (44/50) Vertrauenswürdig
shipping.tracking 87% 22 12% (3/24) 71% (17/24) Kalibrierung läuft
integration.webhook 83% 37 15% (6/39) 54% (21/39) Wissen fehlt
security.sharing 90% 19 10% (2/21) 86% (18/21) Kalibrierung läuft

Themen, denen Wissen fehlt

Genug Daten, aber die Annahmequote liegt unter der Auto-Lösen-Schwelle — meist eine Wissenslücke, kein Modellproblem. Ergänzen oder verbessern Sie die Wissensdatenbank-Artikel zu diesen Themen.

Quelle: audit_log + Ihre Tickets, RLS-beschränkt auf diesen Workspace. Jeder Nenner wird angezeigt, damit eine Rate bei N=1 anders gelesen wird als bei N=500.