ooligo
STACK

Support-Quality-Assurance-Stack — die Resolutions bewerten, die Ihnen berechnet werden

Eine Support-Organisation, die pro Verified Resolution abgerechnet wird und deren Score, Stichprobe und Streitakte von jemand anderem stammen müssen als von dem Anbieter, der die Rechnung schickt.

Difficulty
Fortgeschritten
Tools
5
Customer Success

The stack

Am 26. März 2026 hat Zendesk die Übernahme von Forethought abgeschlossen. Zwei Monate zuvor hatte der Anbieter automatisierte Ergebnisse bereits in drei Stufen aufgeteilt — Assisted Escalation, Contained Resolution und Verified Resolution, die einzige, die Ihr Kontingent verbraucht — wobei das Urteil von einem LLM nach einem 72-Stunden-Fenster ohne Kundenreaktion gefällt wird. Nimmt man beides zusammen, verkauft ein einziges Unternehmen Ihnen den AI-Agenten, definiert, was als Resolution zählt, betreibt das Modell, das über die Erfüllung dieser Definition entscheidet, stellt die Rechnung und verkauft zusätzlich das Quality-Assurance-Produkt, das die gesamte Konstruktion bewertet.

Das ist kein Vorwurf der Böswilligkeit. Es ist die Beschreibung eines Messproblems. Dieser Stack ist die Audit-Ebene: Er bewertet jede Konversation, zieht eine Stichprobe aus denen mit der höchsten Fehlerwahrscheinlichkeit, führt ein Abstimmungsbuch, das der Agenten-Anbieter nicht geschrieben hat, und macht aus der Differenz zwischen Maschinen-Score und Menschen-Score eine Kalibrierungsentscheidung statt eines Streits.

Die Form

  • Zendesk ist System of Record und Zähler zugleich. Suite Team kostet $55, Suite Professional $115 pro Agent und Monat bei jährlicher Zahlung. Automated Resolutions sind je nach Plan mit 5, 10 oder 15 pro Agent und Monat enthalten, gedeckelt bei 10.000 pro Jahr, danach $1,50 committed oder $2,00 pay-as-you-go. Jede Zahl in Ihrer Reklamation muss an eine Conversation ID gebunden sein, die hier lebt.
  • Decagon oder Fin (Intercom) ist die bewertete Partei. Welcher Agent auch löst — dieser Stack behandelt seine Ausgabe als Beweismittel, nicht als Reporting. Das direkte Duell der Agenten steht in Decagon vs Fin; die Rollout-Entscheidungen stehen im AI-Support-Agent-Stack.
  • Zendesk QA oder Solidroad ist der Bewerter, und die Wahl ist das ganze Argument. Zendesk QA fährt AutoQA über jede Interaktion inklusive AI-Agenten und Voice, markiert Churn-Risiko und festgefahrene Schleifen über Spotlight, bewertet laufende Konversationen und stellt Bot- und Menschen-Scores in AI Agent QA nebeneinander. Verkauft wird es im Workforce Engagement Bundle zu $50 pro Agent und Monat bei jährlicher Zahlung, das auch Workforce Management abdeckt. Solidroad verkauft zwei getrennte Produktlinien — QA Automation, Coaching und Trainingssimulationen für Menschen; QA and Benchmarking, Prozessverbesserungen und eigene AI Scorecards für Agenten — und verbindet sich direkt mit Decagon, Sierra und Fin, um sie zu bewerten, wobei Richtlinien und Makros aus Guru und Notion importiert werden, damit die Scorecard Ihre tatsächlichen Regeln abbildet. Das Unternehmen hat am 16. April 2026 eine Series A über $25M unter Führung von Hedosophia mit First Round Capital, Y Combinator und Sony Innovation Fund aufgenommen und nennt Ryanair, ŌURA, Crypto.com und ActiveCampaign als Kunden. Preise veröffentlicht es nicht; der einzige Weg zu einer Zahl ist eine Demo.
  • Assembled ist die Kapazitätsebene — und veröffentlicht seine Preise. Workforce Management kostet $25 (Core), $45 (Pro) und $75 (Enterprise) pro Agent und Monat plus eine Plattformgebühr, AI Copilot startet bei $35 pro Agent und Monat, die eigenen AI-Agenten starten bei $0,65 pro Konversation. Das Produkt positioniert sich darüber, interne Agenten, BPO-Dienstleister und AI an einer Stelle zu steuern, was hier aus einem engen Grund zählt: Wenn der Agent 60% des Volumens absorbiert, behalten die Menschen den Rest — und der Rest ist pro Konversation schwerer, als der Durchschnitt es war.
  • n8n zieht die Stichprobe und führt das Buch. Es ist die günstigste Komponente und der einzige Datensatz im Stack, den kein geprüfter Anbieter umschreiben kann.
  • Slack ist der Ort der Kalibrierung. Kein Dashboard, sondern ein wöchentlicher Thread mit genau den Konversationen, bei denen Maschinen-Score und Menschen-Score auseinanderlagen — und am Ende eine Entscheidung.

Benannte Übergaben

  1. Konversation wird in Zendesk geschlossen → Webhook feuert → n8n schichtet die Stichprobe. Zuerst die Risiko-Buckets: innerhalb von sieben Tagen wiedereröffnet, nach Agentenkontakt eskaliert, CSAT von 1 oder 2, Accounts oberhalb einer Umsatzschwelle. Die Zufallsziehung füllt die verbleibende Quote.
  2. Jede Konversation → automatisch an den Bewerter → die gezogene Teilmenge → an einen menschlichen Reviewer. Die Maschine deckt 100% ab, der Mensch den Teil, in dem ein Fehler teuer wird.
  3. Das 72-Stunden-Fenster schließt → Zendesk vergibt eine Stufe → n8n schreibt die Zeile. Conversation ID, Stufe, QA-Score, Flag für Wiedereröffnung binnen sieben Tagen, Eskalations-Flag — in Ihrem eigenen Speicher.
  4. Monatsende → Buch gegen Rechnung abgleichen. Eine als Verified Resolution abgerechnete Konversation, die zusätzlich binnen sieben Tagen eine Wiedereröffnung erzeugt hat, ist eine Position zum Reklamieren, keine Rundung zum Schlucken.
  5. Maschinen-Score weicht um mehr als den vereinbarten Schwellenwert vom Menschen-Score ab → das Paar geht in den Kalibrierungs-Thread in Slack. Das Ergebnis ist ein korrigierter Mensch, eine korrigierte Scorecard oder ein korrigierter Prompt.
  6. QA markiert eine Wissenslücke → Coaching-Zuweisung für Menschen, Scorecard-Revision für den Agenten. Derselbe Befund, zwei verschiedene Wege der Behebung, weil ein Mensch ohne Kontext und ein Bot ohne Kontext unterschiedlich scheitern.

Kostenbasis

Eine Support-Organisation mit 12 Agenten und 6.000 Konversationen pro Monat, von denen der Agent 3.600 übernimmt und 2.400 als Verified Resolutions landen:

  • Zendesk QA über das Workforce Engagement Bundle: $50 × 12 Seats × 12 Monate = $7.200 pro Jahr, Workforce Management inklusive.
  • Assembled Pro stattdessen, wenn Sie die Kapazitätsebene separat kaufen: $45 × 12 × 12 = $6.480 pro Jahr plus eine nicht veröffentlichte Plattformgebühr. Fordern Sie diese Gebühr als eigene Position an, bevor Sie sie mit dem Bundle vergleichen.
  • Solidroad: nur auf Angebot. Kalkulieren Sie gegen das Zendesk-Bundle als Referenz und lassen Sie den Anbieter bei etwas anderem als dem Preis gewinnen — der Grund zu kaufen ist, dass er nicht dem Unternehmen berichtet, das Ihre Resolution-Rechnung schickt.
  • n8n Pro: €60 pro Monat für 10.000 Executions, rund €720 pro Jahr.
  • Menschliche Review-Zeit: 2% von 6.000 Konversationen sind 120 Reviews pro Monat; bei acht Reviews pro Stunde sind das 15 Stunden, etwa ein Zehntel eines FTE. Das ist die Position, die alle vergessen, und die einzige, die den Scores Bedeutung gibt.

Jetzt die unbequeme Rechnung. Diese 2.400 Verified Resolutions kosten $3.600 pro Monat zum Committed-Satz, $43.200 pro Jahr. Wenn 5% davon zugunsten des Anbieters falsch eingestuft sind, bringt die vollständige Rückforderung rund $2.160 pro Jahr gegen eine Audit-Ebene, die $8.000 oder mehr kostet. Der Rechnungsstreit finanziert diesen Stack nicht. Was ihn finanziert, ist die Wiedereröffnung: Eine als gelöst abgerechnete Konversation, die zurückkommt, wird zweimal bezahlt — einmal vom Zähler und einmal von dem Menschen, der sie danach bearbeitet. Bewerten Sie den Stack gegen Wiedereröffnungsvolumen und CSAT-Erholung und behandeln Sie die Rechnungsgenauigkeit als das Nebenprodukt, das sie ist.

Varianten und wann Sie tauschen

  • Zendesk QA, wenn Sie ohnehin komplett auf Zendesk laufen und der Agent von jemand anderem stammt. Wenn Decagon oder Fin löst, bewertet Zendesk QA den Bot eines Wettbewerbers statt den des eigenen Arbeitgebers, und das Unabhängigkeitsproblem verschwindet weitgehend. Die $50 des Bundles absorbieren zusätzlich Workforce Management und streichen die Assembled-Position vollständig.
  • Solidroad, wenn Agent und Helpdesk vom selben Anbieter kommen. Zendesks eigene AI-Agenten mit Zendesk QA zu betreiben heißt, dass dasselbe Unternehmen die Ergebnisdefinition, das Urteil, die Rechnung und das Zeugnis besitzt. Genau dann rechtfertigt die Scorecard einen zweiten Vertrag bei einem zweiten Anbieter.
  • Assembled unter etwa 15 Agenten weglassen. Ein Forecast, der in eine Tabelle passt, braucht keine Plattform. Holen Sie es zurück, sobald BPO-Dienstleister ins Spiel kommen, denn fremdgesteuerte Headcount ist die Stelle, an der Forecast-Fehler zum SLA eines anderen werden.
  • n8n durch native Helpdesk-Trigger ersetzen nur so lange, wie die Stichprobenregel aus einem System liest. Sobald die Stichprobe vom Account-Umsatz im CRM oder von Wiedereröffnungsdaten aus einem zweiten Tool abhängt, bleibt n8n.

Was dieser Stack nicht ersetzt

  • Er entscheidet nicht, was der Agent lösen darf. Das Intent-Scoping ist das Ticket-Deflection-Agent-Template.
  • Er rollt den Agenten nicht aus und besitzt den Eskalationspfad nicht. Das ist der AI-Support-Agent-Stack, den dieser hier prüft.
  • Er hält keine Kunden. Ein gelöstes Ticket ist kein verlängerter Vertrag — siehe den Customer-Retention-Stack.
  • Er schreibt die Scorecard nicht. Jede Ebene hier setzt voraus, dass jemand entschieden und aufgeschrieben hat, was gut ist.
  • Er ersetzt keine Führungskraft, die Konversationen liest. Er ersetzt eine Führungskraft, die eine bequeme Stichprobe liest und das QA-Programm nennt.

Fallstricke, jeder mit einer Absicherung

  • Bewerter und Bewerteter können dasselbe Unternehmen sein. Zendesk besitzt Forethought seit dem 26. März 2026 und verkauft das QA-Produkt, das AI-Agenten bewertet. Absicherung: Halten Sie das Abstimmungsbuch in einem Speicher, in den der Agenten-Anbieter nicht schreiben kann, oder kaufen Sie den Bewerter bei einem anderen Unternehmen als den Agenten.
  • AutoQA-Scores sind Modellurteile und verschieben sich, wenn Modell oder Prompt sich verschieben. Eine Scorecard-Revision kann Ihren Durchschnitt bewegen, ohne dass sich ein einziger Agent anders verhält. Absicherung: Frieren Sie ein Gold Set aus 50 handbewerteten Konversationen ein und lassen Sie es nach jeder Scorecard- oder Modelländerung erneut laufen; eine Verschiebung im eingefrorenen Set ist eine Messänderung, keine Leistungsänderung.
  • 100% Abdeckung nimmt die Ausrede der Stichprobe, nicht deren Verzerrung. Menschliche Reviews driften weiter zu kurzen, gut lesbaren Konversationen. Absicherung: Machen Sie die Risikoschichten zu verbindlichen Quoten im n8n-Sampler — Wiedereröffnungen, Eskalationen, niedriger CSAT, wertvolle Accounts — und lassen Sie die Zufallsziehung nur den Rest füllen.
  • Abrechnungsstufe und QA-Score kommen auf verschiedenen Uhren an. Die Stufe landet 72 Stunden nach der letzten Nachricht, der Score sofort. Absicherung: Binden Sie jede Zeile an die Conversation ID und gleichen Sie monatlich ab. Ein wöchentlicher Abgleich liest Latenz als Abweichung.
  • QA nach menschlichen Seats wird pro Arbeitseinheit teurer, je mehr Volumen der Agent absorbiert. Bei $50 pro Agent und Monat, 12 Seats und steigendem Bot-Anteil zahlen Sie dasselbe für eine schrumpfende menschliche Last. Absicherung: Prüfen Sie, ob Ihr QA-Vertrag Seats oder Konversationen misst, bevor der AI-Anteil 50% überschreitet, und verhandeln Sie an diesem Punkt neu statt zur Verlängerung.
  • Coaching gegen eine Rubrik, die niemand gelesen hat, ist eine verkappte Leistungsbeurteilung. Absicherung: Veröffentlichen Sie die Scorecard im Team, bevor sie jemanden bewertet, und behandeln Sie den ersten Monat der Scores als Kalibrierungsdaten statt als Leistungsdaten. Wenn eine konkrete Eskalation schiefgeht, fahren Sie das Escalation RCA.

Passungsregeln

Die richtige Wahl, wenn: Sie 2.000 Konversationen pro Monat oder mehr fahren, mindestens ein Teil Ihres Resolution-Volumens ergebnisbasiert abgerechnet wird, Menschen und AI dieselbe Queue anfassen und irgendwann jemand — ein CFO, ein Board, ein Verlängerungsgremium — fragen wird, woher Sie wissen, dass die Deflection-Zahl echt ist. Am besten passt das bei 10 bis 50 Support-Seats, wo der Zähler groß genug ist und keine Analytics-Funktion existiert, die eine Scoring-Pipeline selbst baut.

Die falsche Wahl, wenn: Sie einige hundert Konversationen pro Monat bearbeiten und eine Führungskraft alle schwierigen davon lesen kann, oder Ihr Support rein menschlich zu festen Seat-Preisen läuft, wo die Audit-Ebene mehr kostet als die Genauigkeit, die sie kauft. Falsch ist sie auch, wenn niemand die Scorecard verantwortet — eine herrenlose Rubrik erzeugt Scores, die alle stillschweigend ignorieren, und Sie hätten ein zweites Dashboard gekauft, das neben dem des Anbieters ignoriert wird.

Wenn Sie nur eine Sache tun können: Bewerten Sie 50 Konversationen von Hand gegen eine schriftliche Rubrik und heben Sie sie auf. Dieses Gold Set kostet einen Tag, braucht keinen Vertrag und ist der einzige Weg herauszufinden, ob irgendein später gekaufter Bewerter — anbietereigen oder nicht — mit Ihnen darin übereinstimmt, was eine Resolution ist. Kombiniert mit CSAT auf agentenbearbeiteten Konversationen haben Sie die zwei Zahlen, die es überstehen, wenn ein Anbieter seine Definitionen ändert.