El 26 de marzo de 2026, Zendesk cerró la adquisición de Forethought. Dos meses antes ya había dividido los resultados automatizados en tres niveles — assisted escalation, contained resolution y verified resolution, el único que consume tu cupo — con el veredicto producido por un LLM tras una ventana de 72 horas sin respuesta del cliente. Junta los dos hechos y resulta que una sola compañía te vende el agente de AI, define qué cuenta como resolución, ejecuta el modelo que decide si se cumplió esa definición, emite la factura y vende el producto de quality assurance que califica todo el arreglo.
Esto no es una acusación de mala fe. Es la descripción de un problema de medición. Este stack es la capa de auditoría: puntúa cada conversación, muestrea las que tienen más probabilidad de estar mal, mantiene un libro de reconciliación que no escribió el proveedor del agente y convierte la diferencia entre la puntuación de la máquina y la del humano en una decisión de calibración en lugar de una discusión.
La forma
- Zendesk es el sistema de registro y el medidor. Suite Team cuesta $55 y Suite Professional $115 por agente al mes pagado por año. Las automated resolutions se incluyen a razón de 5, 10 o 15 por agente al mes según el plan, con un tope de 10.000 al año, y después se facturan a $1,50 comprometido o $2,00 pay-as-you-go. Cada número de tu disputa tiene que estar ligado a un conversation ID que vive aquí.
- Decagon o Fin (Intercom) es la parte calificada. Resuelva quien resuelva, este stack trata su salida como evidencia y no como reporte. El cara a cara entre los agentes está en Decagon vs Fin; las decisiones de despliegue viven en el AI support agent stack.
- Zendesk QA o Solidroad es el calificador, y cuál elijas es todo el argumento. Zendesk QA ejecuta AutoQA sobre cada interacción, incluidas las de agentes de AI y voz, marca riesgo de churn y bucles atascados con Spotlight, puntúa conversaciones en vivo y pone las puntuaciones de bot y humano lado a lado en AI Agent QA. Se vende dentro del Workforce Engagement Bundle a $50 por agente al mes pagado por año, que también cubre workforce management. Solidroad vende dos líneas separadas — QA automation, coaching y simulaciones de entrenamiento para humanos; QA and benchmarking, mejoras de proceso y scorecards de AI personalizadas para agentes — y se conecta directamente a Decagon, Sierra y Fin para evaluarlos, importando políticas y macros desde Guru y Notion para que la scorecard refleje tus reglas reales. Levantó una Serie A de $25M el 16 de abril de 2026 liderada por Hedosophia con First Round Capital, Y Combinator y Sony Innovation Fund, y nombra a Ryanair, ŌURA, Crypto.com y ActiveCampaign como clientes. No publica precios; el único camino a un número es una demo.
- Assembled es la capa de capacidad, y sí publica sus precios. Workforce management va a $25 (Core), $45 (Pro) y $75 (Enterprise) por agente al mes más una tarifa de plataforma, AI Copilot arranca en $35 por agente al mes y sus propios agentes de AI arrancan en $0,65 por conversación. Se vende como la plataforma que gestiona agentes internos, proveedores BPO y AI en un solo lugar, lo que aquí importa por una razón concreta: cuando el agente absorbe el 60% del volumen, los humanos se quedan con el residuo, y el residuo es más difícil por conversación de lo que era el promedio.
- n8n arma la muestra y mantiene el libro. Es el componente más barato y el único registro del stack que ningún proveedor auditado puede reescribir.
- Slack es donde ocurre la calibración. No un dashboard: un hilo semanal con las conversaciones en las que la puntuación de la máquina y la del humano no coincidieron, y una decisión al final.
Handoffs nombrados
- La conversación se cierra en Zendesk → se dispara el webhook → n8n estratifica la muestra. Primero los buckets de riesgo: reabiertas en siete días, escaladas después de pasar por el agente, CSAT de 1 o 2, cuentas por encima de un umbral de ingresos. El sorteo aleatorio llena la cuota que quede.
- Cada conversación → al calificador, de forma automática → el subconjunto muestreado → a un revisor humano. La máquina cubre el 100%; el humano cubre la parte donde equivocarse sale caro.
- Se cierra la ventana de 72 horas → Zendesk asigna un nivel → n8n escribe la fila. Conversation ID, nivel, puntuación de QA, marca de reapertura en siete días, marca de escalación, en tu propio almacén.
- Fin de mes → reconcilia el libro contra la factura. Una conversación facturada como verified resolution que además produjo una reapertura dentro de siete días es una línea que se reclama, no un redondeo que se absorbe.
- La puntuación de la máquina se aleja de la del humano más allá del umbral acordado → el par va al hilo de calibración en Slack. La salida es un humano corregido, una scorecard corregida o un prompt corregido.
- QA marca un hueco de conocimiento → asignación de coaching para humanos, revisión de scorecard para el agente. El mismo hallazgo, dos rutas de remediación distintas, porque un humano sin contexto y un bot sin contexto fallan de maneras diferentes.
Línea base de costos
Una organización de soporte de 12 agentes con 6.000 conversaciones al mes, donde el agente toma 3.600 y 2.400 terminan como verified resolutions:
- Zendesk QA vía el Workforce Engagement Bundle: $50 × 12 asientos × 12 meses = $7.200 al año, y workforce management viene incluido.
- Assembled Pro en su lugar, si compras la capa de capacidad por separado: $45 × 12 × 12 = $6.480 al año más una tarifa de plataforma no publicada. Pide esa tarifa como línea aparte antes de compararla con el bundle.
- Solidroad: solo por cotización. Presupuesta contra el bundle de Zendesk como referencia y exige que el proveedor gane en algo distinto al precio — la razón para comprarlo es que no le rinde cuentas a la compañía que te envía la factura de resoluciones.
- n8n Pro: €60 al mes por 10.000 ejecuciones, alrededor de €720 al año.
- Tiempo de revisión humana: muestrear el 2% de 6.000 conversaciones son 120 revisiones al mes; a ocho revisiones por hora son 15 horas, cerca de una décima de un FTE. Es la línea que todos olvidan y la única que le da sentido a las puntuaciones.
Ahora la aritmética incómoda. Esas 2.400 verified resolutions cuestan $3.600 al mes a la tarifa comprometida, $43.200 al año. Si el 5% está mal clasificado a favor del proveedor, recuperarlo todo devuelve unos $2.160 al año frente a una capa de auditoría que cuesta $8.000 o más. La disputa de facturación no paga este stack. Lo que lo paga es la reapertura: una conversación facturada como resuelta que regresa se cobra dos veces, una por el medidor y otra por el humano que después la atiende. Evalúa el stack contra el volumen de reaperturas y la recuperación de CSAT, y trata la exactitud de la factura como el subproducto que es.
Variaciones y cuándo cambiar
- Zendesk QA cuando ya eres todo-Zendesk y el agente es de otro. Si Decagon o Fin es quien resuelve, Zendesk QA califica al bot de un competidor y no al de su empleador, y el problema de independencia prácticamente desaparece. Los $50 del bundle además absorben workforce management, lo que elimina por completo la línea de Assembled.
- Solidroad cuando el agente y el helpdesk son del mismo proveedor. Correr los agentes de AI de Zendesk con Zendesk QA significa que la misma compañía posee la definición del resultado, el veredicto, la factura y el boletín de calificaciones. Ese es el caso donde pagarle a un segundo proveedor por la scorecard justifica el segundo contrato.
- Saca a Assembled por debajo de unos 15 agentes. Un forecast que cabe en una hoja de cálculo no necesita plataforma. Reincorpóralo en cuanto entren proveedores BPO, porque la plantilla gestionada por terceros es donde el error de forecast se convierte en el SLA de otro.
- Cambia n8n por triggers nativos del helpdesk solo mientras la regla de muestreo lea de un solo sistema. En cuanto la muestra dependa de los ingresos de cuenta en el CRM o de datos de reapertura de una segunda herramienta, quédate con n8n.
Lo que este stack no reemplaza
- No decide qué puede resolver el agente. El alcance de intents es el ticket deflection agent template.
- No despliega el agente ni es dueño del camino de escalación. Eso es el AI support agent stack, al que este audita.
- No retiene clientes. Un ticket resuelto no es un contrato renovado — mira el customer retention stack.
- No escribe la scorecard. Cada capa de aquí asume que alguien decidió qué es bueno y lo puso por escrito.
- No reemplaza a un manager leyendo conversaciones. Reemplaza a un manager leyendo una muestra de conveniencia y llamándola programa de QA.
Puntos de vigilancia, cada uno con su guardia
- El calificador y el calificado pueden ser la misma compañía. Zendesk es dueña de Forethought desde el 26 de marzo de 2026 y vende el producto de QA que puntúa agentes de AI. Guardia: mantén el libro de reconciliación en un almacén donde el proveedor del agente no pueda escribir, o compra el calificador a una compañía distinta de la del agente.
- Las puntuaciones de AutoQA son juicios de modelo, y se mueven cuando se mueve el modelo o el prompt. Una revisión de scorecard puede desplazar tu promedio sin que un solo agente se comporte distinto. Guardia: congela un gold set de 50 conversaciones puntuadas a mano y vuelve a correrlo después de cada cambio de scorecard o de modelo; un desplazamiento en el set congelado es un cambio de medición, no de desempeño.
- La cobertura del 100% elimina la excusa del muestreo pero no su sesgo. La revisión humana sigue derivando hacia conversaciones cortas y legibles. Guardia: haz que los estratos de riesgo sean cuotas obligatorias en el muestreador de n8n — reaperturas, escalaciones, CSAT bajo, cuentas de alto valor — y deja que el sorteo aleatorio llene solo el resto.
- El nivel de facturación y la puntuación de QA llegan en relojes distintos. El nivel aterriza 72 horas después del último mensaje; la puntuación aterriza de inmediato. Guardia: liga cada fila al conversation ID y reconcilia mensualmente. Reconciliar cada semana hace pasar por discrepancia lo que es latencia.
- QA cobrada por asiento humano se encarece por unidad de trabajo a medida que el agente absorbe volumen. A $50 por agente al mes, con 12 asientos y una participación creciente del bot, pagas lo mismo por una carga humana que se encoge. Guardia: revisa si tu contrato de QA mide asientos o conversaciones antes de que la participación de AI pase el 50%, y renegocia en ese cruce y no en la renovación.
- Hacer coaching contra una rúbrica que nadie ha leído es una evaluación de desempeño disfrazada. Guardia: publica la scorecard al equipo antes de que califique a nadie, y trata el primer mes de puntuaciones como datos de calibración y no de desempeño. Cuando una escalación concreta salga mal, corre el escalation RCA.
Reglas de encaje
Es la elección correcta cuando: manejas 2.000 conversaciones al mes o más, al menos parte de tu volumen de resolución se factura por resultado, humanos y AI tocan la misma cola, y alguien — un CFO, un board, un comité de renovación — terminará preguntando cómo sabes que el número de deflection es real. Encaja mejor entre 10 y 50 asientos de soporte, donde el medidor pesa lo suficiente y no hay función de analytics que construya un pipeline de scoring en casa.
Es la elección equivocada cuando: manejas unos pocos cientos de conversaciones al mes y un manager puede leer todas las difíciles, o tu soporte es enteramente humano con precio plano por asiento, donde la capa de auditoría cuesta más que la exactitud que compra. También es la elección equivocada si nadie va a ser dueño de la scorecard — una rúbrica sin dueño produce puntuaciones que todos ignoran en silencio, y habrás comprado un segundo dashboard para ignorar junto al del proveedor.
Si solo puedes hacer una cosa: puntúa a mano 50 conversaciones contra una rúbrica escrita y guárdalas. Ese gold set cuesta un día, no necesita contrato y es la única forma de averiguar si cualquier calificador que compres después — propiedad de un proveedor o no — coincide contigo en qué es una resolución. Combínalo con CSAT en las conversaciones atendidas por el agente y tienes los dos números que sobreviven a que un proveedor cambie sus definiciones.