Saltar al contenido
ai-agent.review — AI Agent Reviews, inicio
← Todas las noticias

Investigación

La beta de evaluación de agentes de CX de G2 separa los resultados de tareas de las reseñas de compradores

Declarado por el proveedorComprobado: 2026-10-06[g2-launch][g2-method]

Atribución editorial: Gosia Madej

Preparado con ayuda de IA. La atribución editorial no implica que se hayan probado personalmente los productos ni revisado manualmente todas las noticias.

Publicado: · Fecha del acontecimiento:

El anuncio del 14 de septiembre presentó una beta pública. Consultada el 7 de octubre, su clasificación general de CX muestra a Tidio y Retell empatados con 200 puntos.

Evaluación editorialComprobado: [g2-launch][g2-board]

Dos pilas iguales de fichas que representan tareas completadas aparecen junto a una lupa y, por separado, un globo de comentarios de clientes.
Ilustración editorial original sobre evidencias de tareas y comentarios de compradores presentados por separado; no es una interfaz de G2 ni un gráfico de puntuaciones de productos. · AI Agent ReviewsUso de imágenes y permisos

G2 describió su primera clasificación de agentes de experiencia del cliente como disponible en beta pública el 14 de septiembre. La documentación fechada el 8 de septiembre ya describía el programa, así que aquí se usa el 14 de septiembre como fecha del anuncio fechado, no como una fecha de primer acceso verificada. Este es un análisis del lanzamiento de septiembre, no de un lanzamiento de hoy.

Declarado por el proveedorComprobado: [g2-launch][g2-docs]

La clasificación general muestra actualmente nueve agentes evaluados. Tidio y Retell tienen 200 puntos Overall cada uno, seguidos por LiveAgent con 195. Aunque la presentación coloca a Tidio en primer lugar y a Retell en segundo, sus totales publicados son iguales. G2 asigna a Tidio un 87 %/92 % en precisión/cumplimiento y a Retell un 86 %/90 %; son dimensiones distintas, no pruebas de superioridad universal.

Informe independienteComprobado: [g2-board]

La nota de puntuación de G2 del 22 de septiembre describe 46 tareas de soporte en una empresa simulada con 38 herramientas. Cada tarea estándar superada suma cinco puntos, por lo que el máximo actual es 230; 200 representa, por tanto, 40 tareas superadas, no un 200 %. Las tareas fallidas o ausentes reciben cero puntos. G2 afirma que actualmente cada tarea se ejecuta una vez y que prevé realizar pruebas repetidas.

Declarado por el proveedorComprobado: [g2-scoring][g2-method]

La precisión mide el respaldo probatorio de las afirmaciones, el cumplimiento comprueba la política proporcionada y la relevancia mide el enfoque en la necesidad del cliente; G2 utiliza evaluadores basados en modelos de lenguaje para estas dimensiones. La exhaustividad comprueba de forma determinista los resultados esperados del sistema. Las dimensiones complementarias se normalizan como porcentajes y son independientes de los puntos Overall. Las valoraciones de compradores constituyen una tercera señal y no modifican la puntuación de la evaluación.

Declarado por el proveedorComprobado: [g2-method]

El lanzamiento tiene limitaciones importantes para las comparaciones. El anuncio de G2 dice que la configuración beta favorece a los agentes sin interfaz y que todavía no representa plenamente los flujos de trabajo establecidos y configurados. La nota de puntuación describe un conjunto distinto de tareas minoristas para agentes de comercio electrónico. La documentación de G2 indica que las evaluaciones de proveedores son gratuitas durante la beta y que prevé cobrar por ellas más adelante.

Declarado por el proveedorComprobado: [g2-launch][g2-scoring][g2-docs]

Contrastado con las fuentes

Verificación de fuentes asistida por IA

La revisión asistida por IA examinó el anuncio de G2, su documentación, la clasificación, la explicación de puntuación, el borrador técnico y la página del resultado de Tidio. G2 opera el programa y evalúa como tercero los productos incluidos. Estas páginas proceden de una misma fuente informativa; no repetimos el benchmark ni auditamos su calificación de forma independiente.

Evaluación editorialComprobado: [g2-launch][g2-board][g2-method][g2-scoring][g2-docs][g2-tidio][g2-draft]

Las fechas corresponden a hechos distintos: la página de resultados de Tidio fecha su ejecución el 6 de agosto, mientras que el anuncio y la explicación de puntuación aparecieron en septiembre. El PDF técnico enlazado, fechado el 20 de agosto, está marcado como borrador y describe métodos de combinación de puntuaciones distintos de la explicación más reciente basada en aprobado/suspenso. Para los puntos actuales usamos la explicación publicada más reciente y señalamos la discrepancia documental, en lugar de combinar las fórmulas sin indicarlo.

Evaluación editorialComprobado: [g2-tidio][g2-scoring][g2-draft]

Evidencia de las fuentes

Fragmento de la fuente original. Esto muestra lo que afirma la fuente, pero no demuestra el rendimiento del producto.

Our first leaderboard for Customer Experience AI Agents is live in beta.

Leer la fuente original [g2-launch]

Qué cambia para los usuarios

Usa estos datos como referencia para elaborar una lista de opciones y luego inspecciona los registros de las tareas y confirma que la configuración, la fecha y el caso de uso evaluados coincidan con tu despliegue previsto. Una tarea aprobada aún puede contener un error de política: el total general y las dimensiones complementarias responden a preguntas distintas. Exige pruebas repetidas con tus propias políticas antes de inferir fiabilidad en producción, ahorro de costes o retorno de la inversión; esta instantánea no demuestra ninguno de esos resultados.

Evaluación editorialComprobado: [g2-method][g2-scoring]

Fuentes