El plan: Cómo Voicify hace que la realización de pedidos con inteligencia artificial sea una experiencia agradable para los clientes.
ARCHITECT ANÁLISIS DESTACADO

El plan: Cómo Voicify hace que la realización de pedidos con inteligencia artificial sea una experiencia agradable para los clientes.

POR

Aadu Pirn

FUENTE

Cloud Blog

DATE

READ

6 min de lectura

Voicify transforma las llamadas telefónicas tradicionales en experiencias fluidas utilizando IA y tecnologías en la nube. Fundada en 2018, la empresa inicialmente se centró en la creación de asistentes basados en voz, …

Bienvenido a The Blueprint, una nueva función en la que destacamos cómo los clientes de Google Cloud abordan desafíos únicos y comunes en diversas industrias utilizando las últimas tecnologías de IA y en la nube. Esperamos inspirar a otros que buscan innovar en su trabajo. Fundada en 2018, Voicify reimagina la llamada telefónica tradicional con el objetivo de transformar cada llamada en una experiencia fluida y atractiva. El desafío: Cuando comenzamos Voicify en 2018, nuestra visión era ayudar a las organizaciones a construir asistentes de voz confiables, pragmáticos y técnicamente fundamentados para cualquier canal, incluyendo teléfonos y chat. Pero la pandemia cambió todo. Nos enfocamos principalmente en casos de uso telefónicos en los sectores de restaurantes y atención médica, donde, en ese momento, el volumen y el personal eran desafíos significativos. Los restaurantes podían perder hasta el 20% de sus llamadas y pedidos como resultado, y los proveedores de atención médica tenían dificultades para mantenerse al día con el volumen de llamadas con la precisión requerida del 100% al integrar información de citas en un sistema de gestión de prácticas. Nos dimos cuenta de que los asistentes de IA especializados y con fines específicos eran la clave para que las empresas mantuvieran un excelente servicio a escala. Para tener éxito, teníamos que superar cuatro desafíos principales: Precisión transaccional: Nuestro asistente de voz necesitaba razonar con solicitudes complejas de los clientes contra sistemas de punto de venta y gestión de prácticas con 100% de precisión. Gestión de picos de tráfico: El uso de nuestro LLM necesitaba ser provisionado con precisión para mantener los costos y mantener los servicios al cliente a pesar de los comunes (y extremos) picos de tráfico que se ven en restaurantes y organizaciones de atención médica. Latencia: Cualquier retraso en la respuesta del asistente puede hacer que los clientes cuelguen. Necesitábamos un tiempo de primer token súper rápido, con la mínima demora desde cuando un usuario envía una solicitud de voz o texto hasta cuando el modelo de IA genera su primer resultado. Seguridad y cumplimiento: Desde nuestra fundación en 2018, hemos asegurado que cumplimos con HIPAA, SOC2, ISO27001 y PCI, y que nuestra seguridad es de nivel empresarial. Necesitábamos una arquitectura y una infraestructura que emplearan todas las salvaguardas posibles para proteger la integridad y la seguridad de los datos. La solución: Nuestra plataforma de orquestación conversacional construye y valida los pedidos de restaurantes contra un sistema de punto de venta antes de la entrega para garantizar la precisión. Bajo el capó, Gemini Flash, servido a través de Gemini Enterprise Agent Platform, mejora drásticamente la latencia, minimizando los tiempos de espera del usuario y evitando que cuelguen. Además, vemos ahorros de aproximadamente un 25% a un 30% en comparación con nuestro uso anterior de otros LLM, y también con mayor confiabilidad. Para hacer crecer el negocio y el volumen de llamadas, y para manejar los picos de tráfico, pasamos de Google AI Studio a Vertex AI y su actual versión en Gemini Enterprise. Queríamos las garantías empresariales que proporcionaba la última, que necesitábamos para escalar así como para la seguridad y el cumplimiento para nuestros clientes de atención médica. Las características específicas de la plataforma Gemini Enterprise Agent Platform nos ayudan a gestionar altos volúmenes de llamadas sin experimentar interrupciones del servicio o respuestas perdidas. Estos servicios de nivel empresarial pueden haber tenido un mayor costo que AI Studio, pero valieron la pena para garantizar una disponibilidad confiable y la funcionalidad de pago según el uso facilitó el escalado. Por ejemplo, utilizamos una combinación de capacidad provisionada y pago según el uso con Vertex AI para acomodar el uso máximo el día antes del Día de Acción de Gracias, y no experimentamos problemas de limitación de velocidad. La arquitectura: El resultado: Gemini ha reducido la carga sobre nuestras herramientas de programación internas para extraer contexto y construir menús. Hemos visto mejoras significativas en el rendimiento y la confiabilidad, con menor latencia y mayor confiabilidad con Gemini. Y, la mayor estabilidad de nuestros asistentes potenciados con Gemini ha hecho que el proceso de incorporación de clientes sea mucho más eficiente. Ahora solo toma uno o dos días preparar un restaurante para probar después de obtener acceso al sistema POS, en comparación con lo que anteriormente tomaba de uno a dos semanas. Con las soluciones de Google para escalar y servicios de nivel empresarial, hemos optimizado nuestro métrico de tiempo para el primer token, minimizando los tiempos de espera del cliente. Al utilizar las capacidades de capacidad provisionada y pago según el uso de Vertex AI, hemos asegurado un 100% de disponibilidad, prevenido respuestas perdidas y problemas de limitación de velocidad, incluso durante períodos de uso máximo. Ahora podemos gestionar fácilmente la naturaleza irregular del tráfico de restaurantes. En términos de tecnología, anticipamos movernos más allá de la captura conversacional de pedidos para una asistencia más proactiva, utilizando el contexto de las conversaciones o las actividades de POS. ¿Algún día pronto, tu pedido típico de la cena de los viernes de tu restaurante japonés favorito, podría ser realizado proactivamente por un asistente de voz de Voicify para ti. Los detalles: Nuestro enfoque de la industria presenta varios desafíos únicos que tuvimos que resolver en el backend. El componente principal de nuestras soluciones Voicify es nuestra plataforma de orquestación de voz, que gestiona todo el pila de IA para teléfonos y está diseñada para una escalabilidad y seguridad de nivel empresarial. Este es también el nodo donde se llaman las soluciones de la industria dependiendo de las necesidades del usuario. Nuestra plataforma de orquestación de voz está cerca del cliente y coordina los servicios de backend como Gemini y los diferentes componentes del asistente de voz. La utilizamos para gestionar funciones como el reconocimiento de voz, la conversión de texto a voz y la generación de texto, que no es puramente generativa pero incluye elementos programáticos. Una de las decisiones arquitectónicas únicas que tomamos fue cómo gestionar grandes y complejos menús de restaurantes. Decidimos evitar poner todo el menú en un único prompt, y incluimos solo cierta información en el prompt inicial y luego recopilamos más detalles a medida que la conversación progresa. Esto mejora los tiempos de respuesta y ayuda a gestionar la complejidad de los pedidos más grandes al centrarse solo en las partes relevantes de cada menú en una interacción. También diseñamos la arquitectura desde el principio de nuestra empresa para cumplir con los altos estándares de los clientes empresariales para la seguridad y el cumplimiento, particularmente en atención médica. Nos aseguramos de que nuestra escalabilidad sea de nivel empresarial. Arquitectónicamente también estamos empleando todas las salvaguardas para garantizar la integridad y la seguridad de los datos. Por último, nuestra plataforma está diseñada para soportar un entorno multicloud como parte de nuestra estrategia para lograr el máximo nivel de disponibilidad.