- Démarrage
- Agents conversationnels UiPath
- Agents UiPath dans Studio Web
- À propos des agents UiPath
- Licences
- Agents avancés (aperçu)
- Exécuter des agents
- Agents et workflows
- Meilleures pratiques pour créer des agents
- Choix du meilleur modèle pour votre agent
- Meilleures pratiques pour la publication et le déploiement d’agents
- Meilleures pratiques en matière d’ingénierie contextuelle
- Meilleures pratiques pour DeepRAG et la transformation par lots : JIT vs. stratégies basées sur l’index
- Utiliser des fichiers
- Contextes
- Escalades
- Évaluations
- Traçages d’agent
- Score de l’agent
- Agents codés UiPath
- Créer avec des agents codés
Voix (Aperçu)
Des agents conversationnels vocaux en temps réel qui gèrent les appels entrants et passent les appels sortants, intégrés à Maestro Flow avec le nœud d'agent de reconnaissance optique des caractères.
Un agent conversationnel gère les conversations téléphoniques en temps réel. Les appelants composent un numéro qui vous appartient et l'agent peut exécuter des outils pendant l'appel pour lire ou mettre à jour les données en direct.
Mode de fonctionnement
Un agent vocal s'exécute sur un modèle de reconnaissance vocale en temps réel. L'audio est transmis directement au modèle, sans pipeline de syntaxe-raison-s propose distinct entre les deux. C’est ce qui rend la conversation suffisamment rapide pour que l’appelant puisse s’interrompre. Les outils s'exécutent en dehors de ce chemin audio, sur le moteur d'exécution de l'agent partagé qui répond aux appels d'outils pour chaque type d'agent.
Vous apportez le numéro de téléphone sur un tronc SIP ou à partir de votre propre compte Twilio. L'appel est transmis à UiPath, qui conserve la session du modèle pendant sa durée et exécute les outils de l'agent.
Les agents conversationnels vocaux sont créés dans Maestro Flow, et non dans Agent Builder. Il n'y a pas d'agent vocal distinct à publier ou à importer.
- Créer dans Maestro Flow — modélisation de l'appel avec l' Agent vocal, Appel entrant, Créer un appel sortant et Nœuds d'appel de fin . Le modèle, le persona, la requête et les outils sont configurés sur le nœud de l'agent vocal .
- Déploiement : connecter un numéro de téléphone via SIP ou votre propre compte Twilio et le lier à un flux publié.
- Observabilité — lecture de la transcription d'un appel, des appels d'outils et des synchronisations dans la trace de l'exécution de l'exécution.
Limitations
Nous développons activement le produit avec de nouvelles fonctionnalités. La table ci-dessous décrit les limitations actuelles, dont il est prévu qu'elles soient traitées dans les publications à venir.
| Limitation | Description |
|---|---|
| Durée de l’appel | Les appels sont limités à 10 minutes |
| Enregistrement des appels | Les enregistrements audio des appels ne sont pas disponibles. |
| Transférer l'appel à une personne | Le transfert d'appels en direct vers une personne n'est pas pris en charge. |
| Prise en charge des SDK/surfaces de chat | Les agents vocaux sont disponibles uniquement par appels téléphoniques |
| Automation Suite | Les agents volumineux sont disponibles uniquement dans Automation Cloud. |
FAQ
Quels fournisseurs de téléphone fonctionnent?
Les agents vocaux fonctionnent avec les fournisseurs de téléphone suivants:
- Twilio
- SDK Amazon China
- Génération
- Cinq9
- tous les fournisseurs SIP qui répondent aux exigences du coffre SIP
Fournisseurs qui ne fonctionnent pas:
- Amazon Connect: utilisez plutôt le SDK Amazon volet.
- Azure Communications Services: à moins que vous n’ayez un SBC géré, vous pouvez utiliser.
- Zoom
Quelles langues sont prises en charge?
La couverture linguistique et la qualité dépendent du modèle sélectionné. Par exemple, les modèles Gemini Live prennent en charge 24 langues. La compréhension des accents et la réponse en différents accents sont limitées par les capacités du modèle.
Quels garde-fous et protections de données s'appliquent?
UiPath applique une rétention de données zéro avec tous les fournisseurs d'IA, ce qui signifie qu'aucun son ou transcription n'est stocké avec nos fournisseurs d'IA tels qu'OpenAI et Google.
Les garde-fous au niveau de l'agent ne sont pas disponibles pour les agents vocaux. Cela inclut des garde-fous centralisés dans AI Trust Layer, tels que le masquage des informations permettant d’identifier une personne et des politiques de contenu. Des garde-fous au niveau des outils sont disponibles sur les outils connectés au nœud de l' agent vocal . Voir Observabilité.