Guide complet gratuit

agent IA de support client

Concevez agent IA de support client.

00

Points de contrôle de pratique

Le rythme de l’entretien reste compact, pour que la page consacre son attention aux vraies décisions de conception.

  1. 01
    Clarifier le périmètre
  2. 02
    Besoins + échelle
  3. 03
    API + modèle de données
  4. 04
    Dessiner l’architecture
  5. 05
    Deep dive
  6. 06
    Décision de compromis
01

Les besoins qui façonnent la conception

Ne vous contentez pas d’énoncer les besoins : demandez-les. Chaque carte associe la contrainte de conception à une question de clarification que vous pouvez dire à voix haute avant de dessiner l’architecture.

Besoins fonctionnels

01L'agent répond-il à tout, ou trie-t-il d'abord ?

Triage d'abord : chaque message entrant est classé par intention — répondable depuis les connaissances, nécessite des données de compte, ou relève immédiatement d'un humain (client en colère, menace juridique, risque de churn).

02Que peut réellement FAIRE l'agent sur un compte ?

Uniquement des outils approuvés à entrées typées — vérifier le statut, mettre à jour les paramètres, émettre un remboursement plafonné. Les actions risquées ou irréversibles exigent une confirmation explicite ou un humain.

03Quand un humain doit-il reprendre la main, et que reçoit-il ?

En cas de faible confiance, d'échecs répétés ou sur demande du client, un humain prend le relais. Il reçoit un dossier de passation : la conversation, les sources récupérées, les actions tentées et l'incertitude propre à l'agent. Jamais un départ à froid.

04L'agent se souvient-il des tours précédents — et des conversations précédentes ?

À l'intérieur d'une même conversation, il se souvient toujours de tout — même d'un très long fil. D'une conversation à l'autre, il ne garde que les faits liés au compte, jamais le contenu des échanges précédents, conformément à la politique de rétention.

05Une langue ou plusieurs ?

Le pipeline traite toutes les langues, mais pas l'évaluation. Les golden sets se construisent par locale, car la qualité d'une réponse ne se transfère pas d'une langue à l'autre.

06Un client peut-il exiger un humain à tout moment ?

Toujours. « parler à un humain » est à un tour de distance, à chaque étape. Cacher cette sortie gonfle les métriques de déflexion (la part des conversations qui n'atteignent jamais un humain) tout en détruisant la confiance.

Hors périmètreCanal vocal et parole en temps réel · Entraînement de modèles de fondation personnalisés · Conversations de vente et de marketing (support uniquement)

Besoins non fonctionnels

01Quel est le pire mode de défaillance — être lent, ou avoir tort ?

Avoir tort : une politique inventée ou un remboursement non autorisé coûte plus cher que n'importe quelle latence. L'ancrage, la citation et le contrôle des actions priment sur la fluidité.

02Quelles données l'agent peut-il voir pendant qu'il répond ?

Seulement ce que ce client a le droit de voir. L'accès à la connaissance est cloisonné par tenant et par plan. Les runbooks internes et les données des autres tenants ne doivent jamais apparaître dans une réponse.

03À quelle vitesse les réponses doivent-elles être ressenties ?

Les réponses doivent commencer à apparaître en environ 2 secondes et se terminer bien en dessous de 30 — et tenir cela à environ 10 K conversations par jour.

04Quand quelque chose tourne mal, pouvons-nous reconstituer pourquoi ?

Oui : chaque tour est tracé — requête, chunks récupérés et scores, prompt, appels d'outil avec entrées/sorties, et la décision d'escalade. Les échecs sont rejoués dans le jeu d'évaluation.

05Comment savons-nous que l'agent se dégrade ?

La qualité est vérifiée contre un ensemble de référence de conversations de support à chaque changement de modèle ou de prompt. Rien ne part sans être mesuré. Le taux de déflexion à lui seul n'est pas la qualité.

Continuez à demander — l’entretien est une conversation

Les vrais entretiens sondent bien plus qu’une liste propre. Ces questions de périmètre séparent ceux qui interrogent le problème de ceux qui le récitent.

  • Quel est le contrat d'escalade — en combien de temps un humain doit-il répondre après le transfert ?
  • Quelles sont les règles de rétention des données et de PII pour les journaux de conversation ?
  • Y a-t-il un plafond de coût par conversation — à partir de quand l'agent coûte-t-il plus cher que l'humain qu'il remplace ?
  • Devons-nous nous attendre à des utilisateurs hostiles — des gens qui tentent délibérément de piéger l'agent pour obtenir des remboursements ou faire fuiter des données ?
  • Y a-t-il des pics saisonniers ou de jour de lancement dans le volume de support que nous devons absorber ?
02

Les chiffres qui forcent les décisions d’architecture

Traitez chaque estimation comme une pression qui justifie un composant : cache, file, partition, réplica, pool de workers ou chemin de repli.

01

Économie de la déflexion

10 K conversations/jour (fournies par l'examinateur), l'agent résout entièrement ~60 %, un ticket humain dure ~15 min en moyenne10 K × 60 % = 6 000 résolues/jour ; 6 000 × ~15 min = 90 000 min ≈ 1 500 heures-agent/jour ; à 8 heures par poste ≈ 190 postes de support absorbés

Le dossier commercial vit ou meurt sur la QUALITÉ de résolution — c'est pourquoi la suite d'évaluation est une exigence, pas un outillage.

02

Budget de contexte par tour

~8 K tokens : système + politiques (2 K) + chunks récupérés (4 K) + fenêtre de conversation (2 K)2 K + 4 K + 2 K = 8 K tokens par tour — les chunks récupérés représentent la moitié de tout le budget, donc ces 4 K tokens doivent porter la réponse

La précision de récupération est le vrai levier de qualité — une fenêtre plus grande est un surcoût, pas un correctif.

03

Décomposition de la latence

cibles p95 : récupération 300 ms + rerank 200 ms + premier token 1,5 s≈ 2 s jusqu'au premier token diffusé

Chaque étape a son propre budget et son propre monitoring — « l'IA est lente » n'est pas un diagnostic.

04

Coût de la suite d'évaluation

500 conversations golden × 3 variantes jugées par release500 × 3 = 1 500 exécutions jugées par release — exécutées en parallèle, cela représente quelques minutes de temps mural et quelques dollars de tokens du modèle juge

L'évaluation continue coûte moins cher qu'un seul ticket entreprise mal géré.

05

Charge d'escalade

~40 % des 10 K conversations escaladent4 000/jour routées vers des humains AVEC des paquets de transfert

La qualité du transfert détermine si les humains font confiance à l'agent — un mauvais paquet double leur travail.

Exemple de décision

Les chiffres

Dix mille conversations par jour, et l'agent en résout complètement soixante pour cent. Toute la valeur repose sur le fait que ces résolutions soient JUSTES. Une seule politique de remboursement inventée efface un mois d'économies.

Mon choix

Construire l'agent comme un pipeline à barrières. Il classe d'abord l'intention, récupère avec les propres permissions du client, et ne répond qu'avec des citations. Tout effet de bord passe derrière des outils typés et en liste blanche, avec des paliers de risque appliqués en dehors du modèle. La confiance garde chaque étape : sous le seuil, le client reçoit un humain plus un dossier de passation — la conversation, les sources, les actions tentées et l'incertitude de l'agent. Chaque tour est tracé et rejouable, et les échecs alimentent un golden eval set jugé par grille et comparaison par paires, calibré par des humains.

À éviter

Ce que je NE ferais PAS : donner au modèle une connexion à la base de données et un system prompt qui dit « sois utile ». L'accès libre, c'est ainsi qu'un agent rembourse le mauvais client. Je ne mesurerais pas non plus la qualité par le seul taux de déflexion. Un agent qui déflecte avec assurance en donnant de mauvaises réponses obtient un score parfait tout en détruisant la confiance. Et les tests de correspondance exacte ne peuvent pas juger des conversations de support. « A-t-il résolu correctement » est un jugement de préférence, et c'est pourquoi l'eval set stocke des sorties de référence bonnes ET mauvaises avec des grilles.

Changer si

Si le produit passe en multi-région avec des règles de résidence des données, les index de récupération et les journaux de conversation doivent être shardés par région. La suite d'évaluation gagne alors des golden sets par locale, car la qualité ne se transporte pas d'une langue à l'autre.

03

Chemin d’architecture

D’abord une image complète, puis chaque chemin comme son propre schéma — le chemin d’écriture et le chemin de lecture portent un trafic différent et justifient des composants différents.

Image complète

Vue d’ensemble — chaque composant

CustomerIntent RouterAgentOrchestratorLLM + GuardrailsResponse (cited)Permission-FilteredRAGrécupération limitée au tenantTool Gateway(risk tiers)actions sur le compteHuman Escalation+ Handoffconfiance faible

Tout ce que fait le modèle passe une barrière : la récupération est limitée aux permissions, les actions passent par la passerelle d'outils, et une confiance faible sort vers un humain avec un paquet de transfert complet. Les traces enregistrent chaque saut.

Chemin 1

Chemin de réponse — classer, récupérer, ancrer, répondre

Customer messageIntent RouterPermission-FilteredRAGLLM (grounded +cited)Streamed answer

La classification d'intention tourne avant toute génération. La récupération porte les permissions du client dans la requête d'index. La réponse cite ses sources, ou elle ne part pas.

Chemin 2

Chemin d'action — outils typés derrière des paliers de risque

Agent decisionTool GatewayRisk tier checkExecute /Confirm / DenyTraced result

Le modèle propose ; la passerelle dispose. Les paliers bas s'exécutent, les paliers moyens demandent au client de confirmer, les paliers hauts exigent un humain — et chaque appel atterrit dans la trace.

04

API et modèle de données

Avant d’optimiser, rendez le contrat inspectable : endpoints, entités, propriété, retries et état.

POST/support/messages

req{ conversation_id?, text }

rés200 réponse en streaming avec citations · ou { escalated: true, ticket_id }

L'identité du client vient de la session — les permissions de l'agent sont celles du client, jamais plus larges.

POST/support/{conversation_id}/escalate

rés201 { ticket_id } avec le paquet de transfert joint

Se déclenche sur une confiance faible, un échec répété ou une demande explicite du client — l'escalade est une fonctionnalité, pas un échec.

POSTinternal: tools.execute(tool, input, risk_tier)

résresult · blocked (confirmation requise) · denied (politique)

Le seul chemin de la sortie du modèle vers de vrais effets de bord : entrées typées, outils sur liste d'autorisation, paliers de risque appliqués hors du modèle.

Entités principales

Conversation

conversation_id (PK) · customer_id · channel · state: active/escalated/resolved

Turn

turn_id (PK) · conversation_id · role · content · trace_ref

trace_ref renvoie à la trace entièrement rejouable : récupération, prompt, appels d'outil, décisions.

ToolAction

action_id (PK) · conversation_id · tool · input · result · risk_tier · confirmed_by

Les paliers risqués enregistrent qui a confirmé — l'agent, le client, ou un agent humain.

HandoffPacket

conversation_id · summary · retrieved_sources · attempted_actions · uncertainty_notes

Ce que reçoit l'humain lors de l'escalade — la différence entre une reprise et un redémarrage.

05

Directions de deep dive

Choisissez une voie pour le dernier tiers de l’entretien. Chaque voie vous donne le sujet, la question de l’examinateur à laquelle répondre, et le mode d’échec à éviter.

Focus

L'agent promet un remboursement qu'il ne devrait pas

Question

Quelles sont les défenses en couches entre « le modèle veut rembourser 500 $ » et l'argent qui bouge réellement ?

Réponse

C'est la passerelle qui décide, pas le modèle. L'outil de remboursement prend des entrées typées avec un plafond strict, et les niveaux de risque vivent dans la passerelle d'outils, hors du modèle. 500 $ est au-dessus de la ligne d'exécution automatique, donc l'argent ne bouge qu'après confirmation du client ou approbation d'un humain. Même une tentative bloquée atterrit dans la trace.

À éviter

Faire confiance au prompt système comme contrôle — la politique vit dans la passerelle d'outils, hors du modèle.

Focus

Les données du tenant restent chez elles

Question

Deux entreprises utilisent ce produit. Déroulez la récupération pour une question dont le meilleur chunk correspondant appartient à l'AUTRE tenant.

Réponse

Mettez l'ID de tenant dans la requête d'index. Ainsi le chunk de l'autre tenant n'est même jamais un candidat à la récupération — il est exclu avant le classement, pas retiré après coup. Ne filtrez pas les résultats après, à la place. Ratez une vérification là et le document d'un concurrent finit dans le prompt.

À éviter

Filtrer a posteriori les chunks récupérés — le filtre de permission doit être dans la requête sur l'index elle-même.

Focus

L'instant du transfert

Question

La confiance chute en pleine conversation. Que voit exactement l'agent humain, et qu'advient-il du flux du client ?

Réponse

L'humain ouvre un dossier de passation, pas un écran vide. Il porte toute la conversation avec un résumé courant en tête, les sources que l'agent a récupérées, chaque action qu'il a tentée, et sa propre note d'incertitude. Le client reste dans le même chat et voit simplement une personne le rejoindre. Il ne se répète jamais.

À éviter

Escalader avec seulement une transcription — les sources, les actions tentées et les notes d'incertitude sont ce qui évite à l'humain de repartir de zéro.

Focus

Est-ce que ça se dégrade ?

Question

Un ajustement de prompt est livré. Comment savez-vous que la qualité du support n'a pas régressé en silence — avant que les clients ne vous le disent ?

Réponse

Rejouez un ensemble permanent de conversations golden à chaque release. Un modèle juge note chaque réponse contre une grille et compare la nouvelle version à l'ancienne, et des humains le recalibrent régulièrement. La correspondance exacte ne sait pas noter de la prose, et le taux de déflexion récompense les réponses fausses mais assurées. Grille plus jugement par paires attrape la régression avant les clients.

À éviter

Les tests de correspondance exacte ou le taux de déflexion comme métrique — les réponses de support nécessitent une grille et un jugement par paires, calibrés par des humains.

Focus

Qui a vu quoi

Question

Un client conteste une action que l'agent a effectuée le mois dernier. Reconstituez la conversation : qu'est-ce qui est stocké, pour combien de temps, et qui peut le lire ?

Réponse

Chaque tour a été tracé — la requête, les chunks récupérés et leurs scores, le prompt, les appels d'outils avec entrées et sorties, et la décision d'escalade. Donc l'action contestée se rejoue exactement comme elle s'est produite. Les logs ne vivent que le temps de la fenêtre de rétention, avec les PII caviardées. Les lire est en soi une action permissionnée et auditée.

À éviter

Stocker les conversations brutes indéfiniment avec les PII intactes — la rétention et la censure sont des exigences, pas du nettoyage.

Prêt à vous entraîner ?

Expliquez agent IA de support client à voix haute et obtenez une évaluation IA de votre explication.

S’entraîner avec l’IA →