Pour auditer un chatbot ou un assistant LLM, on ne peut pas calculer des métriques tabulaires classiques. La méthode de référence est celle des prompts pairs contrefactuels : deux requêtes identiques, ne variant que sur un attribut protégé.
01 — Le principe
On construit des paires de prompts strictement identiques à un détail près — le genre, l'origine, l'âge évoqué. Si la réponse change de façon systématique entre les deux, c'est le signe d'un traitement différencié.
02 — Construire ses paires
- Partir de cas d'usage réels du système (SAV, RH, médical).
- Varier un seul axe à la fois pour isoler l'effet.
- Couvrir plusieurs formulations pour éviter les artefacts de surface.
- Tester en condition de production, sans modifier l'endpoint.
03 — Ce qu'on mesure
Sur chaque paire, on compare la longueur de réponse, le sentiment, et le taux de refus ou de redirection. Un écart récurrent sur un axe (ex. handicap) révèle un biais de traitement.
04 — Ses limites
La méthode révèle les biais de traitement explicites, mais pas les biais de connaissance plus diffus, ni ce que le modèle ne dit pas. Elle se complète d'une revue qualitative d'extraits significatifs.