IA responsable

« Et s’il invente ? » — faire citer ses sources à un agent

C’est la première question posée dans chaque atelier, et elle est juste. Un modèle de langue produit une phrase plausible ; rien dans sa mécanique ne garantit qu’elle soit vraie. Tout l’art consiste à rendre l’erreur visible.

14 août 20266 min de lecturePar Sébastien Joumel
On ne supprime pas l’invention, on la rend repérableAucun montage n’élimine le risque. Un bon montage fait qu’une erreur saute aux yeux au lieu de passer inaperçue.

La règle unique : citer

Chaque affirmation produite par un agent renvoie au document et à la version d’où elle vient. Pas « d’après nos procédures » — la référence exacte, cliquable, vérifiable en trois secondes.

Cette règle a l’air modeste. Elle change tout : elle transforme la relecture d’un exercice de confiance en un exercice de vérification. Une personne qui doit croire relit mal ; une personne qui peut vérifier relit vite.

Si une phrase n’a pas de source, elle n’a rien à faire dans la sortie.

Quatre montages qui marchent

Répondre depuis les documents, pas depuis la mémoire

L’agent cherche d’abord dans votre base, puis rédige à partir de ce qu’il a trouvé. S’il ne trouve rien, il doit le dire — et non compléter avec ce qu’il « sait ».

Autoriser le « je ne sais pas »

Un agent qu’on n’autorise pas à échouer invente. Le circuit doit prévoir une sortie « pas de réponse dans le socle » qui remonte à une personne, et cette sortie doit être fréquente au début.

Séparer extraction et rédaction

Extraire une date d’un document est vérifiable. Rédiger un paragraphe ne l’est pas. Quand les deux sont mélangés, on ne sait plus ce qu’on relit.

Journaliser les entrées

Le journal garde ce que l’agent a lu, pas seulement ce qu’il a produit. C’est ce qui permet de corriger la cause au lieu de corriger la sortie.

Deux fausses solutions

« On va prendre un modèle plus puissant. » Un meilleur modèle réduit la fréquence des erreurs, pas leur nature. Sur une question dont la réponse n’est nulle part dans vos documents, le meilleur modèle du marché inventera aussi — simplement de façon plus convaincante.

« On va tout relire. » Personne ne relit trois cents sorties par jour. Au bout de deux semaines, la relecture devient un coup d’œil. Mieux vaut relire dix pour cent des sorties avec une méthode que cent pour cent en diagonale.

Comment on vérifie que ça tient

À l’ouverture d’un système, on constitue un jeu de cas réels — quarante à cent — dont on connaît la bonne réponse. On mesure trois choses : la part de réponses exactes, la part de « je ne sais pas » justifiés, et la part d’erreurs silencieuses. Seule la troisième compte vraiment.

Ce jeu de cas ne sert pas qu’à la mise en service : on le rejoue à chaque changement de modèle ou de prompt. C’est ce qui permet de dire, chiffres à l’appui, si une mise à jour a amélioré ou dégradé le système.

À lire sur le site

D’autres notes

Tous les billets →

Premier échange — quinze minutes

On vous dira quel système ouvrir en premier.

Décrivez le geste qui vous coûte le plus cher. Nous vous dirons ce qui est faisable, en combien de temps et à quel prix. Si la réponse est non, vous repartirez avec les deux raisons pour lesquelles c’est non.