IA responsable

IA frugale : ce que ça change sur une facture

Le réflexe est de prendre le modèle le plus puissant « pour être tranquille ». Sur un geste répété trois cents fois par jour, ce réflexe se lit sur la facture — et il n’améliore souvent rien.

19 juin 20266 min de lecturePar Sébastien Joumel
La bonne question n’est pas « lequel est le meilleur »C’est « lequel est le plus petit qui passe mes cas de test ». Elle se tranche en une demi-journée, une fois pour toutes, et se rejoue à chaque nouveau modèle.

Comment on tranche

La méthode tient en quatre étapes, et elle ne demande aucune conviction :

  • constituer un jeu de cas réels — quarante à cent — avec la bonne réponse connue ;
  • faire tourner les modèles candidats, du plus petit au plus grand ;
  • garder le plus petit qui atteint le seuil que vous avez fixé ;
  • noter le coût par traitement, et le relire dans trois mois.

Le résultat surprend souvent : sur des tâches d’extraction, de classement ou de reformulation dans un format connu, un petit modèle atteint le même seuil qu’un grand, pour une fraction du prix et une latence bien moindre.

Où le petit modèle échoue

Il ne fait pas tout, et prétendre le contraire coûte plus cher que la facture qu’on voulait réduire. Il décroche typiquement sur :

  • le raisonnement en plusieurs étapes enchaînées ;
  • les documents longs où l’information utile est éparpillée ;
  • la rédaction qui doit tenir un ton précis sur plusieurs paragraphes ;
  • les langues peu représentées dans son entraînement.

D’où le montage le plus fréquent chez nous : un petit modèle traite le volume, et les cas qu’il signale comme incertains partent vers un grand. On paie le grand sur cinq pour cent des cas au lieu de cent.

Trois réglages qui pèsent plus que le modèle

La taille du contexte envoyé. Envoyer tout un document plutôt que l’extrait utile multiplie le coût sans améliorer la réponse — et dégrade souvent la précision.

Le cache. Beaucoup de gestes répètent la même consigne sur des données différentes : la partie stable se met en cache, et ne se paie plus à chaque appel.

Le nombre d’appels. Un circuit qui rappelle le modèle quatre fois par traitement coûte quatre fois plus. C’est souvent un défaut de conception, pas une nécessité.

La facture d’un agent se décide à la conception, pas au moment de choisir l’abonnement.

Et l’empreinte, alors ?

Un modèle plus petit consomme moins d’énergie par requête — c’est mécanique. Mais nous ne vous donnerons pas de chiffre en grammes de CO₂ par traitement : les données publiques sur l’inférence sont trop lacunaires pour qu’un tel chiffre soit honnête, et elles varient selon le centre de données et l’heure.

Ce qu’on peut dire sans se tromper : le geste le plus sobre reste de ne pas appeler de modèle quand une règle suffit. C’est aussi le moins cher — les deux vont dans le même sens, ce qui est rare.

À lire sur le site

D’autres notes

Tous les billets →

Premier échange — quinze minutes

On vous dira quel système ouvrir en premier.

Décrivez le geste qui vous coûte le plus cher. Nous vous dirons ce qui est faisable, en combien de temps et à quel prix. Si la réponse est non, vous repartirez avec les deux raisons pour lesquelles c’est non.