IA frugale : ce que ça change sur une facture
Le réflexe est de prendre le modèle le plus puissant « pour être tranquille ». Sur un geste répété trois cents fois par jour, ce réflexe se lit sur la facture — et il n’améliore souvent rien.
Comment on tranche
La méthode tient en quatre étapes, et elle ne demande aucune conviction :
- constituer un jeu de cas réels — quarante à cent — avec la bonne réponse connue ;
- faire tourner les modèles candidats, du plus petit au plus grand ;
- garder le plus petit qui atteint le seuil que vous avez fixé ;
- noter le coût par traitement, et le relire dans trois mois.
Le résultat surprend souvent : sur des tâches d’extraction, de classement ou de reformulation dans un format connu, un petit modèle atteint le même seuil qu’un grand, pour une fraction du prix et une latence bien moindre.
Où le petit modèle échoue
Il ne fait pas tout, et prétendre le contraire coûte plus cher que la facture qu’on voulait réduire. Il décroche typiquement sur :
- le raisonnement en plusieurs étapes enchaînées ;
- les documents longs où l’information utile est éparpillée ;
- la rédaction qui doit tenir un ton précis sur plusieurs paragraphes ;
- les langues peu représentées dans son entraînement.
D’où le montage le plus fréquent chez nous : un petit modèle traite le volume, et les cas qu’il signale comme incertains partent vers un grand. On paie le grand sur cinq pour cent des cas au lieu de cent.
Trois réglages qui pèsent plus que le modèle
La taille du contexte envoyé. Envoyer tout un document plutôt que l’extrait utile multiplie le coût sans améliorer la réponse — et dégrade souvent la précision.
Le cache. Beaucoup de gestes répètent la même consigne sur des données différentes : la partie stable se met en cache, et ne se paie plus à chaque appel.
Le nombre d’appels. Un circuit qui rappelle le modèle quatre fois par traitement coûte quatre fois plus. C’est souvent un défaut de conception, pas une nécessité.
La facture d’un agent se décide à la conception, pas au moment de choisir l’abonnement.
Et l’empreinte, alors ?
Un modèle plus petit consomme moins d’énergie par requête — c’est mécanique. Mais nous ne vous donnerons pas de chiffre en grammes de CO₂ par traitement : les données publiques sur l’inférence sont trop lacunaires pour qu’un tel chiffre soit honnête, et elles varient selon le centre de données et l’heure.
Ce qu’on peut dire sans se tromper : le geste le plus sobre reste de ne pas appeler de modèle quand une règle suffit. C’est aussi le moins cher — les deux vont dans le même sens, ce qui est rare.
- Les dix systèmes d’une entreprise — le geste le plus sobre est celui qu’on n’appelle pas
- IA pour l’e-commerce — trois cents demandes par semaine, le volume qui décide
- Le relevé des dix systèmes — le coût d’exploitation en fait partie
D’autres notes
Agent IA ou simple automatisation : la question à 20 000 €
Un tiers des cas d’usage qu’on nous demande ne réclament aucun modèle. Comment distinguer ce qui relève d’un workflow, ce qui réclame un agent, et pourquoi se tromper coûte cher dans les deux sens.
Méthode · 17 juillet 2026Mesurer le retour d’un agent sans se mentir
Les quatre chiffres à relever avant d’ouvrir un système, la mesure à trente jours, et les trois biais qui font conclure à un succès inexistant.
IA responsable · 14 août 2026« Et s’il invente ? » — faire citer ses sources à un agent
Un modèle produit une phrase plausible, pas une phrase vraie. Les quatre montages qui rendent l’invention repérable, et la seule règle qui compte : chaque affirmation renvoie à sa source.