Ressources
Pourquoi ChatGPT se trompe en comptabilité, et ce que ça change
Le problème n’est pas le taux d’erreur. C’est que l’erreur a exactement la forme d’une réponse juste.
Par Pablo Goffinet, fondateur d’OSERIA ·
Presque tout le monde a fait l’expérience : le premier résultat impressionne, le troisième a dérivé, et il faut tout revérifier. On en conclut généralement que le modèle « n’est pas encore assez bon », et on attend la version suivante.
C’est un mauvais diagnostic, et il coûte cher parce qu’il conduit à attendre au lieu de corriger. Le mécanisme de l’erreur n’est pas un manque de puissance.
Vérifié le 5 septembre 2026. Le cadre décrit ici évolue : si vous lisez cette page longtemps après cette date, recoupez avec les sources citées en bas.
Un modèle produit ce qui est plausible, pas ce qui est vrai
Un modèle de langage produit la suite la plus vraisemblable au regard de ce qu’il a vu. Sur un sujet comptable ou fiscal, le vraisemblable est très proche du vrai : le bon vocabulaire, la bonne structure d’argument, un numéro d’article crédible, une référence au BOFiP formulée comme les vraies.
C’est ce qui rend l’erreur coûteuse. Elle ne ressemble pas à une erreur. Une réponse fausse en comptabilité a la même allure qu’une réponse juste, alors qu’un modèle qui se trompe sur une date historique produit quelque chose d’immédiatement suspect.
La conséquence pratique : le contrôle ne peut pas se faire au jugé. Il faut remonter à la source, ce qui prend le temps que l’outil prétendait faire gagner.
Sans contrainte, la réponse change d’une fois sur l’autre
Posez deux fois la même question à quelques minutes d’intervalle et vous obtiendrez deux réponses différentes, parfois contradictoires. Ce n’est pas un défaut : rien dans la question ne contraignait la réponse.
Un cabinet ne peut pas travailler ainsi, pour une raison qui n’est pas technique. Une position doit pouvoir être expliquée à un client, défendue devant un contrôle, et retrouvée dans six mois. Une réponse qui change n’est pas défendable, même quand elle est juste.
C’est pourquoi une réponse sans source est inutilisable dans ces métiers, même exacte : elle n’est pas contestable, donc elle n’est pas opposable.
Ce qui corrige réellement, et ce qui ne corrige pas
Mieux formuler la question améliore le résultat à la marge et c’est ce qu’enseignent les formations. Cela ne change pas le mécanisme : sans périmètre déclaré ni source imposée, le modèle continue de produire ce qui lui semble plausible.
Ce qui change le mécanisme, c’est de contraindre la réponse : imposer les sources dans lesquelles chercher, exiger que chaque élément cite d’où il vient, et refuser de répondre plutôt que de combler un trou. Un système construit ainsi répond moins souvent, et ce qu’il répond se vérifie.
Le test qui tranche, et il ne coûte rien : posez dix questions dont vous connaissez déjà la réponse, dont deux cas limites. Le résultat sur les deux cas limites vaut tous les argumentaires.
Sources
Cet article expose un cadre, il ne remplace pas un avis. Sur une situation précise, la question se pose à votre conseil ou à votre ordre.
Questions fréquentes
Les modèles ne vont-ils pas s’améliorer ?
Ils s’améliorent, et le mécanisme reste le même. Un modèle mieux entraîné produit du plausible plus souvent juste, ce qui rend l’erreur résiduelle plus difficile à repérer, pas moins présente.
Attendre la version suivante est donc une stratégie qui aggrave le problème qu’elle prétend résoudre.
Un outil spécialisé règle-t-il la question ?
Il la réduit beaucoup, quand il impose ses sources et les cite. C’est la différence entre un assistant généraliste et un outil adossé à une base.
La citation prouve que la source existe et dit ce qui est cité. Elle ne prouve pas que cette source s’applique à votre cas : c’est le raisonnement qui relie les deux qu’il faut relire, et là le métier reprend la main.
C’est la dernière colonne qui vous intéresse ?
Ce que nous construisons commence là où ces outils s’arrêtent. Un échange suffit à dire si c’est votre cas.
