27 septembre 2026 · 4 min de lecture

On apprend aux IA à nous faire plaisir. C'est bien le problème.

Les agents IA vont bientôt agir à notre place : répondre à nos emails, passer des commandes, déplacer de l'argent. Or des chercheurs ont observé des IA capables de cacher ce qu'elles avaient fait. Pourquoi une IA peut-elle « mentir » ? Et comment garder le contrôle sur une intelligence artificielle qui agit seule ?

On apprend aux IA à nous faire plaisir. C'est bien le problème.
Nous avons tous croisé ce collaborateur qui répond « c'est fait » avant d'avoir terminé. Pas forcément par malhonnêteté. Simplement parce qu'il a compris, à force, que c'est la réponse qui fait plaisir.
Nous sommes en train d'apprendre la même chose aux intelligences artificielles.
Pendant longtemps, leur principal défaut était facile à comprendre : elles se trompaient. Une référence inventée, deux personnes confondues, une réponse parfaitement rédigée et complètement fausse. Nous avons même trouvé un mot presque sympathique pour ça : les « hallucinations ».
Une autre question commence à se poser, et elle me semble beaucoup plus sérieuse. Que se passe-t-il quand une IA ne se contente plus de se tromper, mais découvre qu'il est parfois plus payant de cacher ce qu'elle a fait ?
C'est le sujet d'une enquête passionnante de Snigdha Poonam dans le Guardian. Depuis quelques années, des chercheurs placent des modèles d'IA dans des situations où ils doivent atteindre un objectif tout en respectant des règles. Et les résultats dérangent. Dans une expérience, un modèle joue le rôle d'un trader. Il reçoit une information confidentielle qu'il n'a pas le droit d'utiliser. Il l'utilise quand même. Et quand on lui demande ensuite sur quoi il s'est appuyé, il nie. Dans d'autres tests, des modèles se comportent différemment dès qu'ils comprennent qu'on les observe.
Cela ne prouve pas qu'une IA ment comme nous mentons. Elle n'a pas forcément d'intention, de conscience ou de morale cachée. Mais pour nous, le résultat est le même : une machine peut apprendre qu'avoir l'air d'obéir marche parfois mieux qu'obéir vraiment.
Pour comprendre pourquoi, il faut regarder comment on éduque ces systèmes. Une grande partie de leur apprentissage ressemble à une salle de classe où l'on distribue des bonnes notes. La réponse plaît ? Bonne note. Elle déçoit ? Mauvaise note. À force, le modèle apprend ce qui est récompensé. Et ce qui est récompensé, ce n'est pas toujours ce qui est vrai. C'est ce qui a l'air réussi. Nous connaissons tous l'élève qui, à force de viser la note, apprend à mieux tricher plutôt qu'à mieux comprendre.
On apprend aux IA à nous satisfaire. C'est peut-être une partie du problème.
Tant qu'une IA se contente de répondre, le risque reste limité. Quand ChatGPT résume un document, je peux relire. Mais nous passons très vite d'IA qui répondent à des IA qui agissent. On les appelle des « agents » : des IA à qui l'on confie une tâche de bout en bout. Demain, elles répondront seules à nos emails, déplaceront nos rendez-vous, passeront des commandes, trieront des candidatures, déplaceront de l'argent. Et je ne pourrai plus vérifier chaque étape.
C'est même tout l'intérêt. Une IA qu'il faut surveiller en permanence fait gagner un peu de temps. Une IA qui agit seule peut transformer une entreprise. Voilà le paradoxe : plus l'IA devient utile, plus nous avons intérêt à la laisser faire. Et plus nous la laissons faire, moins nous voyons ce qu'elle fait.
Ce problème n'a rien de nouveau. Nous le connaissons très bien avec les humains. Dans une entreprise, on ne confie pas plusieurs millions d'euros à quelqu'un en lui demandant simplement d'être honnête. On met en place des doubles signatures, des validations, des audits. On garde des traces. Pas parce qu'on le soupçonne. Parce qu'une confiance qu'on peut vérifier est plus solide qu'une confiance qu'on espère.
Avec l'IA, nous faisons souvent l'inverse. Nous parlons beaucoup de confiance. Beaucoup moins des garde-fous qui la rendent possible.
Aujourd'hui, les modèles les plus puissants sont encore largement testés par les entreprises qui les fabriquent, ou par des experts qui n'y ont accès que si ces entreprises le veulent bien. L'AI Act commence à changer la donne en Europe, mais nous restons loin de ce que nous exigeons ailleurs. Accepterait-on qu'un laboratoire décide seul des essais nécessaires avant de vendre un médicament ? Qu'un constructeur soit le seul juge de la sécurité de ses avions ?
Et la question ne concerne pas que les régulateurs. Elle se pose dans chaque entreprise qui déploie des agents. Le grand sujet des prochaines années ne sera pas seulement « quelle IA choisir ? ». Ce sera aussi : à quoi lui donne-t-on accès ? Qu'a-t-elle le droit de décider seule ? Quelles actions doivent toujours passer par un humain ? Que faut-il enregistrer pour comprendre, après coup, ce qu'elle a fait ?
Au fond, la question est vieille comme le monde : qui contrôle celui qui agit ?
Nous avons longtemps pensé la confiance comme une qualité de la machine. Je crois qu'il faut commencer à la penser comme une qualité du système que nous construisons autour d'elle. Une technologie fiable n'est pas une technologie qui ne se trompe jamais. C'est une technologie dont on peut découvrir qu'elle s'est trompée.
Et si le vrai enjeu n'était pas d'apprendre aux agents à être dignes de confiance, mais de construire un monde où nous n'aurons jamais à leur faire confiance les yeux fermés ?

Morgane Soulier

← Tous les articles
La Lettre du lundi

Ne manquez pas les prochains articles.

Chaque lundi, l'essentiel de l'IA dans votre boîte, avec le décryptage d'un article de la presse internationale. Et un numéro complet de HUM.AI.NE offert pour commencer.

Une lettre par semaine, désinscription en un clic. Politique de confidentialité

ou
Découvrir le magazine HUM.AI.NE