1132 mots 6 minutes

Si vous utilisez de la GenAI pour vos travaux écrits, relisez

Je lis beaucoup de textes professionnels en ce moment. Trop d’entre eux semblent écrits par une IA générative que personne n’a relue : mots mal choisis, répétitions, faits faux. Est-ce une impression, ou une tendance mesurée ?

Le début de l’analyse est donc quelque chose comme : existe-t-il une tendance liée à l’augmentation de l’usage de l’IA générative quant à la production de textes qui sont de plus en plus longs, faux et s’ils ne sont pas relus par les auteurs peuvent aboutir à des aberrations ?

Vous pouvez tenter de votre côté de poser cette question à votre agent GenAI préféré pour voir ce que cela donne. En en prenant un au hasard à ma disposition, il m’a répondu en introduction : “Oui, cette tendance existe et elle constitue aujourd’hui un problème majeur identifié par les chercheurs et les experts de l’information. Lorsqu’un texte généré par intelligence artificielle n’est pas relu et vérifié par un humain, la combinaison de la logique statistique des modèles et de l’absence de contrôle produit régulièrement des erreurs massives”. Ceci sera la dernière intervention d’une GenAI dans ce billet.

On va commencer par le constat :

  • des textes très longs, on y retrouve des tournures lourdes et des répétitions, on a donc parfois du mal à trouver l’information. Par ailleurs, ceci est aussi vrai sur d’autres types de média, par exemple des vidéos courtes qui vont tourner en rond avant de t’annoncer que les constructeurs automobiles vont devoir mettre des autoradios dans les voitures ; bon, il n’y a pas de quoi en faire un contenu de 5 minutes.
  • des mots mal placés ou mal employés, parfois ce ne sont que des anglicismes, parfois ce n’est pas le bon mot mais un lointain synonyme ou du vieux français, parfois ce n’est juste pas le bon mot et la phrase n’a pas de sens. L’avantage, c’est que j’apprends plein de nouvelles expressions et de nouveaux mots, certes, je ne serais pas capable de les replacer, mais on pourrait tenter une petite carabistouille de-ci de-là.
  • des hallucinations ; ce n’est pas parce que votre prompt ou le skill employé (après l’installation d’un repo git plus ou moins qualitatif) dit de ne pas en utiliser que cela n’arrive pas, notamment des liens entre des informations vraies, mais la combinaison est fausse, ou alors des références associées à des auteurs ou des thématiques incorrectes.
  • des contenus de mauvaise facture : et oui, on lit beaucoup de choses plates, sans fond, sans analyse, sans queue ni tête (peut-être ce blog répond-il à cette catégorie, mais c’est moi qui l’écris…). C’est dommage car combiné avec la longueur des productions ce serait encore mieux s’il y avait du contenu.

Comment en arrive-t-on à générer des contenus de plus en plus fades voir faux alors que les modèles GenAI et les suites applicatives sont toujours plus performants ?

Je crains d’avoir un début de réponse avec la façon dont les outils sont utilisés. Ils peuvent en effet être simplement un assistant chat ou un outil très complet avec des skills précis, des agents collaborants et des usages de construction, mais aussi d’analyse critique et de correction. Demandez sur un de vos prochains écrits une correction orthographique et grammaticale à votre agent préféré, vous serez surpris, il ne comprendra peut-être pas tout et les propositions ne seront peut-être pas toutes pertinentes, mais certaines vous surprendront probablement. Pour utiliser correctement les outils, il faut lire de la doc, expérimenter, se former, échanger avec des personnes qui utilisent effectivement l’outil, comprendre ce qui fonctionne pour eux, ce qui ne fonctionne pas. Attention aux contenus générés disponibles facilement sur la toile, rien n’est simple ou facile d’accès en ce bas monde, il faut travailler pour avoir des résultats.

Par ailleurs, commence-t-on à voir les premiers effets d’une alimentation des GenAI par des contenus générés, eux-mêmes de mauvaise qualité ? Je ne suis pas sûr de cela et c’est probablement assez compliqué à démontrer, mais le fait d’avoir déjà nommé le phénomène n’est pas rassurant (on parle de model collapse, mais on trouve aussi consanguinité numérique qui est très joli et cannibalisme qui l’est un peu moins).

Certes les données de qualité empilées dans les premiers corpus d’apprentissage sont déjà épuisées. Donc, ajouter des textes anciens du XIVe siècle n’est probablement pas une bonne idée pour une GenAI assez généraliste, à part pour nous faire renaître des tournures de phrase anciennes peut-être.

Lorsqu’il s’agit de remplir un site web à vocation très généraliste, ce n’est probablement pas très grave ? Cela fait longtemps que la plupart des contenus postés sont générés par des tiers sur commande, donc très souvent loin d’une réalité propre au propos. Désormais, plus besoin d’un tiers dans un pays lointain, quelques lignes dans un prompt et c’est presque pareil.

Donc comment peut-on faire pour ne pas généraliser ce type de contenus ?

Certains experts disent que tant qu’il y aura de nouveaux contenus de qualité générés par des humains, ceci atténuera voire rendra impossible l’effondrement du modèle sur lui-même à cause de l’apprentissage sur les données synthétiques (synthetic data). Je tente de croire ceux-ci, la vision est plus optimiste et donc il nous incombe d’ajouter du contenu de qualité (si possible) que certaines GenAI pourraient utiliser pour se nourrir et tenter de rester moins bêtes. Une étude1 a montré qu’il existe un niveau de mix entre les données humaines et synthétiques qui favorise l’effondrement, il suffit donc de rester au-dessus de ce ratio (en faveur des données humaines bien sûr). Dans cet autre papier2, on apprend que l’effondrement est d’autant plus important que la créativité est demandée au modèle génératif.

Sans une relecture humaine systématique et l’exercice d’un esprit critique, l’usage aveugle de la GenAI accélère la diffusion de fausses informations à grande échelle. Donc, soit on ne rédige pas avec de l’IA générative certains contenus, soit on les relit afin de limiter les erreurs et alléger la charge mentale du lecteur humain qui va devoir tenter d’en extraire quelque chose. Et même si cela doit prendre plus de temps, ce n’est pas grave, mieux vaut faire quelque chose de bien quitte à y passer du temps, sinon autant ne rien produire.


Pour aller un peu plus loin :