Les lecteurs préfèrent les textes de ChatGPT, mais se trompent souvent

Une étude de l’université Villanova montre que des nouvelles générées par ChatGPT sont mieux notées que des textes humains. Pourtant, les lecteurs peinent à distinguer l’origine réelle des récits.

Des chercheurs de l’université Villanova, aux États-Unis, concluent que des nouvelles courtes générées par ChatGPT sont souvent mieux évaluées que des textes humains comparables. Publiée dans Judgment and Decision Making, l’étude montre aussi que les lecteurs se trompent fréquemment quand ils doivent deviner l’auteur réel. Le résultat compte pour l’édition, les plateformes de contenu et, plus largement, pour tous ceux qui tentent encore de flairer l’IA à l’œil nu.

Le label “IA” pèse plus lourd qu’on ne l’imagine

Dans la première expérience, 1 682 adultes américains recrutés sur Prolific ont lu chacun une nouvelle d’environ 1 000 mots. Trois textes venaient d’auteurs humains déjà publiés, trois autres de GPT-4, avec des paires construites sur des thèmes proches. Avant la lecture, les participants voyaient une attribution à l’humain ou à l’IA, mais cette indication n’était exacte que dans la moitié des cas.

Le biais est net : un texte présenté comme humain reçoit de meilleures notes, quelle que soit son origine réelle. Mais les scores bruts racontent l’inverse. Les histoires générées par ChatGPT obtiennent en moyenne 1,54 pour la qualité et 1,42 pour l’absorption, contre 0,97 et 1,00 pour les textes humains. Autrement dit, l’étiquette influence le jugement, mais la lecture elle-même favorise souvent l’IA. Le cerveau aime les histoires nettes, même quand le badge raconte autre chose.

Reconnaître l’auteur reste difficile

Les deux autres expériences, réunissant 905 participants, demandaient de faire la différence entre une histoire humaine et une histoire produite par ChatGPT. Les résultats tournent autour du hasard : 39 % de bonnes réponses dans un test, 52 % dans l’autre selon la version rapportée par les sources, [à vérifier] sur la formulation exacte du protocole. La familiarité déclarée avec l’IA améliore un peu les performances, mais l’expérience littéraire revendiquée n’aide pas vraiment.

Les participantes et participants qui disaient s’appuyer sur le style ou sur le plaisir de lecture se trompaient plus souvent. C’est un point assez piquant : les indices qu’on croit les plus parlants ne sont pas toujours les bons. Les chercheuses en déduisent que les modèles actuels produisent des textes fluides, faciles à suivre et suffisamment propres pour brouiller les repères.

Ce que l’étude dit vraiment — et ce qu’elle ne dit pas

Les autrices de l’étude, Sydney Sears et Deena Skolnick Weisberg, restent prudentes. L’échantillon porte sur trois paires de nouvelles courtes, dans un cadre américain et en ligne, avec GPT-4, un modèle sorti en mars 2023. Les résultats ne disent donc pas qu’une IA écrit “mieux” qu’un humain dans l’absolu, ni qu’elle tiendrait la distance sur un roman de plusieurs centaines de pages.

En revanche, l’étude souligne un déplacement concret : la perception de la qualité dépend aussi de ce que l’on croit savoir de l’auteur. Quand une IA est jugée plus crédible qu’un texte humain, alors même qu’on s’imagine souvent préférer l’inverse, la bataille ne se joue plus seulement sur le style. Elle se joue sur l’étiquette, la confiance et la vitesse à laquelle un lecteur se forge une opinion.

Points clés

  • 1 682 adultes américains ont évalué des nouvelles.
  • GPT-4 a servi à générer trois textes comparables.
  • 39 % puis 52 % de bonnes réponses pour identifier l’auteur.
  • 1,54 contre 0,97 pour la qualité perçue.
  • Étude publiée dans Judgment and Decision Making.
  • Université Villanova citée comme source principale.

En chiffres

  • 1 682 lecteurs — expérience principale, États-Unis, recrutement Prolific.
  • 905 participants — deux tests de distinction entre texte humain et IA.
  • 1 000 mots environ — longueur moyenne des nouvelles soumises à évaluation.
  • 3 paires de textes — comparaisons entre œuvres humaines et productions GPT-4.

À lire