
Pangram, le détecteur de textes IA qui prétend ne jamais se tromper : peut-on vraiment lui faire confiance ?
Libération CheckNews décortique Pangram, l'outil réputé le plus performant du marché pour débusquer les textes générés par IA. Taux de faux positifs annoncé à 0,01 %, études indépendantes de Chicago Booth et Maryland, roman "phénomène de l'année" accusé — et la limite que même Pangram ne veut plus taire.
C'est l'outil que les rédactions, les universités et les maisons d'édition citent depuis six mois quand elles veulent trancher : ce texte a-t-il été écrit par une IA ? Pangram — développé par Pangram Labs à New York — revendique 99,98 % de précision et un taux de faux positifs de 1 sur 10 000. Libération, dans un CheckNews du 23 septembre 2026, se demande jusqu'où on peut lui faire confiance. Réponse : très loin, mais pas partout — et les zones grises sont exactement celles où l'on aimerait avoir un verdict.
Ce qui a mis Pangram sur le devant de la scène
Le déclencheur est éditorial. Ces dernières semaines, plusieurs romans salués par la critique ont vu circuler l'accusation d'avoir été co-écrits — ou entièrement écrits — par une IA générative. La Libre Belgique a documenté deux cas emblématiques : Thélyson Orélien, dont un livre est soupçonné, et le « phénomène littéraire de l'année » sur lequel une enquête indépendante a été menée en s'appuyant sur Pangram [1][2]. Résultat : Pangram est devenu, en quelques semaines, l'arbitre officieux du monde du livre francophone. C'est ce que Libération pointe : quand un outil devient juge, il faut passer sa méthodologie au tamis.
Comment fonctionne Pangram
Techniquement, Pangram est un classifieur supervisé entraîné sur des millions de paires (texte humain vs texte IA), avec quatre choix qui expliquent son avance :
- Décision au niveau du passage, pas de la phrase : les détecteurs mot-à-mot faisaient trop de faux positifs. Pangram fenêtre par centaines de tokens.
- Entraînement contre le "humanized text" : les modèles récents savent produire des textes délibérément « humains » (ajout de tics, de fautes légères, de rythmes irréguliers). Pangram s'est spécialement entraîné à ces variantes.
- Couverture multi-modèles : GPT-4/5/Astra, Claude, Gemini, Llama, DeepSeek, Mistral. Un détecteur qui ne connaît que ChatGPT rate tout le reste.
- Correction du biais anti-non-natif, sur lequel les précédents détecteurs se cassaient les dents (voir plus bas).
Les chiffres avancés
Pangram affiche des performances qui font pâlir la concurrence [3][4] :
- 99,98 % de précision sur son propre benchmark interne
- 1 faux positif pour 10 000 textes humains classés comme humains
- 99,3 % de détection sur textes IA « humanisés » — GPTZero, dans la même étude, en attrape moins de 3 %
- Bat GPTZero et Originality dans les 10 domaines évalués (académique, presse, blog, technique, créatif, etc.)
Les études indépendantes — et leurs nuances
Ce qui fait la force du dossier Pangram, c'est que ces chiffres ne viennent pas que de Pangram. Deux études universitaires citées par Libération les corroborent, à quelques bémols près :
- Chicago Booth (Jabarian & Imas, août 2025). Pangram est le seul détecteur à maintenir un plafond de 0,5 % de faux positifs sans perdre en sensibilité. Originality et GPTZero, à niveau de détection comparable, montent à plusieurs pour cent de faux positifs — ce qui, appliqué à 10 000 étudiants, fait 500 accusations à tort [5].
- Université du Maryland (2026). Étude intitulée « People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text ». Pangram bat chaque détecteur humain individuel et toutes les alternatives commerciales testées. Les auteurs relèvent cependant ~2 % d'erreur sur textes humains — supérieur au chiffre revendiqué par Pangram [6].
- Vrije Universiteit Brussel (2026, peer-reviewed). Sur textes académiques : 97,5 % de précision inclusive pour Pangram, contre 2,5 % pour GPTZero sur les textes IA humanisés. L'écart est massif [7].
Le biais historique que Pangram dit avoir corrigé
En 2023, une étude de Stanford devenue emblématique testait sept détecteurs sur 91 essais TOEFL écrits par des non-anglophones : plus de la moitié étaient classés comme IA. Le taux de faux positifs moyen atteignait 61,3 %, alors que les essais d'étudiants américains passaient très majoritairement les tests. Un scandale méthodologique : accuser d'IA les étudiants dont l'anglais est appris, précisément parce que leur style est plus régulier et syntaxiquement simple.
Pangram affirme aujourd'hui atteindre 0 % de faux positifs sur ce même corpus de 91 textes. Ce point est important : c'est probablement la principale raison pour laquelle il est adopté par les universités qui refusent de tomber dans le piège Stanford.
Ce que Pangram ne peut pas faire — et l'admet
C'est le point que Libération souligne. Même Pangram Labs, dans sa documentation, précise trois limites structurelles :
- Détection ≠ preuve. Un score « 100 % IA » sur Pangram n'est pas une preuve juridique. C'est une probabilité statistique élevée. Pour un travail scolaire ou une enquête éditoriale, cela doit déclencher une conversation, pas une sanction.
- Le texte hybride reste piégeux. Les auteurs qui utilisent l'IA pour brouillonner puis retravaillent extensivement produisent des textes que tous les détecteurs, Pangram compris, peinent à qualifier. « Écrit par un humain avec assistance IA » n'est pas une catégorie que le détecteur sait distinguer proprement.
- La contre-mesure évolue plus vite que la détection. Chaque nouveau modèle et chaque nouvelle technique de "humanization" force Pangram à mettre à jour son entraînement. La fenêtre d'avance est de quelques semaines à quelques mois.
Ce que ça change pour la France
Trois enjeux immédiats :
- Édition : les maisons françaises commencent à intégrer Pangram dans leur due diligence de manuscrits. Attention à l'automatisme : un texte qui déclenche l'alerte doit être discuté avec l'auteur, pas rejeté par l'outil.
- Université : plusieurs facultés françaises (Sciences Po, Dauphine, plusieurs grandes écoles) évaluent Pangram pour remplacer les détecteurs anglo-saxons moins fiables. Question ouverte : que fait-on des 50 étudiants sur 10 000 qui seront classés à tort ?
- Presse : le CheckNews de Libération ne parle pas encore de généraliser Pangram dans les rédactions. C'est probablement une bonne chose. Un journaliste accusé sur la foi d'un score n'aurait aucun recours technique probant.
La nuance à retenir
Pangram est le meilleur outil du marché. Il est en avance nette sur GPTZero, Originality et les alternatives open source. Ses études indépendantes sont solides. Cela ne le rend pas infaillible, et surtout pas utilisable comme preuve seule. Le bon usage : un signal de forte probabilité qui déclenche une vérification humaine — dialogue avec l'auteur, examen des brouillons, historique de rédaction, cohérence stylistique avec le reste de l'œuvre. Un score, aussi précis soit-il, ne remplace pas une enquête.
Le vrai signal
Le débat sur les détecteurs d'IA sort de sa phase enfantine — « ça marche / ça marche pas ». Il entre dans sa phase adulte : quel usage on en fait dans un cadre institutionnel. Pangram a réussi le premier verrou technique. La société doit maintenant régler le deuxième : accepter qu'un outil à 99,98 % de précision produit quand même, à l'échelle française, des milliers d'accusations infondées par an. Et se doter des garde-fous procéduraux qui vont avec.
Article source : Libération CheckNews — « IA et littérature : le logiciel Pangram est-il vraiment fiable ? » (23 septembre 2026, réservé aux abonnés).