Aller au contenu

Jeudi 8 octobre 2026

L’actualité tech, expliquée

Dernière publication · Fin de la 2G : alarmes, téléassistance et vieux mobiles à vérifier

IAExplication

AI Act oblige, OpenAI va filigraner des textes de ChatGPT dans l’UE

Dans ChatGPT et Codex, seuls les textes « éligibles » porteront un signal invisible, et seuls des chercheurs et organismes agréés auront d’abord accès au détecteur. OpenAI reconnaît qu’une retouche peut nettement l’affaiblir et qu’un texte traduit peut échapper à la détection.

Les trois icônes officielles de l’UE pour signaler un contenu généré par IA : un rond noir marqué AI, et deux étiquettes AI GENERATED et AI MODIFIED.
Les icônes mises à disposition par la Commission européenne pour étiqueter les contenus générés ou modifiés par IA. Leur reproduction ici illustre l’article ; L’Octet n’est pas signataire du code de bonnes pratiques.Icônes : Commission européenne, libre réutilisation ; composition : L’Octet

L’annonce répond à une obligation légale, et OpenAI le dit d’emblée : l’AI Act impose aux fournisseurs d’IA générative de rendre les textes produits identifiables par une machine. Rien ne changera à l’écran. Mais l’entreprise reconnaît que la détection des textes filigranés reste une technologie jeune, aux limites importantes.

Ce qu’OpenAI a annoncé le 5 octobre

Dans son billet « Our approach to EU text provenance rules », publié le 5 octobre, OpenAI décrit une approche « par étapes », qui tient compte à la fois des exigences de l’AI Act et des limites de la technique.

  • ChatGPT et Codex, dans l’UE seulement. « Dans les semaines qui viennent », OpenAI ajoutera un filigrane invisible aux textes « éligibles » produits par ChatGPT et Codex pour les utilisateurs de toutes les formules, uniquement dans l’Union européenne. Au lancement, le filigrane ne devient pas un réglage par défaut dans le reste du monde : cette approche régionale doit permettre à l’entreprise de tirer des leçons d’un usage réel.
  • L’API, sur demande. Depuis le 5 octobre, les clients de l’API, partout dans le monde, peuvent activer le filigrane pour certains modèles. L’option reste désactivée par défaut. OpenAI travaille aussi avec ses partenaires cloud pour la proposer, dans les semaines à venir, sur ses modèles accessibles via leurs services.
  • Un détecteur réservé aux spécialistes. Les chercheurs et organismes spécialisés peuvent déposer une candidature depuis le 5 octobre. L’accès sera d’abord accordé au cas par cas, « conformément au code de bonnes pratiques » européen. L’outil indiquera s’il détecte un filigrane d’OpenAI, sans identifier l’utilisateur ni révéler ses requêtes ou ses conversations. OpenAI ne l’ouvre pas au public au lancement, en raison du risque de filigranes manqués et de faux positifs.
  • Le texte seulement. Pour les images et l’audio, les outils de vérification d’OpenAI restent accessibles publiquement.

La méthode s’appelle textGrain. Elle ajoute, écrit OpenAI, « un signal statistique invisible aux choix de mots du modèle », que le détecteur recherche ensuite. Elle est décrite dans un rapport technique qu’OpenAI promet de compléter dans les semaines à venir. Ce rapport est coécrit avec des chercheurs des universités de Pennsylvanie et de Yale, selon TechCrunch. OpenAI prévoit aussi de publier la technologie en open source, « pour que d’autres puissent s’en servir ».

Deux affirmations relèvent de l’auto-évaluation, sans contrôle indépendant à ce jour. Selon OpenAI, textGrain a égalé ou dépassé les autres méthodes testées, dont SynthID de Google. Le filigrane ne dégraderait pas les réponses : sur les tests de performance de son dernier modèle de pointe, Astra, l’entreprise dit ne voir aucune différence notable avec et sans filigrane.

Ce que dit la loi : marquer n’est pas étiqueter

L’AI Act distingue deux obligations que l’on confond souvent. Marquer un contenu, c’est le rendre reconnaissable par une machine. L’étiqueter, c’est prévenir les humains. Elles ne pèsent pas sur les mêmes acteurs.

Marquage (article 50, § 2) Étiquetage des textes (article 50, § 4)
Qui Les fournisseurs de systèmes d’IA générative (OpenAI, Google…) Les « déployeurs » qui publient avec l’IA (entreprises, médias, administrations)
Quoi Sorties marquées « dans un format lisible par machine » Indiquer que le texte a été généré ou manipulé par une IA
Quels contenus Audio, image, vidéo, texte Textes publiés pour informer le public sur des questions d’intérêt public
Exceptions Notamment « une fonction d’assistance pour la mise en forme standard » Texte soumis à un examen humain ou à un contrôle éditorial, sous la responsabilité éditoriale d’une personne
Échéance 2 août 2026 ; 2 décembre 2026 pour les systèmes déjà sur le marché avant le 2 août 2026 2 août 2026

Le marquage, à la charge des fournisseurs. C’est l’article 50, paragraphe 2 qui concerne OpenAI. Les fournisseurs « veillent à ce que les sorties des systèmes d’IA soient marquées dans un format lisible par machine et identifiables comme ayant été générées ou manipulées par une IA ». Le texte n’impose aucune technique. Il demande des solutions « aussi efficaces, interopérables, solides et fiables que la technologie le permet, compte tenu des spécificités et des limites des différents types de contenus ».

L’étiquetage, à la charge des « déployeurs ». Le paragraphe 4 vise ceux qui publient. Pour les hypertrucages (« deepfakes »), ils doivent signaler que le contenu est artificiel. Pour le texte, l’obligation est plus étroite : elle tombe lorsque le texte « a fait l’objet d’un processus d’examen humain ou de contrôle éditorial » et qu’une personne « assume la responsabilité éditoriale de la publication ». Un article relu et signé par une rédaction n’a donc pas à porter de mention. Un fil d’information publié automatiquement, si.

Le paragraphe 1 ajoute une troisième obligation, plus familière : prévenir les gens lorsqu’ils discutent avec une IA et non avec un humain.

Le calendrier

  • 10 juin 2026. La Commission publie un code de bonnes pratiques sur le marquage et l’étiquetage des contenus générés par IA.
  • 8 juillet 2026. Adoption du règlement (UE) 2026/1744, dit « omnibus numérique sur l’IA », publié au Journal officiel le 24 juillet.
  • 2 août 2026. Les obligations de transparence de l’article 50 s’appliquent, selon la Commission.
  • 5 octobre 2026. Billet d’OpenAI. Activation possible du filigrane dans l’API, ouverture des candidatures pour le détecteur.
  • « Dans les semaines qui viennent ». Filigrane sur ChatGPT et Codex dans l’UE, offre chez les partenaires cloud, mise à jour du rapport technique.
  • 2 décembre 2026. Date limite du marquage pour les systèmes mis sur le marché avant le 2 août 2026.

Ce délai vient de l’omnibus : il ajoute à l’AI Act une disposition transitoire qui ne vise que le marquage du paragraphe 2. Le règlement justifie cette période de quatre mois par la nécessité de laisser les fournisseurs adapter leurs pratiques sans perturber le marché. ChatGPT étant sur le marché bien avant août, le calendrier d’OpenAI semble taillé pour cette échéance de décembre. C’est notre lecture : le billet ne mentionne pas cette date.

Le code de bonnes pratiques et les icônes européennes

Le code de bonnes pratiques a deux volets : l’un pour les fournisseurs (marquage et détection), l’autre pour les déployeurs (étiquetage des hypertrucages et des textes). L’adhésion est volontaire, mais elle offre un cadre reconnu à l’échelle de l’UE pour démontrer sa conformité. Environ 190 entreprises et organisations l’avaient signé fin juillet, selon la Commission. OpenAI s’y réfère pour l’accès à son détecteur. Elle en est signataire pour le volet fournisseurs, selon la Commission, aux côtés notamment d’Anthropic, Google, Meta, Microsoft et Mistral.

Pour l’étiquetage visible, la Commission propose trois icônes européennes : une icône générale, une icône « entièrement généré par IA » et une icône « partiellement modifié par IA ». Elle le précise : l’usage des icônes est facultatif, l’étiquetage exigé par l’article 50 ne l’est pas.

Comment on cache une signature dans des mots

Pour une image, on peut ajouter des métadonnées ou modifier imperceptiblement des pixels. OpenAI rappelle d’ailleurs qu’elle combine les deux pour ses images. Un texte, lui, ne peut rien cacher sans changer. Les filigranes de texte jouent donc sur le seul levier disponible : le choix des mots.

Un modèle de langage écrit « token » par « token », des fragments de mots. À chaque étape, il attribue une probabilité à des milliers de suites possibles, puis il en tire une. La méthode qui a popularisé l’idée a été publiée en janvier 2023 par une équipe de chercheurs universitaires (Kirchenbauer et al.). Avant chaque mot, un calcul pseudo-aléatoire fondé sur le mot précédent (ou, dans la variante privée, sur une clé secrète) désigne une « liste verte » de tokens. Le modèle est alors légèrement poussé à les choisir. Le lecteur ne voit rien : le texte reste naturel. Un détecteur capable de refaire ce calcul compte les mots « verts ». S’il en trouve beaucoup plus que le hasard ne le permet, un test statistique conclut au filigrane.

Google applique un principe voisin avec SynthID Text : une fonction pseudo-aléatoire ajuste les probabilités du modèle pendant la génération, et le détecteur répond « filigrané », « non filigrané » ou « incertain ». OpenAI n’entre pas dans ce détail pour textGrain dans son billet. Selon TechCrunch, qui s’appuie sur le rapport technique, le détecteur travaille à partir du seul texte et d’une clé secrète.

Les limites, chiffrées par OpenAI

Ces faiblesses ne sont pas des critiques extérieures : OpenAI publie elle-même ses chiffres. Les taux selon la longueur et le type de texte sont mesurés avec un taux de faux positifs cible de 1 %.

Situation testée par OpenAI Taux de détection
Texte de 200 tokens (sujet de psychologie) environ 80 %
Texte de 400 tokens (sujet de psychologie) environ 95 %
Texte de 400 tokens, 10 % des mots remplacés par des synonymes environ 66 % (contre 92 % sans retouche)
Texte de 400 tokens, 25 % des mots remplacés 17 %
Réponses de mathématiques « nettement plus faible »
  • La retouche. Le signal est porté par les mots : en les changeant, on l’efface peu à peu. Google fait le même constat pour SynthID : la confiance du détecteur peut fortement baisser quand un texte est entièrement réécrit.
  • La traduction. Un texte traduit n’a plus les mots d’origine. OpenAI range la traduction parmi les causes d’échec et dit étudier la résistance des filigranes à la retouche et à la traduction. La documentation de SynthID le signale aussi.
  • Les textes courts. Le test statistique a besoin de matière : moins il y a de mots, moins la détection est sûre.
  • Les réponses contraintes. Quand il n’y a qu’une bonne réponse, le modèle n’a pas de marge pour glisser un signal. OpenAI l’observe en mathématiques, où le choix des mots est moins libre. Google note de même que le filigrane est moins efficace sur les réponses factuelles.
  • Un adversaire décidé. Google le dit sans détour : SynthID n’est pas conçu pour arrêter des adversaires déterminés.

Ces limites ont contribué, écrit OpenAI, à sa décision de réserver d’abord le détecteur à des chercheurs et organismes agréés. Le législateur en a tenu compte : l’article 50 n’exige pas une détection infaillible, mais des solutions aussi fiables « que la technologie le permet ».

Ce qu’un filigrane ne dit pas

Le billet y consacre une section entière. Selon OpenAI, un filigrane détecté :

  • ne mesure pas la part humaine. Il peut indiquer qu’un système d’OpenAI a généré ou traité une partie d’un passage, « mais pas quelle part de jugement, de retouche ou de créativité humaine s’y trouve » ;
  • n’établit ni propriété ni responsabilité. Il ne dit pas à qui appartient le texte, si son usage était légal, si une mention était obligatoire, ni qui en répond ;
  • n’identifie personne. Il n’associe au texte ni personne, ni organisation, ni compte, ni requête, ni conversation ;
  • ne garantit pas l’exactitude. Il ne dit pas si un passage est vrai, trompeur ou sorti de son contexte.

À l’inverse, l’absence de filigrane ne prouve pas qu’un humain a écrit le texte. Celui-ci peut être trop court, retouché ou traduit. Il peut aussi venir d’un modèle non couvert, être antérieur au filigrane ou avoir été produit par l’outil d’une autre entreprise.

Ce qui change pour vous

  • À l’écran, rien. Le filigrane est invisible.
  • Vos textes deviennent potentiellement détectables. Un texte copié tel quel depuis ChatGPT emporte son filigrane, puisque celui-ci est dans les mots eux-mêmes. Pour l’instant, seuls des chercheurs et organismes agréés auront accès au détecteur.
  • Ce n’est pas un détecteur de triche. Pour un enseignant ou un recruteur, ni la présence ni l’absence d’un filigrane ne règle la question, au vu des taux publiés et des avertissements d’OpenAI elle-même.
  • Pour les entreprises et les médias, l’obligation propre à l’AI Act reste l’étiquetage (paragraphe 4). Elle vise les textes d’intérêt public qui n’ont pas été relus par un humain ou dont personne n’assume la responsabilité éditoriale.

Ce que l’on ne sait pas encore

  • La liste exacte des textes « éligibles » : le code produit par Codex est-il filigrané ? Les réponses très courtes le sont-elles ? Le billet ne le précise pas.
  • Quand et à quelles conditions le détecteur sera ouvert au-delà des chercheurs. OpenAI dit seulement qu’elle l’élargira lorsque les résultats pourront être interprétés de manière responsable.
  • Si un format commun émergera entre fournisseurs. La loi exige des solutions « interopérables », alors que chacun marque ses textes avec sa propre méthode et ses propres clés : Google recommande de garder privée la configuration de SynthID Text. La publication en open source de textGrain, annoncée sans date, pourrait changer la donne.
  • Comment les autorités chargées d’appliquer l’AI Act apprécieront, après le 2 décembre, des solutions qui, selon les chiffres de leurs propres concepteurs, résistent mal à la retouche.

À lire aussi