Comment on fabrique un glossaire explicatif Trois régimes pour dire d’où vient le sens d’un mot, des sources citées mot pour mot, et des audits dont chaque constat est vérifié avant d’être accepté.
Les glossaires explicatifs d’ARGUS comptent, selon la langue, de 94 à 135 entrées. Chaque entrée suit le même ordre : le sens commun du mot, ou son sens établi dans un domaine ; son emploi dans ARGUS ; ce avec quoi il ne faut pas le confondre ; les entrées voisines. Une note d’origine s’y ajoute lorsque la provenance du mot éclaire la lecture.
La Design Note 02 explique pourquoi chaque glossaire a été rédigé à partir du seul protocole de sa langue. Celle-ci décrit comment une notice est faite, et ce que les contrôles successifs ont trouvé entre le 10 et le 26 septembre 2026. Sauf mention contraire, les chiffres cités sont ceux des glossaires explicatifs 1.0.0.
La première phrase doit suffire à comprendre
Le champ « Dans ARGUS » est le cœur de la notice. Il est tiré du protocole, à l’endroit où celui-ci définit ou emploie la notion. Le glossaire français en fixe l’exigence : si l’on ne garde que le terme et la première phrase de ce champ, le lecteur doit pouvoir expliquer correctement la notion à quelqu’un d’autre. Les conditions, les exceptions et les renvois aux étapes viennent ensuite, et aucun ne peut être supprimé ou atténué pour simplifier la lecture.
Ainsi, dans le glossaire français, un contrôle est « une question de vérification définie avant d’être menée et comptée comme une seule unité ». La suite précise que chaque contrôle reçoit l’un des trois statuts prévus en 3.B, et que toute analyse déclare trois nombres, un par statut.
Le champ « Dans ARGUS » ne dit rien que le protocole ne dise. Dans les glossaires allemand et portugais, chaque citation du protocole est comparée au texte du protocole par un script avant tout audit. L’audit du portugais a encore relevé une notice qui distinguait deux termes par des phrases définitoires que le protocole ne formule pas ; elles ont été remplacées.
Chaque notice reçoit un régime, qui dit d’où vient le sens du mot
Le régime décide de la forme de la notice. Il y en a trois.
Au régime A, un mot ordinaire reçoit dans ARGUS un sens précis. Contrôle en est un exemple : le lecteur connaît le mot, il ne connaît pas l’unité de compte.
Au régime B, le mot est un terme établi d’un domaine, et la notice donne ce « sens établi » avant l’emploi ARGUS. Assertorique vient de la classification kantienne des jugements, où il occupe le degré médian entre le problématique et l’apodictique. Dans ARGUS, il désigne le degré le plus élevé d’une échelle d’engagement qui en compte quatre. La notice doit dire les deux, car un lecteur qui connaît Kant lirait sinon l’échelle de travers.
Au régime C, l’expression est une création du protocole, sans sens antérieur. Nuance verrouillée en est un exemple : selon le glossaire français, une nuance « intégrée de telle manière qu’elle renforce ou protège la conclusion au lieu de l’ouvrir ». Le champ « À ne pas confondre » y compte davantage qu’ailleurs, car l’expression, faite de mots courants, donne au lecteur l’impression de la comprendre.
Le régime appartient à la notice, dans sa langue. Une même notion peut être en B dans une langue et en A dans une autre, soit parce que la langue ne dispose pas du même terme établi, soit parce que la preuve disponible diffère. Le glossaire portugais range ainsi deferência au régime A, là où l’espagnol et l’allemand rangent la notion en B : un emploi en droit administratif a été signalé par la recherche, mais la source n’a pas pu être lue. Faute de source lue, la notice n’en dit rien, et le point reste ouvert.
Le régime C affirme une absence, et doit la prouver
Dire qu’une expression n’a pas de sens avant ARGUS, c’est affirmer que personne ne l’employait. C’est l’affirmation la plus difficile à établir, et les audits l’ont souvent mise en défaut.
Audit croisé, qui nomme le deuxième niveau de contradiction prévu par le protocole, a d’abord été classé au régime C en français, en anglais et en allemand. Dans les trois langues, l’expression s’est révélée attestée avant ARGUS dans la pratique de la qualité et de l’audit. Les trois notices sont passées au régime A, et mentionnent désormais cet emploi antérieur.
Le chantier allemand a posé une règle, reprise en portugais. Une entrée n’est classée C que si trois vérifications sont faites et consignées : les dictionnaires consultés ne donnent pas l’expression ; la recherche n’a trouvé aucun emploi établi dans un domaine ; le protocole construit lui-même la notion. Faute de quoi l’entrée reste au régime A, où la notice cite le sens de chacun des mots qui composent l’expression. Ce choix prudent n’affirme aucune absence.
La règle n’a pas suffi du premier coup. La première version allemande comptait 17 entrées en C. Les huit constats majeurs de son audit portaient tous sur des entrées de ce régime : les recherches négatives n’avaient pas visé les littératures de domaine, comme le droit, la qualité ou les études littéraires. Sept de ces entrées sont passées en A, une en B, et neuf restent en C.
L’effet est visible dans les chiffres. Le régime C compte 44 entrées sur 109 en français, 44 sur 108 en anglais, 46 sur 115 en espagnol et 33 sur 94 en italien ; il en compte 9 sur 134 en allemand et 10 sur 135 en portugais. L’écart tient à la règle : six notions classées C en espagnol, comme la contre-épreuve courte ou le test de substitution, sont en A en allemand et en portugais. Huit notions restent en C dans ces trois langues, parmi lesquelles la nuance verrouillée, la propagande adaptée et le conformisme de série.
Dans la version 1.0.0, les quatre premiers glossaires n’ont pas été réexaminés sous cette règle. Ils avaient été gelés le 24 septembre, la veille du jour où elle a été posée. Un glossaire gelé ne se rouvre que pour un défaut documenté ou une décision d’inventaire. Une entrée classée C sous l’ancienne règle reste peut-être juste ; sa preuve est plus faible que celle exigée aujourd’hui, et seule une recherche nouvelle, suivie d’un audit, dirait si elle tient. Pour les 167 entrées concernées, cette révision n’a pas été faite dans la version 1.0.0 ; elle figure parmi les travaux réservés à une version suivante. Les glossaires portent ainsi la date de leur méthode, et les chiffres ci-dessus en gardent la trace.
Une source se cite mot pour mot, avec son adresse et sa date
La règle sur les affirmations d’usage a été posée pendant le chantier espagnol, et le rédacteur l’a enfreinte le jour même. La notice zetética écrivait que la recherche n’avait trouvé aucun emploi installé du couple zetética / dogmática dans la littérature juridique en espagnol. Le contre-audit a produit quatre pièces qui l’attestent, dont une revue de droit péruvienne et le programme d’un congrès de philosophie du droit. La leçon en est restée : une recherche qui ne trouve rien n’établit rien.
Les affirmations de fréquence suivent la même règle. Le glossaire espagnol disait d’un sens qu’il était « el más frecuente », d’un mot qu’il « no tiene uso corriente en castellano ». Le dictionnaire de référence ne mesure pas la fréquence : les six affirmations de ce type ont été retirées, et chacune remplacée par ce que le dictionnaire enregistre ou n’enregistre pas. Pour hombre de paja, le remplacement a renforcé la mise en garde : le dictionnaire ne donne à la locution que le sens de prête-nom.
Dans les glossaires allemand et portugais, chaque source externe est citée mot pour mot, avec l’ouvrage, l’entrée, l’acception, l’adresse et la date de consultation. Chacun des deux glossaires compte plus de 450 adresses de ce type. Pour matiz bloqueado, l’équivalent portugais de la nuance verrouillée, la notice écrit que l’expression ne figure ni dans le dictionnaire Priberam, consulté le 25 septembre, ni dans le dictionnaire Infopédia, consulté le 26, puis cite le sens de chacun des deux mots. La notice française de la même notion, rédigée deux semaines plus tôt, s’en tient à deux phrases, sans source. Une source illisible, payante ou bloquée n’est pas contournée ; le point reste ouvert. Deux documents que l’outil de lecture ne pouvait pas atteindre ont été fournis en PDF par un responsable du projet, puis lus.
Chaque version se mesure, et une version gelée ne se corrige plus
Les notices sont rédigées dans des fichiers de travail, par groupes d’entrées. Un script les assemble en un glossaire, vérifie sa structure et ses renvois, et refuse d’écraser une version existante. Le fichier assemblé n’est jamais corrigé à la main : toute correction se fait dans les fichiers de travail, puis le glossaire est réassemblé. Le glossaire français a connu dix-sept versions, le portugais deux.
Chaque passage d’une version à la suivante est décrit dans un document de migration : les notices modifiées, celles qui restent identiques à l’octet près, et l’empreinte numérique de chaque fichier. Entre ses versions 0.1 et 0.2, le glossaire portugais a ajouté deux entrées, en a retiré une, en a modifié trente dans les champs annoncés, et toutes les autres sont restées identiques.
Le gel se fait sur l’accord explicite d’un responsable humain du projet. Un glossaire gelé ne se modifie plus ; une correction ouvre une nouvelle version. C’est le rendu réel de la page qui a révélé, en italien, un défaut que les relectures n’avaient pas vu : une phrase en gras contenant un mot en italique s’affichait mal. Depuis, avant le gel, le candidat passe par le générateur qui produit la page du site, et la page issue du fichier gelé doit être identique, à l’octet près, à celle du candidat validé.
Chaque constat d’audit se vérifie avant d’être accepté
Chaque glossaire a été audité par une autre IA, sur un paquet dont le contenu est vérifié par script avant l’envoi : le glossaire, le protocole de sa langue, la migration et, en allemand et en portugais, les sources lues. Aucun constat n’est accepté sur la foi de l’auditeur. Il est vérifié dans le protocole ou dans la source avant d’être concédé, et ce qui n’a pas pu être vérifié est déclaré.
Ce contrôle joue dans les deux sens. L’audit allemand datait de 2020 un article paru en 2021, et de 1917 une publication de 1921 ; les deux dates ont été corrigées avant usage. Pour une autre entrée, l’auditeur proposait le régime B ; la vérification a montré que le sens établi portait sur un autre objet, l’entrée est passée en A, et l’audit suivant a retiré sa recommandation.
Ce que les audits ont trouvé tient en quelques familles : des régimes C sans preuve, des affirmations d’usage sans source, des conditions du protocole absentes d’une notice, des citations mal transcrites. L’audit portugais a relevé 29 citations du protocole dont les guillemets internes avaient été changés ; la consigne venait du mandat de rédaction, et le glossaire ne la déclarait pas.
Certains défauts échappent à l’audit, parce qu’aucune grille ne les couvre. Le contrôle final du glossaire espagnol a trouvé deux lignes d’arbitrage, en français, restées dans le corps de deux notices.
Les notes de suivi du chantier tiennent enfin la liste des erreurs du rédacteur, quelle que soit la façon dont elles ont été trouvées : l’instrument de comptage s’est trompé cinq fois avant d’être juste, et une page 96 avait été citée comme la page 95.
Ce que la méthode laisse ouvert
Les citations des glossaires allemand et portugais reproduisent le texte des pages tel que l’outil de lecture l’a restitué. En allemand, un échantillon tiré au hasard a été relu sur la page ; le glossaire portugais déclare que la vérification sur l’original reste à faire.
Chaque glossaire déclare ses points ouverts dans une note de travail, 19 pour le portugais ; ces notes figurent dans les fichiers gelés, et la page du site ne les affiche pas.
Les quatre premiers glossaires n’ont pas non plus été repris sous la règle des citations datées. Les glossaires français et anglais renvoient encore, à quelques reprises, à un point « 3.A » que le protocole ne nomme jamais ainsi.
Le travail pourrait ne jamais finir : on trouvera toujours un point à améliorer. En septembre, le glossaire français a été gelé quatre fois et rouvert trois fois, entre ses versions de travail 0.10 et 0.17. Pour que le chantier puisse s’arrêter, les six glossaires gelés forment désormais une version commune, 1.0.0. Une version gelée ne se modifie plus ; les améliorations connues sont réservées à une version suivante, qui les traitera ensemble et portera un nouveau numéro.
Encadré : ce que cela coûte
Aucun relevé d’ensemble n’a été fait ; ce qui suit est qualitatif.
Le plus coûteux a été de relire le protocole entier, qui compte près de 1 100 lignes. Au chantier allemand, plusieurs agents d’IA lancés en même temps relisaient chacun le protocole et leur propre historique à chaque étape ; certains ont été coupés par la limite d’usage avant d’avoir écrit leur travail, qui a été perdu. Les audits coûtent aussi, avec la préparation de leur paquet et la vérification de chaque constat. Les consultations de dictionnaire, elles, ont peu coûté.
Trois choix ont réduit la dépense au chantier portugais. Un script extrait du protocole les seuls paragraphes où chaque terme apparaît, et le rédacteur ne lit que ceux-là. La recherche dans les dictionnaires est séparée de la rédaction et confiée à un modèle plus léger. Un seul agent travaille à la fois, et un agent coupé est repris là où il s’est arrêté. Le glossaire portugais a ainsi coûté nettement moins que l’allemand, sans atteindre l’objectif de moitié qui lui avait été fixé. Ce qui a encore pesé : conduire les premières étapes dans une même conversation, où le protocole et les résultats des outils étaient relus à chaque appel.