Su ARGUS V5.1.0 e i glossari esplicativi 1.0.0 Come si costruisce un glossario esplicativo Tre regimi per dire da dove viene il senso di una parola, fonti citate parola per parola e audit in cui ogni constatazione è verificata prima di essere accettata.

I glossari esplicativi di ARGUS contano, secondo la lingua, da 94 a 135 voci. Ogni voce segue lo stesso ordine: il significato comune della parola, o il suo significato consolidato in un dominio; il suo uso in ARGUS; ciò con cui non va confusa; le voci vicine. Vi si aggiunge una nota d’origine quando la provenienza della parola aiuta la lettura.

La Design Note 02 spiega perché ogni glossario è stato redatto a partire dal solo protocollo della sua lingua. Questa descrive come si costruisce una voce, e che cosa hanno trovato i controlli successivi tra il 10 e il 26 settembre 2026. Salvo indicazione contraria, le cifre citate sono quelle dei glossari esplicativi 1.0.0.

La prima frase deve bastare a capire

Il campo «In ARGUS» è il cuore della voce. È tratto dal protocollo, nel punto in cui questo definisce o impiega la nozione. Il glossario francese ne fissa il requisito: se si conservano soltanto il termine e la prima frase di questo campo, il lettore deve poter spiegare correttamente la nozione a un’altra persona. Le condizioni, le eccezioni e i rinvii ai passi vengono dopo, e nessuno di essi può essere soppresso o attenuato per semplificare la lettura.

Così, nel glossario francese, un controllo è «una domanda di verifica definita prima di essere condotta e contata come una sola unità». Il seguito precisa che ogni controllo riceve uno dei tre esiti previsti in 3.B, e che ogni analisi dichiara tre numeri, uno per esito.

Il campo «In ARGUS» non dice nulla che il protocollo non dica. Nei glossari tedesco e portoghese, ogni citazione del protocollo è confrontata con il testo del protocollo da uno script prima di qualsiasi audit. L’audit del portoghese ha comunque rilevato una voce che distingueva due termini con frasi definitorie che il protocollo non formula; sono state sostituite.

Ogni voce riceve un regime, che dice da dove viene il senso della parola

Il regime decide la forma della voce. Ce ne sono tre.

Al regime A, una parola corrente riceve in ARGUS un senso preciso. Controllo ne è un esempio: il lettore conosce la parola, ma ignora l’unità di conteggio che designa.

Al regime B, la parola è un termine consolidato di un dominio, e la voce dà questo «significato consolidato» prima dell’uso ARGUS. Assertorico viene dalla classificazione kantiana dei giudizi, dove occupa il grado intermedio tra il problematico e l’apodittico. In ARGUS designa il più alto dei quattro gradi di impegno di una scala. La voce deve dire entrambe le cose, perché un lettore che conosce Kant leggerebbe altrimenti la scala nel senso sbagliato.

Al regime C, l’espressione è una creazione del protocollo, senza senso anteriore. Sfumatura bloccata ne è un esempio: secondo il glossario francese, una sfumatura «integrata in modo tale da rafforzare o proteggere la conclusione invece di aprirla». Il campo «Da non confondere con» vi conta più che altrove, perché l’espressione, fatta di parole correnti, dà al lettore l’impressione di capirla.

Il regime appartiene alla voce, nella sua lingua. Una stessa nozione può essere in B in una lingua e in A in un’altra, o perché la lingua non dispone dello stesso termine consolidato, o perché la prova disponibile è diversa. Il glossario portoghese colloca così deferência al regime A, mentre lo spagnolo e il tedesco collocano la nozione in B: la ricerca ha segnalato un uso nel diritto amministrativo, ma la fonte non ha potuto essere letta. In mancanza di una fonte letta, la voce non ne dice nulla, e il punto resta aperto.

Il regime C afferma un’assenza, e deve provarla

Dire che un’espressione non ha senso prima di ARGUS significa affermare che nessuno la usava. È l’affermazione più difficile da stabilire, e gli audit l’hanno spesso smentita.

Audit incrociato, che nomina il secondo livello di contraddittorio previsto dal protocollo, è stato dapprima classificato al regime C in francese, in inglese e in tedesco. Nelle tre lingue l’espressione si è rivelata attestata prima di ARGUS nella pratica della qualità e dell’audit. Le tre voci sono passate al regime A, e ora menzionano quest’uso anteriore.

Il lavoro sul tedesco ha posto una regola, ripresa per il portoghese. Una voce è classificata C solo se sono state fatte e registrate tre verifiche: i dizionari consultati non riportano l’espressione; la ricerca non ha trovato alcun uso consolidato in un dominio; il protocollo costruisce da sé la nozione. In caso contrario la voce resta al regime A, dove cita il significato di ciascuna delle parole che compongono l’espressione. Questa scelta prudente non afferma alcuna assenza.

La regola non è bastata al primo colpo. La prima versione tedesca contava 17 voci in C. Le otto constatazioni maggiori del suo audit riguardavano tutte voci di questo regime: le ricerche negative non avevano preso in esame le letterature specialistiche, come il diritto, la qualità o gli studi letterari. Sette di queste voci sono passate in A, una in B, e nove restano in C.

L’effetto si vede nelle cifre. Il regime C conta 44 voci su 109 in francese, 44 su 108 in inglese, 46 su 115 in spagnolo e 33 su 94 in italiano; ne conta 9 su 134 in tedesco e 10 su 135 in portoghese. Lo scarto dipende dalla regola: sei nozioni classificate C in spagnolo, come la controprova breve o il test di sostituzione, sono in A in tedesco e in portoghese. Otto nozioni restano in C in queste tre lingue, tra cui la sfumatura bloccata, la propaganda adattata e il conformismo di serie.

Nella versione 1.0.0, i primi quattro glossari non sono stati riesaminati secondo questa regola. Erano stati congelati il 24 settembre, il giorno prima che fosse posta. Un glossario congelato si riapre solo per un difetto documentato o per una decisione d’inventario. Una voce classificata C secondo la vecchia regola può essere ancora giusta; la sua prova è più debole di quella richiesta oggi, e solo una nuova ricerca, seguita da un audit, direbbe se regge. Per le 167 voci interessate, questa revisione non è stata fatta nella versione 1.0.0; figura tra i lavori riservati a una versione successiva. I glossari portano così la data del loro metodo, e le cifre qui sopra ne conservano la traccia.

Una fonte si cita parola per parola, con il suo indirizzo e la sua data

La regola sulle affermazioni d’uso è stata posta durante il lavoro sullo spagnolo, e il redattore l’ha violata il giorno stesso. La voce zetética scriveva che la ricerca non aveva trovato alcun uso consolidato della coppia zetética / dogmática nella letteratura giuridica in spagnolo. Il controaudit ha prodotto quattro documenti che lo attestano, tra cui una rivista di diritto peruviana e il programma di un congresso di filosofia del diritto. La lezione è rimasta: una ricerca che non trova nulla non stabilisce nulla.

Le affermazioni di frequenza seguono la stessa regola. Il glossario spagnolo diceva di un senso che era «el más frecuente», di una parola che «no tiene uso corriente en castellano». Il dizionario di riferimento non misura la frequenza: le sei affermazioni di questo tipo sono state ritirate, e ciascuna è stata sostituita da ciò che il dizionario registra o non registra. Per hombre de paja, la sostituzione ha rafforzato l’avvertenza: il dizionario dà alla locuzione il solo senso di prestanome.

Nei glossari tedesco e portoghese, ogni fonte esterna è citata parola per parola, con l’opera, il lemma, l’accezione, l’indirizzo e la data di consultazione. Ciascuno dei due glossari conta più di 450 indirizzi di questo tipo. Per matiz bloqueado, l’equivalente portoghese della sfumatura bloccata, la voce scrive che l’espressione non figura né nel dizionario Priberam, consultato il 25 settembre, né nel dizionario Infopédia, consultato il 26, poi cita il significato di ciascuna delle due parole. La voce francese della stessa nozione, redatta due settimane prima, si limita a due frasi, senza fonte. Una fonte illeggibile, a pagamento o bloccata non viene aggirata; il punto resta aperto. Due documenti che lo strumento di lettura non riusciva a raggiungere sono stati forniti in PDF da un responsabile del progetto, poi letti.

Ogni versione si misura, e una versione congelata non si corregge più

Le voci sono redatte in file di lavoro, per gruppi. Uno script le assembla in un glossario, ne verifica la struttura e i rinvii, e si rifiuta di sovrascrivere una versione esistente. Il file assemblato non viene mai corretto a mano: ogni correzione si fa nei file di lavoro, poi il glossario viene riassemblato. Il glossario francese ha conosciuto diciassette versioni, il portoghese due.

Ogni passaggio da una versione alla successiva è descritto in un documento di migrazione: le voci modificate, quelle rimaste identiche byte per byte e l’impronta crittografica di ciascun file. Tra le sue versioni 0.1 e 0.2, il glossario portoghese ha aggiunto due voci, ne ha ritirata una, ne ha modificate trenta nei campi annunciati, e tutte le altre sono rimaste identiche.

Il congelamento avviene sull’accordo esplicito di un responsabile umano del progetto. Un glossario congelato non si modifica più; una correzione apre una nuova versione. È stata la resa effettiva della pagina a rivelare, in italiano, un difetto che le riletture non avevano visto: una frase in grassetto contenente una parola in corsivo veniva visualizzata male. Da allora, prima del congelamento, il candidato passa per il generatore che produce la pagina del sito, e la pagina ottenuta dal file congelato deve essere identica, byte per byte, a quella del candidato convalidato.

Ogni constatazione d’audit si verifica prima di essere accettata

Ogni glossario è stato sottoposto all’audit di un’altra IA, su un pacchetto il cui contenuto è verificato da uno script prima dell’invio: il glossario, il protocollo della sua lingua, la migrazione e, per il tedesco e il portoghese, le fonti lette. Nessuna constatazione è accettata sulla parola dell’auditor. Viene verificata nel protocollo o nella fonte prima di essere concessa, e ciò che non è stato possibile verificare viene dichiarato.

Questo controllo vale nei due sensi. L’audit tedesco datava al 2020 un articolo uscito nel 2021, e al 1917 una pubblicazione del 1921; le due date sono state corrette prima dell’uso. Per un’altra voce, l’auditor proponeva il regime B; la verifica ha mostrato che il significato consolidato riguardava un altro oggetto, la voce è passata in A, e l’audit successivo ha ritirato la sua raccomandazione.

Ciò che gli audit hanno trovato si riduce a poche famiglie: regimi C senza prova, affermazioni d’uso senza fonte, condizioni del protocollo assenti da una voce, citazioni trascritte male. L’audit portoghese ha rilevato 29 citazioni del protocollo in cui le virgolette interne erano state cambiate; la consegna veniva dal mandato di redazione, e il glossario non la dichiarava.

Alcuni difetti sfuggono all’audit, perché nessuna griglia li copre. Il controllo finale del glossario spagnolo ha trovato due righe di arbitrato, in francese, rimaste nel corpo di due voci.

Le note di monitoraggio del lavoro tengono infine l’elenco degli errori del redattore, in qualunque modo siano stati trovati: lo strumento di conteggio ha sbagliato cinque volte prima di essere esatto, e una pagina 96 era stata citata come pagina 95.

Ciò che il metodo lascia aperto

Le citazioni dei glossari tedesco e portoghese riproducono il testo delle pagine così come lo strumento di lettura lo ha restituito. In tedesco, un campione estratto a caso è stato riletto sulla pagina; il glossario portoghese dichiara che la verifica sull’originale resta da fare.

Ogni glossario dichiara i suoi punti aperti in una nota di lavoro, 19 per il portoghese; queste note figurano nei file congelati, e la pagina del sito non le mostra.

Neppure i primi quattro glossari sono stati ripresi secondo la regola delle citazioni datate. I glossari francese e inglese rinviano ancora, in qualche caso, a un punto «3.A» che il protocollo non chiama mai così.

Il lavoro potrebbe non finire mai: si troverà sempre qualcosa da migliorare. A settembre il glossario francese è stato congelato quattro volte e riaperto tre, tra le sue versioni di lavoro 0.10 e 0.17. Perché il lavoro possa fermarsi, i sei glossari congelati formano ora una versione comune, 1.0.0. Una versione congelata non si modifica più; i miglioramenti noti sono riservati a una versione successiva, che li tratterà insieme e porterà un nuovo numero.

Riquadro: quanto costa

Non è stato fatto alcun rilevamento complessivo; ciò che segue è qualitativo.

La cosa più costosa è stata rileggere il protocollo intero, che conta quasi 1100 righe. Nel lavoro sul tedesco, diversi agenti di IA avviati contemporaneamente rileggevano ciascuno il protocollo e la propria cronologia a ogni fase; alcuni sono stati interrotti dal limite d’uso prima di aver scritto il loro lavoro, che è andato perso. Anche gli audit costano, con la preparazione del loro pacchetto e la verifica di ogni constatazione. Le consultazioni dei dizionari, invece, sono costate poco.

Tre scelte hanno ridotto la spesa nel lavoro sul portoghese. Uno script estrae dal protocollo i soli paragrafi in cui compare ciascun termine, e il redattore legge soltanto quelli. La ricerca nei dizionari è separata dalla redazione e affidata a un modello più leggero. Lavora un solo agente alla volta, e un agente interrotto riprende dal punto in cui si è fermato. Il glossario portoghese è così costato nettamente meno del tedesco, senza raggiungere l’obiettivo, che gli era stato fissato, di costarne la metà. Ciò che ha pesato ancora: condurre le prime fasi in una stessa conversazione, in cui il protocollo e i risultati degli strumenti venivano riletti a ogni chiamata.