Sobre ARGUS V5.1.0 e os glossários explicativos 1.0.0 Como se constrói um glossário explicativo Três regimes para dizer de onde vem o sentido de uma palavra, fontes citadas palavra por palavra e auditorias em que cada constatação é verificada antes de ser aceite.

Os glossários explicativos do ARGUS contam, conforme a língua, entre 94 e 135 entradas. Cada entrada segue a mesma ordem: o sentido comum da palavra, ou o seu sentido estabelecido num domínio; o seu uso no ARGUS; aquilo com que não deve ser confundida; as entradas vizinhas. Acrescenta-se uma nota de origem quando a proveniência da palavra ajuda a lê-la.

A Design Note 02 explica porque é que cada glossário foi redigido apenas a partir do protocolo da sua língua. Esta descreve como se constrói uma entrada, e o que os sucessivos controlos encontraram entre 10 e 26 de setembro de 2026. Salvo indicação em contrário, os números citados são os dos glossários explicativos 1.0.0.

A primeira frase tem de bastar para compreender

O campo «Em ARGUS» é o núcleo da entrada. É extraído do protocolo, do ponto em que este define ou emprega a noção. O glossário francês fixa a exigência: se se conservarem apenas o termo e a primeira frase deste campo, o leitor deve poder explicar corretamente a noção a outra pessoa. As condições, as exceções e as remissões para as etapas vêm depois, e nenhuma pode ser suprimida ou atenuada para simplificar a leitura.

Assim, no glossário francês, um controlo é «uma pergunta de verificação definida antes de ser conduzida e contada como uma única unidade». O resto do campo precisa que cada controlo recebe um dos três estatutos previstos em 3.B, e que toda a análise declara três números, um por estatuto.

O campo «Em ARGUS» não diz nada que o protocolo não diga. Nos glossários alemão e português, cada citação do protocolo é comparada com o texto do protocolo por um script antes de qualquer auditoria. Ainda assim, a auditoria do português detetou uma entrada que distinguia dois termos por frases definitórias que o protocolo não formula; foram substituídas.

Cada entrada recebe um regime, que diz de onde vem o sentido da palavra

O regime decide a forma da entrada. Há três.

No regime A, uma palavra corrente recebe no ARGUS um sentido preciso. Controlo é um exemplo: o leitor conhece a palavra, mas desconhece a unidade de contagem que ela designa.

No regime B, a palavra é um termo estabelecido de um domínio, e a entrada dá esse «sentido estabelecido» antes do uso ARGUS. Assertórico vem da classificação kantiana dos juízos, onde ocupa o grau intermédio entre o problemático e o apodítico. No ARGUS, designa o mais alto dos quatro graus de compromisso de uma escala. A entrada tem de dizer as duas coisas, porque, de outro modo, um leitor que conheça Kant leria mal a escala.

No regime C, a expressão é uma criação do protocolo, sem sentido anterior. Matiz bloqueado é um exemplo: segundo o glossário francês, um matiz «integrado de tal maneira que reforça ou protege a conclusão em vez de a abrir». O campo «Não confundir com» pesa aí mais do que noutros casos, porque a expressão, feita de palavras correntes, dá ao leitor a impressão de a compreender.

O regime pertence à entrada, na sua língua. Uma mesma noção pode estar em B numa língua e em A noutra, quer porque a língua não dispõe do mesmo termo estabelecido, quer porque a prova disponível difere. O glossário português coloca assim deferência no regime A, enquanto o espanhol e o alemão colocam a noção em B: a pesquisa assinalou um uso em direito administrativo, mas a fonte não pôde ser lida. Na falta de fonte lida, a entrada nada diz a esse respeito, e o ponto fica em aberto.

O regime C afirma uma ausência, e tem de a provar

Dizer que uma expressão não tem sentido antes do ARGUS é afirmar que ninguém a empregava. É a afirmação mais difícil de estabelecer, e as auditorias desmentiram-na muitas vezes.

Auditoria cruzada, que nomeia o segundo nível de contraditório previsto pelo protocolo, foi primeiro classificada no regime C em francês, em inglês e em alemão. Nas três línguas, a expressão revelou-se atestada antes do ARGUS na prática da qualidade e da auditoria. As três entradas passaram ao regime A e mencionam agora esse uso anterior.

O trabalho sobre o alemão estabeleceu uma regra, retomada em português. Uma entrada só é classificada C se forem feitas e registadas três verificações: os dicionários consultados não registam a expressão; a pesquisa não encontrou nenhum uso estabelecido num domínio; o próprio protocolo constrói a noção. Caso contrário, a entrada fica no regime A, onde cita o sentido de cada uma das palavras que compõem a expressão. Esta escolha prudente não afirma nenhuma ausência.

A regra não bastou à primeira. A primeira versão alemã contava 17 entradas em C. As oito constatações maiores da sua auditoria incidiam todas sobre entradas deste regime: as pesquisas negativas não tinham abrangido as literaturas especializadas, como o direito, a qualidade ou os estudos literários. Sete dessas entradas passaram a A, uma a B, e nove continuam em C.

O efeito vê-se nos números. O regime C conta 44 entradas em 109 em francês, 44 em 108 em inglês, 46 em 115 em espanhol e 33 em 94 em italiano; conta 9 em 134 em alemão e 10 em 135 em português. A diferença deve-se à regra: seis noções classificadas C em espanhol, como a contraprova curta ou o teste de substituição, estão em A em alemão e em português. Oito noções continuam em C nestas três línguas, entre as quais o matiz bloqueado, a propaganda adaptada e o conformismo de série.

Na versão 1.0.0, os quatro primeiros glossários não foram reexaminados segundo esta regra. Tinham sido congelados a 24 de setembro, na véspera do dia em que ela foi estabelecida. Um glossário congelado só se reabre por um defeito documentado ou por uma decisão de inventário. Uma entrada classificada C segundo a regra antiga pode continuar certa; a sua prova é mais fraca do que a que hoje se exige, e só uma nova pesquisa, seguida de uma auditoria, diria se se mantém. Para as 167 entradas em causa, essa revisão não foi feita na versão 1.0.0; figura entre os trabalhos reservados a uma versão seguinte. Os glossários trazem assim a data do seu método, e os números acima guardam a marca disso.

Uma fonte cita-se palavra por palavra, com o seu endereço e a sua data

A regra sobre as afirmações de uso foi estabelecida durante o trabalho sobre o espanhol, e o redator infringiu-a no próprio dia. A entrada zetética escrevia que a pesquisa não tinha encontrado nenhum uso consolidado do par zetética / dogmática na literatura jurídica em espanhol. A contra-auditoria apresentou quatro documentos que o atestam, entre os quais uma revista de direito peruana e o programa de um congresso de filosofia do direito. A lição ficou: uma pesquisa que não encontra nada não estabelece nada.

As afirmações de frequência seguem a mesma regra. O glossário espanhol dizia de um sentido que era «el más frecuente», de uma palavra que «no tiene uso corriente en castellano». O dicionário de referência não mede a frequência: as seis afirmações deste tipo foram retiradas, e cada uma foi substituída pelo que o dicionário regista ou não regista. No caso de hombre de paja, a substituição reforçou o aviso: o dicionário só dá à locução o sentido de testa de ferro.

Nos glossários alemão e português, cada fonte externa é citada palavra por palavra, com a obra, a entrada, a aceção, o endereço e a data de consulta. Cada um dos dois glossários conta mais de 450 endereços deste tipo. Para matiz bloqueado, a forma portuguesa da noção a que o francês chama nuance verrouillée, a entrada escreve que a expressão não figura nem no dicionário Priberam, consultado a 25 de setembro, nem no dicionário Infopédia, consultado a 26, e depois cita o sentido de cada uma das duas palavras. A entrada francesa da mesma noção, redigida duas semanas antes, limita-se a duas frases, sem fonte. Uma fonte ilegível, paga ou bloqueada não é contornada; o ponto fica em aberto. Dois documentos que a ferramenta de leitura não conseguia alcançar foram fornecidos em PDF por um responsável do projeto, e depois lidos.

Cada versão mede-se, e uma versão congelada já não se corrige

As entradas são redigidas em ficheiros de trabalho, por grupos. Um script reúne-as num glossário, verifica a sua estrutura e as suas remissões, e recusa-se a sobrescrever uma versão existente. O ficheiro reunido nunca é corrigido à mão: toda a correção se faz nos ficheiros de trabalho, e o glossário é depois reunido de novo. O glossário francês conheceu dezassete versões, o português duas.

Cada passagem de uma versão à seguinte é descrita num documento de migração: as entradas modificadas, as que permanecem idênticas byte a byte e a impressão digital criptográfica de cada ficheiro. Entre as suas versões 0.1 e 0.2, o glossário português acrescentou duas entradas, retirou uma e modificou trinta nos campos anunciados, e todas as outras permaneceram idênticas.

A congelação faz-se com o acordo explícito de um responsável humano do projeto. Um glossário congelado já não se altera; uma correção abre uma nova versão. Foi a apresentação real da página que revelou, em italiano, um defeito que as releituras não tinham visto: uma frase a negrito que continha uma palavra em itálico era mal apresentada. Desde então, antes da congelação, o candidato passa pelo gerador que produz a página do site, e a página obtida a partir do ficheiro congelado tem de ser idêntica, byte a byte, à do candidato validado.

Cada constatação de auditoria verifica-se antes de ser aceite

Cada glossário foi auditado por outra IA, sobre um pacote cujo conteúdo é verificado por script antes do envio: o glossário, o protocolo da sua língua, a migração e, em alemão e em português, as fontes lidas. Nenhuma constatação é aceite pela palavra do auditor. É verificada no protocolo ou na fonte antes de ser concedida, e o que não pôde ser verificado é declarado.

Este controlo funciona nos dois sentidos. A auditoria alemã datava de 2020 um artigo publicado em 2021, e de 1917 uma publicação de 1921; as duas datas foram corrigidas antes de serem usadas. Para outra entrada, o auditor propunha o regime B; a verificação mostrou que o sentido estabelecido dizia respeito a outro objeto, a entrada passou a A, e a auditoria seguinte retirou a sua recomendação.

O que as auditorias encontraram cabe em poucas famílias: regimes C sem prova, afirmações de uso sem fonte, condições do protocolo ausentes de uma entrada, citações mal transcritas. A auditoria portuguesa detetou 29 citações do protocolo cujas aspas internas tinham sido alteradas; a instrução vinha do mandato de redação, e o glossário não a declarava.

Alguns defeitos escapam à auditoria, porque nenhuma grelha os cobre. O controlo final do glossário espanhol encontrou duas linhas de arbitragem, em francês, que tinham ficado no corpo de duas entradas.

As notas de acompanhamento do trabalho mantêm, por fim, a lista dos erros do redator, seja qual for a forma como foram encontrados: o instrumento de contagem enganou-se cinco vezes antes de acertar, e uma página 96 tinha sido citada como página 95.

O que o método deixa em aberto

As citações dos glossários alemão e português reproduzem o texto das páginas tal como a ferramenta de leitura o devolveu. Em alemão, uma amostra tirada ao acaso foi relida na página; o glossário português declara que a verificação no original está por fazer.

Cada glossário declara os seus pontos em aberto numa nota de trabalho, 19 no caso do português; essas notas figuram nos ficheiros congelados, e a página do site não as mostra.

Os quatro primeiros glossários também não foram revistos segundo a regra das citações datadas. Os glossários francês e inglês remetem ainda, algumas vezes, para um ponto «3.A» que o protocolo nunca designa assim.

O trabalho poderia nunca acabar: haverá sempre algo a melhorar. Em setembro, o glossário francês foi congelado quatro vezes e reaberto três, entre as suas versões de trabalho 0.10 e 0.17. Para que o trabalho possa parar, os seis glossários congelados formam agora uma versão comum, 1.0.0. Uma versão congelada já não se altera; as melhorias conhecidas ficam reservadas a uma versão seguinte, que as tratará em conjunto e terá um novo número.

Caixa: quanto custa

Não foi feito nenhum levantamento de conjunto; o que se segue é qualitativo.

O mais dispendioso foi reler o protocolo inteiro, que tem cerca de 1100 linhas. No trabalho sobre o alemão, vários agentes de IA lançados ao mesmo tempo reliam cada um o protocolo e o seu próprio histórico a cada passo; alguns foram interrompidos pelo limite de utilização antes de terem escrito o seu trabalho, que se perdeu. As auditorias também custam, com a preparação do seu pacote e a verificação de cada constatação. As consultas de dicionário, essas, custaram pouco.

Três escolhas reduziram a despesa no trabalho sobre o português. Um script extrai do protocolo apenas os parágrafos em que cada termo aparece, e o redator lê só esses. A pesquisa nos dicionários é separada da redação e confiada a um modelo mais leve. Trabalha um só agente de cada vez, e um agente interrompido é retomado onde parou. O glossário português custou assim claramente menos do que o alemão, sem atingir o objetivo que lhe tinha sido fixado, o de custar metade. O que ainda pesou: conduzir as primeiras fases numa mesma conversa, em que o protocolo e os resultados das ferramentas eram relidos a cada chamada.