19 min di lettura·Aggiornato il 3 ottobre 2026

Misura di laboratorio · iaFlux Studio

Il 14 giugno 2026 otto testi sono arrivati due volte a tre controlli indipendenti che hanno lavorato in parallelo sugli stessi file, e ogni controllo ha emesso sedici valutazioni. Il controllo della lingua ne ha respinte 15 su 16 (94%), quello dei fatti 11 su 16, quello di conformità 4 su 16: tre verdetti diversi sullo stesso lavoro, e nel cantiere nessun umano ha approvato un testo.

Correzione del 3 ottobre 2026. Dal 17 settembre questa pagina diceva che i testi arrivati ai controlli erano tredici; che il controllo della lingua aveva respinto 15 valutazioni su 16 al primo giro, senza contare le correzioni successive; che il secondo giro era avvenuto altrove; che tre agenti erano stati fermati a mano e nessuno si era bloccato da solo. Ricontando i registri grezzi abbiamo trovato 8 testi, ognuno giudicato due volte nello stesso cantiere, sulla bozza e dopo la riparazione. I totali di 15, 11 e 4 bocciature su 16 valutazioni restano veri, ma sommano i due passaggi. I tre agenti «fermati a mano» erano tentativi bloccati, interrotti e rilanciati da capo dal motore del cantiere. Il resto è in fondo all’articolo, prima delle domande frequenti; il caso studio e il registro pubblico dei verdetti sono corretti allo stesso modo.

Questa relazione la firma chi ha costruito quei tre controlli e li convoca quando il lavoro lo richiede, perché non sono processi sempre accesi. Serve a chi mantiene in esercizio un sistema di agenti: CTO, responsabili innovazione, system integrator. I totali dei tre controlli escono dai registri del cantiere del 14 giugno 2026 e sono pubblici nel caso studio dal 16 settembre 2026; gli altri numeri hanno la loro data accanto. Se invece devi ancora decidere che cosa automatizzare, parti da Cosa NON automatizzare in una PMI: i processi dove l’AI fa danni.

cantiere wf_85678eac · 14 giugno 2026, 14:10:32 → 14:45:35 · 8 testi · 16 valutazioni per controllo · 3 controlli · registri grezzi non pubblici

Tre numeri che non si sommano

I tre controlli hanno guardato gli stessi file nello stesso momento, senza vedersi fra loro: ognuno ha la sua lista, in parte sovrapposta alle altre, e nessun potere sui verdetti degli altri due. “Indipendenti” qui vuol dire che nessuno ha letto il verdetto degli altri, non che girino su modelli diversi: l’errore che eventualmente condividono non è misurato. Questi sono i verdetti di entrambi i passaggi, letti dai registri.

  • 15 / 16as-editorAccenti, lessico, persona, promesse che il testo fa. Bozza 8 su 8, riparazione 7 su 8.
  • 11 / 16claim-checkNumeri, date, prezzi e nomi contro i fatti dichiarati. Bozza 5 su 8, riparazione 6 su 8.
  • 4 / 16as-complianceNomi di terzi, norme, anonimato dei clienti. Bozza 3 su 8, riparazione 1 su 8: anche i tre respinti sulla bozza sono stati riparati e giudicati di nuovo.

Quindici più undici più quattro fa trenta, e trenta non è il numero dei testi bocciati: è il numero dei verdetti negativi su 48 giudizi indipendenti, tre controlli per sedici valutazioni. Un testo respinto da tutti e tre i controlli in entrambi i passaggi comparirebbe sei volte in quella somma; tre testi su otto ci compaiono cinque volte.

Il numero che regge è il più alto dei tre, non la somma: almeno 15 valutazioni su 16 sono state negative, perché tante ne ha respinte il solo controllo della lingua. Il passo per passo di quella mezz’ora sta in un altro pezzo: la sequenza completa del cantiere del 14 giugno.

Il 94% è un numero solo: 15 valutazioni su 16 respinte dal controllo della lingua, sulla bozza e dopo la riparazione, il 14 giugno 2026. Non è la media dei tre controlli, non è la loro somma. Quando leggi una percentuale di qualità su un sistema di agenti, chiedi quale controllo l’ha prodotta e su quali passaggi.

I tre controlli del cantiere del 14 giugno 2026: sedici valutazioni ciascuno su otto testi
ControlloCosa guardaBocciature su 16Da dove viene
as-editorlingua, chiarezza, promesse che il testo fa15trascrizioni del cantiere wf_85678eac, campo verdict di as-editor
claim-checknumeri, date, prezzi e nomi contro i fatti dichiarati11stesse trascrizioni, campo verdict di claim-check
as-compliancelegge, nomi di terzi, anonimato dei clienti4stesse trascrizioni, campo verdict di as-compliance

Cosa guarda il controllo della lingua, e perché boccia quasi tutto

Il controllo della lingua legge una lista fissa: accenti e apostrofi, lessico vietato, persona (chi è “noi” e chi è “tu”), tipografia dei numeri, promesse che il testo fa senza poterle misurare. Una riga rossa vale un verdetto negativo su tutto il testo, senza media; il via libera può portare rilievi non bloccanti da sistemare, come l’unico del cantiere.

Boccia quasi tutto, e la spiegazione probabile è che ciò che cerca stia quasi sempre in superficie: quale riga abbia fatto scattare ciascuna bocciatura non è stato tabulato, quindi resta un’ipotesi. Un esempio nostro, con la data del prima e quella del poi.

Il 14 giugno 2026 il controllo della lingua del cantiere aveva segnalato parole senza accento nelle bozze di tre post del laboratorio, pubblicati il 21 aprile 2026: dei 16 accenti mancanti o sbagliati che il 2 ottobre 2026 erano ancora in pagina, ne nominava 15. La riparazione non è andata online. La mattina del 17 settembre 2026 abbiamo corretto 42 accenti in quei tre post, fra le 07:58 e le 08:00; gli altri 16 li abbiamo corretti il 3 ottobre 2026.

I testi scritti il 17 settembre per correggere e riscrivere sono passati dallo stesso controllo: via libera al quarto giro per i testi dell’onda 0 — fra cui le chiusure dei post del laboratorio, le meta, i testi del repository — e al sesto per i testi del rientro. Ogni giro è nominato nel registro pubblico dei verdetti dei gate, aperto il 17 settembre 2026.

Cosa guarda il controllo dei fatti: 11 bocciature su 16

Il 14 giugno il controllo dei fatti confrontava ogni numero, nome e data con i fogli dei fatti dichiarati: tutte e undici le sue bocciature segnalano affermazioni non tracciabili, tre anche prezzi presentati come impegno o proiezioni inventate.

È anche il controllo che si porta dietro il dato più scomodo di questo articolo: claim-check non ha un contratto scritto. Nel roster degli agent non compare, e nemmeno nel README o nel documento di architettura, mentre as-editor e as-compliance sono marcati come gate nella colonna apposita del roster. Il caso studio del 16 settembre 2026 mette claim-check all’Accampamento, dove stanno gli agenti generici: manca il contratto nel roster, non i criteri con cui giudica.

I contratti in sé non li pubblichiamo: pubblica è la riga del roster che li riassume.

Questo dato sta nel corpo e non in una nota perché cambia il peso del numero: un controllo che ha respinto 11 valutazioni su 16 senza un contratto scritto è un controllo che noi leggiamo nei registri e tu no. Il registro pubblico dei verdetti segnala l’anomalia accanto al suo nome.

Cosa guarda il controllo di conformità: 4 bocciature su 16

Il controllo di conformità guarda nomi di terzi, norme, claim pubblicitari e anonimato dei clienti. Il 14 giugno 2026 ha respinto quattro valutazioni su sedici.

Boccia meno degli altri due, e una ragione è che guarda meno cose.

Il suo no apre una riparazione, come il no degli altri due. Il 14 giugno i tre testi respinti sulla bozza hanno passato questo controllo dopo la riparazione; l’unico no successivo è su un testo che sulla bozza il controllo aveva lasciato passare con la stessa mancanza, cioè senza l’avviso legale sull’AI Act. Non decide sempre allo stesso modo: sul nome di un cliente ha fermato due bozze e ha dato il via libera a 7 valutazioni su testi che lo nominavano nel testo. Il criterio con cui questo controllo decide è interno: qui non c’è niente che tu possa ricontare da fuori.

Perché tre controlli e non uno

Un controllo unico può mediare i verdetti. Chi guarda lingua, fatti e legge insieme ha un solo giudizio da emettere: il risultato tende al compromesso, e il difetto legale finisce in coda a un elenco di virgole.

Tre controlli separati non possono mediare, perché quel giorno non si vedevano: giudicavano lo stesso file nello stesso momento. Ognuno emette il suo verdetto sulla propria materia, e chi ripara riceve i verdetti di tutti e tre, con l’istruzione di risolvere solo i rilievi dei controlli che hanno respinto.

Il costo è alto — 48 giudizi su otto testi, dentro i 229 minuti sommati degli agenti di quel pomeriggio — e non l’abbiamo scomposto per controllo; il guadagno è che nessuno dei tre può assolvere la materia di un altro.

Cosa intercetta ciascun controllo e cosa non vede
ControlloIntercettaCosa non vede
as-editoraccenti, lessico vietato, persona, tipografia dei numeri, promesse implicitese ogni numero è fra i fatti dichiarati
claim-checknumeri, nomi e date assenti dai fogli dei fatti; prezzi presentati come impegno, superlativi, promessese il testo si legge
as-compliancenomi di terzi, norme, claim pubblicitari, anonimato dei clientise il testo si legge
Tutti e trela bozza e la riparazione, un testo alla voltai falsi positivi, il tasso nel tempo

La colonna di destra è il motivo della tabella: ognuno ha un punto cieco che un altro copre, anche se le liste in parte si sovrappongono, e tutti e tre sono ciechi sui falsi positivi e sul tasso nel tempo. Che cosa sia un verificatore indipendente, e dove stia un red team, è già scritto in Agenti AI in Italia: chi li costruisce e chi li documenta.

Vale anche il verso opposto: nessuno di questi tre decide se un testo valeva la pena di essere scritto. Decidere che cosa valga la pena è una scelta di strategia, e la strategia è la prima delle cinque cose che l’AI non può fare per una PMI. E quali agenti abbiano davvero il potere di bloccare una consegna è un conto a parte, pubblicato dal 17 settembre 2026 con il criterio scritto accanto: chi può fermare una consegna e chi la sblocca.

Tre tentativi bloccati, nessuna consegna mancata: dove entra la persona

Nei registri del cantiere, fra le 14:10:32 e le 14:45:35, non c’è nessun messaggio di una persona. Dalle 14:19:28 alle 14:29:49 nessuna istanza ha scritto una riga: le otto aperte aspettavano il risultato di comandi banali, arrivato a tutte fra le 14:29:49 e le 14:30:05; i registri non dicono se qualcuno abbia autorizzato i comandi degli agenti. Tre tentativi, due del controllo della lingua e uno di riparazione, sono rimasti fermi circa tre minuti su un comando senza risposta: il motore del cantiere li ha interrotti e rilanciati da capo. Alla fine ogni lavoro è stato consegnato.

Nel cantiere nessun umano ha approvato un testo: a respingere e a far passare sono stati i tre controlli, e sette testi su otto il cantiere li ha consegnati come da far rivedere a una persona. Non è un divieto: il documento di architettura scrive che il titolare può procedere lo stesso, con la motivazione scritta e i criteri di abbandono fissati prima. Nel cantiere nessuno lo ha fatto.

Nel disegno del cantiere, la persona entra dopo la consegna. Nessuno dei 69 agenti del cantiere del 14 giugno 2026 ha scritto sui file del sito: hanno consegnato giudizi e testi strutturati, con l’elenco di che cosa cambiare e dove. L’ultima parola resta a chi guida.

Quello che questo cantiere non dice

Tre numeri buoni non fanno una misura completa. Questi sono i buchi che restano, scritti perché chi progetta i propri controlli sappia dove i nostri non arrivano.

Come sono stati ricavati questi numeri

Criterio, registri e che cosa non è ricontabile. Nessuno di questi numeri è dichiarato a memoria: escono dai registri che il sistema scrive mentre lavora — il journal.jsonl del cantiere, 511 KB, e le 69 trascrizioni, lette riga per riga, più il file di riepilogo wf_85678eac-4cc.json, che registra i tentativi bloccati e i rilanci. I verdetti vengono dal campo verdict dei risultati strutturati, dentro le stesse 69 trascrizioni: non esistono tre archivi separati, uno per controllo. Il criterio, corretto il 3 ottobre 2026: una valutazione respinta è un verdetto negativo emesso da quel controllo, sulla bozza o dopo la riparazione, e i due passaggi si sommano. Sedici sono le valutazioni emesse da ciascun controllo: otto testi, due passaggi ciascuno. I registri grezzi non sono pubblici: pubblichiamo il riassunto con la provenienza, nel caso studio del 16 settembre 2026, e dal 17 settembre 2026 il registro dei verdetti dei gate.

Cosa abbiamo corretto in questa pagina

Corretto il 3 ottobre 2026, oltre a quanto detto nella nota in apertura. Altre frasi che questa pagina diceva e che i registri non reggono, ognuna con quello che è vero:

  • «Una sola valutazione su sedici è passata senza correzioni»: l’unico via libera della lingua è arrivato dopo la riparazione, sullo stesso testo che ha passato tutti e tre i controlli
  • «compare tre volte», per un testo respinto da tre controlli: in quella somma di 30 poteva comparire fino a sei volte, e tre testi su otto ci compaiono cinque volte
  • «dodici o tredici» testi respinti: i testi erano 8, e tutti e 8 hanno avuto almeno un verdetto negativo sulla bozza, 7 su 8 dopo la riparazione
  • «229 minuti di lavoro degli agenti»: i 229 minuti sono la somma delle durate di tutte le istanze, e circa 128 sono attese del risultato di un comando o tentativi bloccati
  • «Il criterio è dichiarato prima del risultato»: il criterio scritto era quello del solo primo giro, mentre i totali sommano i due passaggi
  • le parole «tre contratti separati», citate dal caso studio: il controllo dei fatti non ha un contratto scritto, e i suoi criteri stavano nell’istruzione del cantiere
  • «non c’è “passa ma sistema”»: il via libera del controllo della lingua può portare rilievi non bloccanti con la loro correzione, e l’unico del cantiere ne aveva uno
  • «Le bocciature tipiche sono tre», fra cui «un claim scritto per un sistema e riusato per tutti»: il 14 giugno il controllo dei fatti non aveva quella regola, scritta il 17 settembre; le sue undici bocciature segnalano affermazioni non tracciabili
  • «ognuno ha una materia sola», «cieco su due terzi del problema» e il controllo dei fatti cieco su «se la frase è pubblicabile per legge»: la lista del controllo dei fatti cercava anche superlativi e promesse, come quella del controllo di conformità, e prezzi presentati come impegno; il controllo di conformità cieco su «se il numero è ricontabile»: affermazione tolta
  • «se il numero è vero e se la fonte esiste» fra le cose che il controllo della lingua non vede: ha bocciato un testo anche per un numero falso nel titolo e ha chiesto di verificare un dato alla fonte; i fogli dei fatti non li ha mai aperti
  • «Il criterio con cui questo controllo decide è cambiato il 17 settembre 2026»: la data non riguarda il contratto del controllo di conformità, che non è cambiato, né l’istruzione con cui ha giudicato il 14 giugno
  • «Un testo che non nomina nessuno e non promette niente di vincolante passa senza toccare la materia di questo controllo»: la sua istruzione guardava anche le norme, e il suo unico no dopo la riparazione è per un avviso sull’AI Act mancante
  • «chi ha scritto torna a riparare tre elenchi distinti»: a riparare erano istanze nuove dello stesso ruolo, che ricevevano i verdetti di tutti e tre i controlli, anche di quelli che avevano dato il via libera
  • «Un no legale non si corregge», «si riscrive da capo» e «si sono fermate lì»: i tre testi fermati sulla bozza dal controllo di conformità sono stati riparati e giudicati di nuovo, e ogni no portava un elenco di correzioni
  • «non per indulgenza» e «da questi registri non sono ricavabili»: i registri mostrano almeno un falso negativo del controllo di conformità, una bozza senza l’avviso sull’AI Act lasciata passare
  • «i quattro testi che avrebbero nominato un cliente senza averne il diritto»: i testi respinti per il nome erano due, e il controllo chiedeva il consenso scritto agli atti oppure di togliere il nome
  • «Nessun umano ha approvato un testo» e «Quel 14 giugno nessuno lo ha fatto»: nei registri del cantiere non c’è nessun messaggio di una persona, ma i controlli hanno fatto passare un solo testo, e gli altri sette erano da far rivedere a una persona; i registri non dicono se qualcuno abbia autorizzato i comandi degli agenti
  • «L’intervento umano è stato sul processo» e «chi guardava ha fermato il processo»: i tre tentativi bloccati li ha interrotti e rilanciati il motore del cantiere; l’ultima riga delle loro trascrizioni parla di un’interruzione dell’utente, ma compare ogni volta che un tentativo viene fermato, anche dal motore
  • «zero caduti»: tre tentativi si sono bloccati su un comando e sono stati ripetuti da capo; nessuna consegna è mancata
  • «41 parole senza accento» in «quattro post», «corretti entro le 08:30»: il 17 settembre gli accenti corretti sono stati 42, in tre post; i restanti, 16 in quei tre post e 17 nel quarto, li abbiamo corretti il 3 ottobre 2026
  • «il controllo non era mai stato puntato» su quei post: il controllo del 14 giugno aveva segnalato parole senza accento, e dei 16 accenti rimasti, mancanti o sbagliati, ne nominava 15; la riparazione non è andata online
  • «altre quattro con l’accento girato»: erano cinque, quattro corrette il 17 settembre e una ancora in pagina il 2 ottobre 2026; «13 accenti» nelle domande frequenti dei dati strutturati: cifra che non abbiamo ricontato, tolta
  • «il secondo giro» come misura che manca: il secondo passaggio è nel cantiere; manca la serie dei giri
  • «Un controllo unico media i verdetti»: era una tesi, non una misura

Che cosa è successo dopo le 14:45:35 non sta nei registri del cantiere, ma in altri registri e sul sito. Degli otto testi, quattro erano nuovi e quattro aggiornavano articoli già online. Fra le 15:00 e le 15:25 un secondo cantiere ha riparato e giudicato di nuovo tre dei quattro testi nuovi, e alla fine tutti e tre hanno passato i tre controlli.

Alle 18:54 del 14 giugno, fra tre strade proposte dall’agente che coordinava il lavoro, è stata scelta quella che l’agente consigliava: «Chirurgico ora», cioè lasciare com’erano le affermazioni già pubblicate e aggiungere solo ritocchi. Alle 19:30 sono andati online, sui quattro articoli, link nuovi o ripuliti, una nota di aggiornamento e, su uno dei quattro, una data di listino resa generica e una nuova domanda frequente sull’AI Act con l’avviso che il testo non è consulenza legale: fra questi ritocchi, l’unico chiesto dai controlli era quell’avviso. Due dei quattro articoli sono stati aggiornati senza controlli; le aggiunte agli altri due sono passate dai controlli della lingua e di conformità, non da quello dei fatti. Le riscritture del cantiere non sono andate online, ma i link, la nota di aggiornamento e la data resa generica venivano dal piano scritto dall’agente che sceglieva gli articoli da aggiornare. In serata diverse pagine del sito sono state rese anonime, e alle 21:57 sono andati online i quattro testi nuovi, in versioni ritoccate dopo l’ultimo controllo registrato: link cambiati, un nome di cliente reso anonimo, domande frequenti, riassunti e descrizioni che nessun controllo registrato aveva letto. Sui quattro articoli, le affermazioni segnalate dai controlli sono rimaste in pagina fino al 3 ottobre 2026, quando le abbiamo corrette (quelle vere con la fonte e la data, le altre tolte o riscritte), salvo alcune già tolte o riscritte fra il 24 agosto e il 30 settembre. Alcune cifre di costo sono ancora in pagina com’erano: le stiamo verificando. Il seguito della giornata viene da altri registri della stessa sessione di lavoro e dalle revisioni di WordPress; gli accenti, dalle revisioni e dalle pagine lette il 2 ottobre 2026.

Domande frequenti

Perché i tre controlli hanno dato un numero diverso di verdetti negativi sugli stessi otto testi?

Perché guardano cose diverse: il 14 giugno 2026 il controllo della lingua ha dato 15 verdetti negativi su 16 valutazioni, quello dei fatti 11 su 16, quello di conformità 4 su 16. Lo stesso testo può essere respinto da più controlli, quindi i tre numeri non si sommano. Gli otto testi sono stati giudicati due volte: sulla bozza i tre controlli ne hanno respinti 8, 5 e 3; dopo la riparazione, 7, 6 e 1.

Il 94% di valutazioni respinte (15 su 16) significa che gli agenti scrivono male?

No: misura la severità di un controllo. Sono 15 valutazioni su 16 respinte dal controllo della lingua il 14 giugno 2026, sulla bozza e dopo la riparazione. Nessuno ha verificato quante di quelle bocciature fossero ingiuste: senza i falsi positivi il 94% dice quanto il controllo è duro, non quanto chi scrive è scarso.

Serve un umano nel loop se ci sono tre controlli automatici?

Sì. Nel cantiere del 14 giugno 2026 nessun umano ha approvato un testo: a respingere sono stati i tre controlli, e sette testi su otto il cantiere li ha consegnati come da far rivedere a una persona. L’ultima parola su che cosa applicare resta a chi guida.

Cosa guarda il controllo di conformità e perché boccia meno degli altri?

Guarda nomi di terzi, norme, claim pubblicitari e anonimato dei clienti. Il 14 giugno 2026 ha dato 4 verdetti negativi su 16 valutazioni, contro i 15 del controllo della lingua: boccia meno, anche perché guarda meno cose. Quando dice no, il testo si ripara come per gli altri controlli: i tre testi respinti sulla bozza hanno passato questo controllo dopo la riparazione, e l’altro no è su un testo che sulla bozza lo aveva passato senza l’avviso legale sull’AI Act.

I numeri del cantiere del 14 giugno 2026 sono verificabili da fuori?

In parte, e da una fonte sola. Il riassunto con la provenienza è pubblico nel caso studio del 16 settembre 2026; il registro pubblico dei verdetti, aperto il 17 settembre 2026, riporta le stesse tre righe ricavate dagli stessi registri, non una verifica indipendente. Nessun terzo ha controllato questi numeri. I registri grezzi non sono pubblici e il tasso continuo dei verdetti non è misurato: chi vuole ricontare oggi si ferma al riassunto.

Antonio Santoro

Lo stesso metodo, sui tuoi numeri?

Scrivici cosa deve fare e con quali dati lavora: rispondiamo per iscritto entro un giorno lavorativo, con una proposta e un preventivo fisso.

Scrivici →