Tracce di audit che registrano decisioni, non solo azioni: cosa devono loggare nel 2026 gli agenti finanziari pronti per il SOX
Gli auditor non accettano più un log che dice che l'agente ha fatto X. Vogliono cosa ha visto, cosa ha deciso, perché la policy lo ha permesso, e cosa è cambiato nel libro mastro. Ecco lo standard.
Di The Rexfin team
Un controller con cui ho parlato questa primavera ha descritto un momento che sta diventando comune. Il suo auditor esterno ha aperto una registrazione contabile inserita da un agente IA durante la chiusura trimestrale, poi ha posto una domanda a cui il log non poteva rispondere: non chi l’aveva registrata, ma perché l’agente pensava di essere autorizzato a farlo. Il sistema aveva registrato l’azione. Aveva registrato il timestamp, il token utente, l’importo. Ciò che non aveva registrato era la cifra che l’agente aveva recuperato, la policy che aveva verificato, la soglia con cui aveva confrontato, e il ragionamento che aveva prodotto prima di agire. Il walkthrough si è bloccato lì.
Quel divario è tutta la storia del 2026. La barra dell’audit si è spostata, e molti strumenti finanziari non si sono mossi con essa.
Il vecchio log risponde alla domanda sbagliata
Per decenni una traccia di audit rilevante ai fini SOX significava un registro di azioni: chi ha fatto cosa, quando, su quale record. Quel modello presuppone che un umano sia l’attore e che il giudizio dell’umano viva nella sua testa, raggiungibile tramite domande e walkthrough. Chiedete all’analista perché ha registrato il rateo, spiega, verificate il supporto, andate avanti.
Un agente autonomo rompe quel presupposto. Il giudizio non vive nella testa di nessuno. Vive in una chiamata transitoria al modello che, per default, non lascia traccia. Se loggate solo l’azione, avete loggato il facile 20% e perso la parte a cui gli auditor tengono davvero: la decisione.
Le linee guida COSO di quest’anno sono dirette al riguardo. Prompt, input, output, versioni di modello e configurazione, e prova della revisione umana sono trattati come parte della traccia di audit, non adiacenti ad essa. Il test dichiarato è se il record catturato è sufficiente a ricostruire su cosa ha agito l’IA e a dimostrare che il controllo ha funzionato come progettato. Ricostruire è la parola operativa. Una riga che dice agent_posted_JE_4471 non ricostruisce niente.
Quattro elementi che un log a livello di decisione deve contenere
Se prendete sul serio lo standard della ricostruzione, una voce per qualsiasi passaggio consequenziale dell’agente ha bisogno di quattro livelli. La maggior parte dei fallimenti è un livello mancante, non un log mancante.
Cosa ha visto l’agente. Le cifre, i record e il contesto esatti alimentati nella decisione, ancorati alla loro fonte. Non “ricavi del Q1” ma il saldo riconciliato specifico, la versione dei dati sottostanti, e la provenienza fino al libro mastro. Se l’input non può essere riprodotto, niente a valle è dimostrabile.
Cosa ha deciso. L’output, più i percorsi candidati considerati. Un abbinamento di riconciliazione ha una confidenza; un’anomalia segnalata ha una magnitudine; una registrazione proposta ha alternative che sono state classificate e scartate. Loggare solo il percorso scelto nasconde se la scelta fosse ragionevole.
Perché la policy lo ha permesso. Il controllo che ha autorizzato l’azione e la valutazione che è stata superata. Questo è il livello che quasi tutti saltano. “L’agente aveva il permesso” non basta. Il record dovrebbe mostrare che l’agente ha operato dentro un limite definito, una soglia di approvazione, un livello di autonomia, una regola di separazione dei compiti, e che la decisione specifica ha soddisfatto quel limite in quel momento.
Cosa è cambiato a valle. Il legame dalla decisione al suo effetto sui libri. Se la decisione dell’agente ha causato una registrazione contabile, una revisione di previsione, o una riclassificazione, la traccia deve collegare i due. Gli auditor sono ora espliciti sul fatto che la tracciabilità end-to-end delle transazioni è l’aspettativa, e che ogni punto di contatto IA dovrebbe mappare all’asserzione finanziaria che influenza, esistenza, completezza, valutazione, e così via.
Mettete insieme questi quattro e potete rispondere alla domanda dell’auditor prima che venga posta. Ometterne uno e siete tornati all’indagine, salvo che non c’è nessun umano da interrogare.
Non potete loggare l’input che non potete tracciare
Ecco la parte che diventa scomoda, e vale la pena dirla chiaramente perché limita quanto il solo logging può comprare.
Un log delle decisioni è affidabile quanto le cifre al suo interno. Se l’agente ha prelevato il “saldo di cassa” da un foglio di calcolo che nessuno ha riconciliato, potete loggarlo splendidamente, prompt completo, razionale completo, timestamp immutabile, e avete prodotto un record perfetto di una decisione inaffidabile. Il log dimostra che l’agente si è comportato in modo coerente. Non dimostra che la decisione fosse giusta, perché l’input non ha mai quadrato con niente.
Ecco perché la conversazione sul lineage del 2026 e la conversazione sul logging degli agenti sono la stessa conversazione. Gli auditor stanno chiedendo un lineage a livello di colonna che tracci i singoli campi finanziari attraverso ogni trasformazione fino alla fonte, proprio per poter dimostrare che i dati che alimentavano un controllo automatizzato erano completi e accurati prima che il controllo li toccasse. Un log a livello di decisione che fa riferimento a numeri non tracciabili soddisfa la forma e fallisce la sostanza.
Quindi il vero prerequisito per un agente pronto per il SOX non è una libreria di logging migliore. È una fonte di verità riconciliata, un unico modello finanziario che quadra con il libro mastro, a cui ogni cifra vista dall’agente può essere tracciata. Fate questo bene e il log diventa significativo: ogni input ha una provenienza, ogni output riporta a una fonte, e “cosa ha visto l’agente” è un fatto riproducibile invece che un’asserzione fiduciosa. Questa è la stessa fondazione che rende resistente a un walkthrough una più ampia traccia di audit per l’IA in finanza.
Ragionamento e calcolo non sono la stessa traccia
Un’altra distinzione che gli auditor stanno iniziando a sondare. Quando un agente “calcola” un rapporto di covenant o una varianza, cosa ha fatto la matematica?
Se il modello linguistico ha prodotto il numero, il vostro log delle decisioni sta registrando l’output di un sistema che è, per progettazione, probabilistico. Lo stesso prompt può produrre una cifra diversa in un giorno diverso, e non c’è un artefatto deterministico da rieseguire. È molto difficile da difendere come controllo automatizzato, perché lo sconto di benchmarking che gli auditor offrono per i controlli applicativi automatizzati presuppone che la logica di controllo sia stabile e il risultato riproducibile.
Il pattern difendibile separa i due. L’agente ragiona su quale calcolo eseguire e quali cifre usare; un motore deterministico esegue il calcolo; il log cattura gli input, la funzione invocata, e il risultato esatto. Rieseguitelo il trimestre successivo con gli stessi input e ottenete lo stesso numero, ogni volta. Quella riproducibilità è ciò che trasforma una voce di log in prova. Sviluppiamo il caso completo per questa separazione in perché gli agenti finanziari devono chiamare strumenti, non calcolare, e si abbina naturalmente con autonomia governata, perché il livello di policy che delimita le azioni di un agente è anche il livello che produce la riga “perché è stato permesso” nel log.
Cosa chiedere al vostro stack prima dell’auditor
Un test breve e poco glamour. Scegliete una decisione che il vostro agente ha preso il trimestre scorso e provate a rispondere, dal solo log: Quali cifre ha visto, e posso tracciare ciascuna alla fonte? Cosa ha deciso, e cosa ha scartato? Quale controllo lo ha autorizzato, e la decisione ha superato quel controllo? Cosa è cambiato nel libro mastro come risultato?
Se una qualsiasi risposta richiede di scrollare le spalle, chiedere a una persona, o rieseguire un modello e sperare, non siete pronti per il SOX: siete esposti al SOX, e il monitoraggio continuo lo farà emergere più velocemente di quanto abbia mai fatto il campionamento annuale.
Gli agenti continueranno a registrare voci e rivedere previsioni; quel treno è partito. La domanda è se ognuna di quelle mosse lascia dietro di sé un record che un auditor può ricostruire senza di voi nella stanza. Quel record inizia con cifre che tracciano a una fonte di verità riconciliata, passa attraverso un motore deterministico, e finisce nel libro mastro. Se volete vedere come si presenta una traccia a livello di decisione quando è costruita su quella fondazione, prenotate una demo e portate la vostra registrazione contabile più difficile.
Parte di L'AI Agentica in Finance Ha Prima Bisogno di un Livello di Numeri Affidabile