Vai al contenuto
Novità: chiedi al Rexfin Analyst Agent del tuo modello. Ogni cifra torna con la sua fonte.
← Risorse

Risorse

Allucinazioni AI nei dati finanziari: fermare l'AI che inventa numeri

L'AI inventa cifre finanziarie che sembrano giuste e non lo sono. Le prove, i danni reali, e l'unica difesa che regge davvero: un modello riconciliato.

Un controller chiede a un assistente AI il margine lordo dello scorso trimestre. Risponde in due secondi: 61,4%. Numero pulito, tono sicuro, formattato a una decimale. L’unico problema è che nessuno riesce a trovare da dove venga il 61,4%. Il libro mastro dice 58,9%. Il modello non ha prelevato una cella sbagliata. Ha prodotto un numero che non è mai esistito da nessuna parte.

Questa è un’allucinazione, e in finanza non è una stranezza. È la modalità di fallimento.

La parte scomoda è quanto plausibile appaia il numero falso. Una cifra di ricavi allucinata non arriva contrassegnata in rosso. Arriva nella stessa frase pacata di quelle corrette, spesso dentro una tabella ordinata, spesso citando una fonte che dice qualcosa di leggermente diverso. Il modello non sta mentendo in alcun senso umano. Sta facendo esattamente ciò per cui è stato costruito: predire il token successivo più probabile. Il più probabile non è lo stesso che vero. Quando l’oggetto è il vostro conto economico, quel divario è l’intero problema.

Cosa significa davvero “allucinazione” con i numeri

Le persone sentono “allucinazione” e immaginano un LLM che inventa un caso legale falso o una citazione inesistente. Con i dati finanziari è più silenzioso e più pericoloso, perché i numeri portano un’aria di precisione non guadagnata.

Tre cose vanno storte, e si sommano:

  • Fabbricazione. Il modello genera una cifra che non appare in nessuna fonte. Ha interpolato. Ha trovato per pattern matching un numero che “sembra” un margine lordo adatto a un’azienda come la vostra.
  • Attribuzione errata. Il numero è reale ma il modello lo assegna al periodo, all’entità o alla voce sbagliata. Q2 viene etichettato Q3. La cassa di una controllata viene riportata come cassa di gruppo.
  • Aritmetica sbagliata. Gli input sono giusti e il modello calcola comunque il totale sbagliato, perché i large language model tokenizzano i numeri come testo e fanno pattern matching sull’aritmetica invece di calcolarla. Abbiamo approfondito il meccanismo in perché la vostra AI sbaglia la matematica finanziaria.

C’è anche un fallimento specificamente tabulare. I dati finanziari vivono in griglie. La ricerca sul ragionamento tabulare, incluso il lavoro della linea di valutazione FAITH sulla fedeltà nel question answering su tabelle, continua a far emergere la stessa debolezza: i modelli perdono traccia di quale riga corrisponde a quale colonna, specialmente in bilanci densi con intestazioni unite, note a piè di pagina e subtotali. Uno stato patrimoniale è esattamente il tipo di documento che li manda in crisi. Il modello legge il documento giusto e restituisce comunque la cella sbagliata.

Le prove non sono più deboli

Per un po’ si poteva liquidare tutto questo come rumore dei primi tempi. Non più.

I tassi di allucinazione sui modelli generalisti più forti sono scesi a singole cifre basse su compiti di benchmark, ma due fatti guastano la tranquillità. Primo, “basso” non è zero, e un tasso di errore del 2% su un board deck con cento cifre significa spedire regolarmente numeri sbagliati. Secondo, i tassi di errore salgono nettamente fuori dalle condizioni pulite dei benchmark, con documenti finanziari reali disordinati e catene di ragionamento più lunghe. Alcuni modelli orientati al reasoning allucinano di più su certi compiti, non di meno, perché più passaggi di inferenza significano più occasioni per deviare.

La realtà operativa corrisponde a quella di laboratorio. Sondaggio dopo sondaggio tra i team dati e analytics scopre che la grande maggioranza è stata colpita almeno una volta da strumenti AI che producono dati inesatti o fabbricati. Quando gli input non sono riconciliati, il modello non ha una verità di riferimento cui ancorarsi, quindi ne confabula una plausibile.

E i fallimenti non sono accademici. Gli aneddoti che circolano tra gli operatori finance tendono a fare rima: una metrica allucinata passata indenne attraverso la due diligence finché qualcuno non ha controllato la fonte, una previsione sicura costruita su un numero inventato dal modello, un numero da board che non quadrava con il libro mastro. Ne raccontiamo uno in la lezione da 15 milioni, una singola cifra confusa emersa pochi giorni prima della chiusura di un finanziamento. Il pattern è sempre lo stesso: il numero sembrava giusto, quindi nessuno lo ha controllato, finché la posta in gioco non ha forzato una verifica.

Perché le vostre solite protezioni non la catturano

Se le allucinazioni fossero ovviamente sbagliate, questo non sarebbe un problema. Individuereste la spazzatura e andreste avanti. Sono pericolose proprio perché superano il test ad occhio nudo.

Tre difese a cui le persone ricorrono, e perché ciascuna non basta da sola:

“Riesamineremo semplicemente l’output.” Il riesame funziona quando gli errori sono visibili. Un 61,4% allucinato accanto a quaranta cifre corrette non è visibile. Dovreste ri-derivare ogni numero a mano, il che vanifica lo scopo di usare l’AI. Il controllo a campione trova quelli ovvi e si perde quelli plausibili. Quelli plausibili sono quelli costosi.

“Usiamo il retrieval, quindi è ancorato ai nostri documenti.” Il retrieval aiuta. Non è sufficiente. Prelevare il documento giusto vi dice da dove dovrebbe provenire un numero. Non garantisce che il modello legga la cella giusta, lo attribuisca al periodo corretto o esegua la matematica correttamente dopo. Le configurazioni retrieval-augmented ingenue si fermano a un tetto di accuratezza ben al di sotto di ciò di cui la finanza ha bisogno, e affidano comunque il calcolo finale al modello che è scarso nel calcolo. Questo è il divario che analizziamo in il RAG per la finanza non basta.

“I modelli più recenti allucinano meno.” Lentamente, in media, in condizioni di benchmark. Ma voi non operate su medie. Operate sul chiuso di trimestre specifico in cui il modello ha confuso due entità. Un tasso di base più basso è benvenuto e non è un controllo. Non potete mettere “il modello ha di solito ragione” in una nota a piè di pagina del board.

Il riassunto onesto: prompting, riesame e aggiornamenti del modello riducono la frequenza dei numeri allucinati. Nessuno di questi vi dà ciò di cui un CFO ha effettivamente bisogno, ovvero la capacità di sapere, per qualsiasi cifra data, che è corretta e di dimostrare da dove viene.

L’unica difesa che regge: ancorare l’AI a un modello riconciliato

Ecco il cambio di prospettiva. Smettete di provare a rendere il language model affidabile con i numeri. Non lo sarà, perché è lo strumento sbagliato per l’aritmetica e l’attribuzione. Invece, mettete sotto di esso un livello che è affidabile, e lasciate che il modello lavori su quella base.

Quel livello è un modello finanziario riconciliato: un’unica fonte di verità che quadra con il libro mastro. Non un cumulo di documenti in cui l’AI fruga. Un unico modello strutturato e riconciliato dove i ricavi sono uguali ai ricavi, i subtotali sommano correttamente e ogni cifra è vincolata alla sua transazione di origine.

Con quel livello in posizione, tre cose cambiano nel comportamento dell’AI:

  1. Recupera invece di inventare. Quando la risposta a “qual era il margine lordo” è un valore specifico in un modello riconciliato, il compito dell’AI è prelevarlo, non generare qualcosa che sembri un margine. Avete eliminato lo spazio per confabulare. Se la cifra non è nel modello, la risposta onesta è “non disponibile”, non un’ipotesi.
  2. Calcola in modo deterministico. Margini, tassi di crescita, runway, matematica degli scenari, niente di tutto questo dovrebbe passare attraverso il predittore di token. Un motore deterministico esegue l’aritmetica su input verificati e restituisce la stessa risposta ogni volta. Il modello orchestra e spiega. Non calcola.
  3. Ogni numero si traccia alla fonte. Poiché ogni cifra è vincolata alle transazioni e ai bilanci da cui proviene, potete cliccare qualsiasi output e vederne la provenienza. È questo che rende la risposta difendibile per un revisore, un investitore o un board. Trattiamo la tracciabilità come requisito di primaria importanza in costruire audit trail per l’AI in finanza.

Questo è ciò che costruisce Rexfin. Si connette alle vostre piattaforme contabili e di dati finanziari, o a estratti conto caricati, riconcilia tutto in un unico modello che quadra con il libro mastro, e poi espone quel modello all’AI per recupero, calcolo deterministico, scenari what-if e insight tracciabili alla fonte. L’AI diventa utile. Non può inventare i vostri numeri.

Come si presenta il bene, concretamente

Se state valutando qualsiasi AI per la finanza, la soglia è semplice da enunciare e difficile da simulare. Per ogni cifra riportata, dovreste poter rispondere sì a tutte queste domande:

  • Questo numero esiste in un modello riconciliato che quadra con il libro mastro, oppure il modello l’ha prodotto dal nulla?
  • La matematica è stata fatta da un motore deterministico, o dal language model?
  • Posso cliccare sulla cifra e vedere i documenti di origine e il percorso di calcolo?
  • Se il dato non c’è, il sistema lo dichiara invece di indovinare?

Uno strumento che non supera questa soglia non sta riportando i vostri numeri. Li sta improvvisando con grammatica eccellente. L’argomentazione categoriale più profonda sul perché tutto questo stack debba esistere si trova nel nostro pillar su il livello di affidabilità per l’AI in finanza.

Il punto chiave

L’allucinazione nei dati finanziari non è un bug che la prossima versione del modello risolverà silenziosamente. È una conseguenza strutturale del chiedere a un sistema di predizione del testo di essere una calcolatrice e un sistema di registrazione. Non lo risolvete fidandovi di più del modello. Lo risolvete non dandogli nulla da inventare, ancorandolo a una fonte di verità riconciliata, affidando la matematica a un motore deterministico e vincolando ogni numero alla sua fonte.

La domanda scettica, ci si può fidare dell’AI con i propri dati finanziari, ha una risposta precisa: solo fino a dove potete tracciare ciò che vi dice. Tutto il resto è un’ipotesi sicura di sé.

Se volete vedere cifre che quadrano con il libro mastro e si tracciano alla fonte, prenotate una demo e portate un numero che normalmente dovreste ricontrollare due volte.

In questo percorso

Loop animato: le cifre di un documento vengono estratte e ciascuna viene ricondotta alla propria citazione.

Prenota una demo

Guarda i tuoi numeri quadrare.

Prenota una demo di 30 minuti. Porta una domanda a cui non riesci mai a rispondere abbastanza in fretta: la modelleremo dal vivo su dati finanziari reali.