Vai al contenuto
Novità: chiedi al Rexfin Analyst Agent del tuo modello. Ogni cifra torna con la sua fonte.
· 8 min di lettura

Di quali modelli IA ti puoi fidare per i dati finanziari nel 2026? Leggere le classifiche con occhio critico

I tassi di allucinazione oggi vanno da meno del 2% a oltre il 25% a seconda del modello e del compito. Ecco perché quel numero in prima pagina non ti dice se la tua IA è sicura sui tuoi dati finanziari.

I tassi di allucinazione oggi vanno da meno del 2% a oltre il 25% a seconda del modello e del compito. Ecco perché quel numero in prima pagina non ti dice se la tua IA è sicura sui tuoi dati finanziari.

Di The Rexfin team

Un controller ci ha inoltrato la scorsa trimestrale il pitch di un fornitore. Il titolo: “Il nostro modello allucina solo l’1,8% delle volte.” La promessa implicita: scegli il modello giusto e il problema dei numeri sparisce. Non è così. Quell’1,8% proveniva da un benchmark di sintesi di documenti, misurato su prosa pulita, valutato da un giudice automatico. Non dice quasi nulla su se lo stesso modello otterrà correttamente il tuo margine lordo del terzo trimestre quando la fonte è un bilancio di verifica consolidato estratto da due libri mastri che non concordano.

I tassi di allucinazione nel 2026 sono reali, pubblici e utili. Sono anche routinariamente fraintesi. Se stai scegliendo uno strumento IA da mettere davanti alle cifre del tuo board, devi sapere cosa misurano le classifiche, cosa non misurano, e perché il divario tra le due cose è esattamente dove vivono gli errori finanziari.

Cosa dicono davvero i numeri

Prendi la Hallucination Evaluation Leaderboard di Vectara, il benchmark pubblico più citato. Nel suo ultimo aggiornamento, i modelli in testa si raggruppano in modo impressionante. Una manciata sta sotto il 2%. Diversi modelli mainstream di OpenAI, Google e Anthropic si collocano nelle basse cifre singole nel test originale. Lo spread tra tutti i modelli valutati, dal migliore al peggiore, va da meno del 2% a ben oltre il 20%.

Ecco la parte che i pitch deck saltano. Vectara misura una cosa ristretta: quanto spesso un modello introduce affermazioni non supportate quando sintetizza un breve documento che gli è stato consegnato. È un test di fedeltà sul testo. Non è un test aritmetico, non è un test di riconciliazione multi-documento, e non è un test se il modello riesce a leggere una tabella finanziaria senza trasporre una colonna.

Quando Vectara ha ricostruito il benchmark a fine 2025 con input più difficili, inclusi documenti più lunghi fino a circa 32.000 token e uno spread più ampio di domini che includeva la finanza, gli stessi modelli di ragionamento che ottenevano cifre singole basse sono saliti sopra il 10%. Stessi modelli. Compito più difficile, più realistico. Il tasso di errore si è moltiplicato. Questo singolo fatto dovrebbe azzerare il modo in cui leggi qualsiasi classifica: il punteggio è una proprietà del test, non solo del modello.

Perché un punteggio in classifica non si trasferisce ai tuoi libri contabili

Tre cose separano un documento di benchmark dai tuoi dati finanziari reali, e ciascuna degrada le prestazioni del modello in modi che il numero in prima pagina non cattura mai.

Primo, i tuoi dati sono disordinati e multi-fonte. Un benchmark di sintesi dà al modello un documento pulito. La tua domanda reale, “qual era l’EBITDA rettificato l’ultimo trimestre”, tocca un libro mastro generale, alcune rettifiche manuali che vivono in un foglio di calcolo, e forse un sottolibro che registra con ritardo. Il modello deve trovare le cifre giuste in tutti questi prima di fare qualsiasi altra cosa. Gli errori di recupero qui sembrano identici agli errori di ragionamento nell’output, e nessun punteggio di fedeltà documentale li prevede.

Secondo, i tuoi dati hanno tabelle e PDF. L’accuratezza del modello sulle cifre finanziarie crolla nettamente quando la fonte è un prospetto scansionato o un’immagine invece di testo pulito. Un modello che sintetizza un articolo fedelmente può comunque leggere male una cella in uno stato patrimoniale perché l’intestazione della colonna stava due righe più su e il modello ha indovinato l’allineamento.

Terzo, e più importante, la finanza è aritmetica, e l’aritmetica non è ciò che questi benchmark valutano. Un modello può recuperare perfettamente ricavi e costo del venduto, poi calcolare il margine lordo come differenza invece che come rapporto, o invertirlo, o applicare la cifra dell’anno scorso. Nulla di tutto ciò viene registrato come “allucinazione” in una classifica di fedeltà. L’affermazione è ancorata alla fonte. È la matematica a essere sbagliata. Ne abbiamo già scritto in l’IA ha preso i numeri giusti e la matematica sbagliata, ed è precisamente la categoria di cui le classifiche sono cieche.

L’argomento a favore dell’agnosticismo dal modello

Quindi di quale modello dovresti fidarti per i dati finanziari? La risposta onesta per un CFO è: la domanda è formulata male.

Se la tua accuratezza dipende da quale modello hai scelto questo trimestre, hai costruito un sistema fragile. I modelli cambiano continuamente. Il leader di classifica a febbraio è raramente il leader ad agosto. I fornitori rilasciano nuove versioni, dismettono le vecchie, e ritarano silenziosamente il comportamento. Ancorare l’integrità del tuo reporting a un modello specifico significa rivalidare l’intero flusso di lavoro finanziario ogni volta che un numero di versione avanza, e la maggior parte dei team non lo fa, il che significa che sta operando su un modello che non ha mai testato.

C’è una posizione più forte. Rendi il modello la parte che può cambiare, e metti sotto le cose che non devono cambiare, dove nessun modello può toccarle.

Questo significa un livello che esegue la riconciliazione prima che qualsiasi IA veda i dati, così ogni cifra riconcilia con il libro mastro. Significa instradare ogni calcolo, margine, tasso di crescita, varianza, rapporto, attraverso un motore deterministico invece di lasciare che sia l’LLM a fare l’aritmetica. Il modello decide cosa calcolare; il motore lo calcola allo stesso modo ogni volta. E significa che ogni risposta porta una traccia fino alla sua fonte, così un controller può dimostrare un numero come dimostrerebbe una formula, non prenderlo per fede.

Quando quel livello esiste, il tasso di allucinazione del modello smette di essere un numero portante. Un modello più debole produce una prosa più goffa; non produce un margine lordo sbagliato, perché non ha mai fatto la matematica. Puoi scambiare GPT con Gemini con Claude un martedì e le tue cifre riportate non si muovono. Questo è ciò che l’agnosticismo dal modello ti compra davvero: resilienza rispetto all’unica variabile che non puoi controllare.

Come leggere il prossimo pitch deck

Quando un fornitore apre con un tasso di allucinazione, fai tre domande. Su quale compito è stato misurato, sintesi o aritmetica? Su quali dati, testo pulito o tabelle disordinate multi-fonte? E cosa succede alle tue cifre quando il modello sottostante cambia il prossimo trimestre? Se la risposta onesta all’ultima è “dovremmo rifare tutti i test”, l’accuratezza vive nel modello, e il modello è sabbia.

Le classifiche vale la pena leggerle. Sono un segnale genuino che i modelli stanno migliorando e che alcuni sono chiaramente più bravi di altri a restare ancorati. Solo non scambiare un punteggio di fedeltà sui documenti di qualcun altro per una garanzia sui tuoi libri contabili. La cifra affidabile non è quella del modello migliore. È quella che è stata riconciliata prima che il modello la vedesse e calcolata da qualcosa di deterministico dopo.

Se vuoi vedere come appare l’accuratezza agnostica dal modello sui tuoi stessi dati finanziari invece che su un benchmark, prenota una demo e porta un numero di cui non ti sei mai fidato che un’IA calcolasse correttamente. Per l’argomento più ampio secondo cui anche punteggi di benchmark forti sono una bocciatura per la finanza non supervisionata, la checklist di verifica per i numeri del board deck è un’ottima lettura successiva, così come il pilastro sulle allucinazioni IA nei dati finanziari.

Parte di Allucinazioni AI nei dati finanziari: fermare l'AI che inventa numeri

Continua a leggere

Prenota una demo

Guarda i tuoi numeri quadrare.

Prenota una demo di 30 minuti. Porta una domanda a cui non riesci mai a rispondere abbastanza in fretta: la modelleremo dal vivo su dati finanziari reali.