Die vier Schichten, die jeder KI-Finance-Stack braucht
Anbindung, Abstimmung, deterministische Berechnung, Abruf. Lassen Sie die mittleren beiden weg, liefert Ihre KI Zahlen, die kein Controller freigibt. Hier erfahren Sie, warum.
Von The Rexfin team
Die meisten KI-für-Finance-Demos sind nur zwei Schichten tief. Sie binden eine Datenquelle an und lassen ein Modell abrufen und über das Gefundene sprechen. Die Demo wirkt sauber. Dann fragt jemand nach der Bruttomarge des letzten Quartals nach Region, das Modell liefert eine selbstbewusste Zahl, und der Controller zerlegt sie in vier Minuten, weil sie sich an nichts im Hauptbuch festmachen lässt.
Die fehlenden Teile sitzen in der Mitte. Ein vertrauenswürdiger KI-Finance-Stack hat vier eigenständige Schichten, nicht zwei: Anbindung, Abstimmung, deterministische Berechnung und Abruf. Die beiden, die alle überspringen, sind genau die, die darüber entscheiden, ob eine Zahl belastbar ist. Sie wegzulassen ist der strukturelle Grund, warum die meisten dieser Demos in dem Raum scheitern, in dem jemand unterschreiben muss.
Schicht eins: Anbindung
Das ist die Schicht, die alle zuerst bauen, weil es die Schicht mit der befriedigenden API ist. Sie binden QuickBooks, Xero, NetSuite, Sage, eine SAP- oder Oracle-Instanz oder ein Data Warehouse an, oder Sie nehmen hochgeladene Abschlüsse und Exporte entgegen. Daten fließen. Ein Modell kann sie sehen.
Anbindung ist notwendig, und sie ist an den Rändern tatsächlich anspruchsvoll. Berechtigungen, Rate Limits, Schema-Drift, die Tatsache, dass „Umsatz” in einem System drei verschiedene Felder in einem anderen sind. Doch wer die Anbindung gut löst, löst exakt ein Problem: den Zugriff. Über die Frage, ob die Zahlen untereinander stimmig sind, sagt das nichts, und es hält ein Modell in keiner Weise davon ab, Rechenoperationen vorzunehmen, die ihm nicht zustehen.
Die Falle ist, dass sich die Anbindung wie die ganze Arbeit anfühlt. Sie können einem Sprachmodell eine authentifizierte Leitung ins Hauptbuch geben und zusehen, wie es Fragen in einfachem Deutsch beantwortet. Das demonstriert sich wunderbar. Es ist zugleich genau der Aufbau, der Zahlen produziert, die nicht aufgehen, weil die nächsten beiden Schichten nichts tun.
Schicht zwei: Abstimmung
Hier klafft bei den meisten Stacks ein Loch. Rohe Finanzdaten sind kein Finanzmodell. Sie sind ein Haufen von Fakten aus Systemen, die nie dafür gebaut wurden, miteinander übereinzustimmen. Das Nebenbuch weicht um ein paar tausend vom Hauptbuch ab. Intercompany-Buchungen stehen auf beiden Seiten mit unterschiedlichem Timing. Eine Gesellschaft bilanziert in einer anderen Währung, nach einem anderen Abschlusskalender, mit einem anderen Kontenplan. Drei Exporte „derselben” Zahl widersprechen sich, und alle drei sind aus ihrer jeweiligen Quelle heraus technisch korrekt.
Abstimmung ist die Arbeit, aus diesem Haufen ein Modell zu machen, das sich am Hauptbuch festmachen lässt. Eine einzige Quelle der Wahrheit, im wörtlichen Sinne: Zahlen, die untereinander abstimmbar sind und sich auf das System zurückverfolgen lassen, aus dem sie stammen. Das ist unspektakuläre, deterministische, regelbasierte Arbeit. Es ist zugleich die Schicht, die darüber entscheidet, ob alles Darüberliegende vertrauenswürdig ist, denn jede Berechnung und jede abgerufene Zahl erbt die Integrität des Modells darunter.
Lassen Sie die Abstimmung weg, dann verlangen Sie von einer KI, über Widersprüche zu schlussfolgern. Sie wird es tun. Sie wird eine der widersprüchlichen Zahlen wählen oder sie stillschweigend vermischen und das Ergebnis mit derselben flüssigen Selbstsicherheit präsentieren, die sie einer korrekten Antwort gibt. Das Modell hat keinen Mechanismus, um zu erkennen, dass die Eingaben sich widersprachen. Das ist kein Prompt, den Sie reparieren können. Es ist eine Schicht, die Sie nicht gebaut haben.
Schicht drei: deterministische Berechnung
Über diese Schicht wird gestritten, deshalb sage ich es zum Mechanismus ganz unverblümt. Sprachmodelle rechnen nicht. Sie sagen das plausibelste nächste Token voraus, und eine plausibel aussehende Zahl ist keine korrekte. Aktuelle mechanistische Forschung ist hier ziemlich eindeutig: Modelle können Arithmetik erzeugen und scheitern daran, sie zu validieren, und die Fehler sind reproduzierbar statt zufälliges Rauschen. Es gibt sogar Arbeiten, die die internen Schaltkreise isolieren, die für selbstbewusst falsche Finanzantworten verantwortlich sind. Die Schlussfolgerung für alle, die in diesem Feld bauen, ist unmissverständlich. Das Modell darf entscheiden, was berechnet wird. Es darf nicht das sein, was die Berechnung durchführt.
Die Berechnung muss also anderswo geschehen, in einer deterministischen Engine. Margen, Kennzahlen, Wachstumsraten, Konsolidierungen, Umlagen, Währungsumrechnung zum richtigen Kurs am richtigen Stichtag, Vorjahres- und Vorperiodenvergleiche. Diese laufen als Code gegen das abgestimmte Modell, nicht als Text, der von einem Transformer erzeugt wird. Gleiche Eingaben, gleiches Ergebnis, jedes Mal. Diese Eigenschaft ist aus einem Grund wichtig, der nichts mit Eleganz zu tun hat: Ein Controller kann sie nachrechnen. Ein Wirtschaftsprüfer kann sie nachrechnen. Nichtdeterministische Ausgaben, bei denen dieselbe Frage am Dienstag eine leicht abweichende Zahl liefert, scheitern schon im Ansatz an grundlegenden Prüfungs- und Compliance-Anforderungen.
Ein nützlicher Test für jedes KI-Finanztool: Stellen Sie ihm dieselbe numerische Frage dreimal, jeweils leicht anders formuliert. Driften die Zahlen, dann lebt die Arithmetik im Modell, und Sie haben ein Schicht-drei-Problem, das als Feature verkleidet ist.
Das ist der Teil der Architektur, über den wir bei Rexfin am meisten nachdenken, denn es ist der Teil, den der Markt immer wieder zu überspringen versucht. Ein Modell an Ihr ERP anzubinden und es antworten zu lassen „fühlt” sich fertig an. Die Rechnung kommt trotzdem falsch heraus, weil das Modell immer noch der Rechner ist.
Schicht vier: Abruf
Der Abruf ist die Schicht, die im Rampenlicht steht, und sie verdient eine echte Rolle, nur nicht die, die Demos ihr geben. Richtig gemacht, ist der Abruf das, was es einer Person ermöglicht, eine Frage in einfacher Sprache zu stellen, die richtigen Zahlen aus dem abgestimmten Modell zu ziehen, ein Was-wäre-wenn-Szenario zu rechnen und eine Antwort zu erhalten, in der jede Zahl sich auf ihre Quelle zurückverfolgen lässt. Die Aufgabe des Modells ist hier echt und wertvoll: die Absicht verstehen, die korrekten Zahlen holen, das Ergebnis einordnen, es erklären.
Was der Abruf nicht ist, ist ein Ersatz für die Schichten darunter. Retrieval-Augmented Generation hat sich ihren Ruf damit verdient, Antworten in echten Dokumenten zu verankern, und für „Was besagt diese Klausel?” reicht das. Finanzen sind Arithmetik, die aufgehen muss. Ein Modell auf die exakte Hauptbuchzeile zu richten ist notwendig und lässt ihm dennoch freie Hand, aus einer korrekten Zahl die falsche Marge zu berechnen. Der Abruf verankert, woher die Zahl stammt. Er macht die Rechnung nicht richtig. Deshalb stößt die Kombination aus Anbindung und Abruf, die Zwei-Schichten-Demo, an eine Decke und bleibt dort.
Wenn der Abruf auf einem abgestimmten Modell und einer deterministischen Engine aufsitzt, ändert sich das Bild. Die Zahlen, die er zurückgibt, gehen bereits auf. Die Berechnungen lassen sich bereits wiederholen. Das Modell setzt eine Antwort aus vertrauenswürdigen Teilen zusammen, statt eine zu fabrizieren. Die Erkenntnis lässt sich auf die Quelle zurückführen, weil die Quelle echt war, bevor das Modell sie je gesehen hat.
Warum die Mitte übersprungen wird, und was das kostet
Die beiden fehlenden Schichten fehlen aus einem profanen Grund: Sie sind die harte, unspektakuläre Ingenieursarbeit, und sie demonstrieren sich nicht. Die Anbindung hat eine API. Der Abruf hat eine Chatbox. Abstimmung und deterministische Berechnung sind stille Infrastruktur, die sich nur dann bemerkbar macht, wenn sie fehlt, und dann erklären Sie einem CFO bereits, warum die Zahl der KI vom Abschluss abweicht.
Ich gebe die offensichtliche Grenze zu. Nichts davon macht KI allwissend über Ihr Geschäft. Das abgestimmte Modell ist nur so gut wie die Quellsysteme, die es speisen, das Prinzip „Müll rein, Müll raus” gilt weiterhin, und Ermessensentscheidungen über Anpassungen bleiben Sache Ihres Teams. Was Ihnen die Vier-Schichten-Trennung bringt, ist enger gefasst und wichtiger: Wenn die KI Ihnen eine Zahl gibt, ist es eine Zahl, die Sie verteidigen können. Sie passt zum Hauptbuch, die Rechnung läuft identisch wieder ab, und die Spur führt zurück zur Quelle.
Das ist die ganze Messlatte für Finance. Nicht „beeindruckend in einer Demo”. Belastbar in dem Raum, in dem jemand unterschreibt.
Wenn Sie sehen möchten, wie ein Stack aussieht, in dem die mittleren beiden Schichten tatsächlich gebaut sind, zeichnet die Säule verlässliche Finanzmodellierungsschicht für KI das vollständige Bild, und MCP für Finance reicht nicht geht der Frage nach, warum die Anbindung eines LLM an Ihr ERP die Rechnung trotzdem falsch macht. Wenn Sie es lieber gegen echte Zahlen laufen sehen, als darüber zu lesen, buchen Sie eine Demo und bringen Sie eine Frage mit, die Ihr letztes Tool falsch beantwortet hat.
Teil von Die Verlässlichkeitsschicht, die KI braucht, bevor sie Ihre Zahlen anfasst