Aktuelle Nachrichten
Geplanter Stellenabbau im Bundeszentralamt für Steuern
Deutsche Entwicklungsprojekte in Tansania
Was KI-Vertragsanalyse zuverlässig macht – und was wir beim Bau eines solchen Systems gelernt haben
Zwischen Upload und Ergebnis liegen mehrere Stufen: Das Dokument muss ausgelesen werden, bei Scans über Texterkennung. Es muss aufbereitet und meist in Abschnitte zerlegt werden, die dann Analysephasen durchlaufen. Am Ende sollte das Ergebnis gegen den Originaltext abgesichert werden. Anbieter lösen diese Schritte unterschiedlich. Dort entsteht Qualität oder geht verloren. Das Problem dahinter ist grundsätzlich dasselbe: Ein Sprachmodell muss nicht nur etwas Plausibles formulieren, sondern die relevanten Stellen vollständig finden, richtig einordnen und auf den Originaltext zurückführen können.
Wie groß der Abstand zwischen einem funktionierenden Prototyp und einem belastbaren System ist, haben wir bei der Entwicklung unserer Vertragsanalyse erlebt.
Das Mengenproblem
Der längste Vertrag, den unser System verarbeitet hat, hat 218 Seiten. Der erste Ansatz war der naheliegende: Volltext an das Modell, Frage nach Fristen, Antwort strukturiert zurück. Bei einem dreiseitigen Mietvertrag funktionierte das bei uns gut, bei achtzig Seiten fingen die Probleme an. Wir haben denselben Vertrag mehrfach analysiert. Mal fand das System eine Frist, mal acht. Nicht falsche, sondern jedes Mal andere.
Vereinfacht gesagt liest ein Sprachmodell nicht, es setzt fort, was wahrscheinlich ist. Besonders anfällig waren unscheinbare Passagen inmitten umfangreicher Verträge. Für ein Werkzeug, das Kündigungstermine überwacht, ist das unbrauchbar.
Warum es auf die Zerlegung ankommt
Lange Dokumente werden deshalb in vielen KI-Anwendungen in kleinere Abschnitte zerlegt, man spricht von Chunking. Entscheidend ist nicht nur ihre Größe, sondern wo sie beginnen und enden. Wer eine Klausel mitten im Satz trennt, nimmt dem Modell den Zusammenhang, den es zur Bewertung braucht.
Genau diesen Fehler haben wir anfangs selbst gemacht. Unsere erste Fassung schnitt alle zweitausend Zeichen. Das Ergebnis war schlechter, weil der Schnitt regelmäßig mitten durch eine Klausel lief: eine halbe Kündigungsregelung hier, die andere Hälfte dort.
Heute sucht das System vor dem Schneiden nach Ankerpunkten und gewichtet sie. Ein Paragrafenzeichen oder ein „Artikel“ am Zeilenanfang zählt stark, eine Nummerierung wie „(3)“ mittel, ein Absatzumbruch schwach. Der Vertrag zerfällt entlang seiner eigenen Gliederung statt einer Zeichenzahl. Dazu kam ein mehrstufiger Ablauf: Übersicht, abschnittsweise Prüfung, Gegenlesen. Danach lag derselbe Vertrag über mehrere Durchläufe konstant bei 52 geprüften Klauseln, wobei eine Klausel keine, eine oder mehrere Fristen enthalten kann. Gleich blieb dabei die Anzahl. Ob es jedes Mal dieselben Klauseln waren und ob 52 die richtige Zahl ist, zeigt erst der Abgleich mit einer von Hand geprüften Referenz.
Das Verifikationsproblem
Die Zahl schwankte zwischen den Durchläufen nicht mehr. Die zweite Schwierigkeit bleibt, und sie betrifft KI-Systeme in sensiblen Bereichen ganz allgemein: Wie lässt sich eine Antwort überhaupt überprüfen?
Eine zutreffende und eine erfundene Aussage kann ein Sprachmodell sprachlich nahezu identisch präsentieren. Eine überzeugende Formulierung ist deshalb kein Beleg für die Richtigkeit der Information. Fehlt eine eindeutige Grundlage, kann es eine Angabe erzeugen, die zu ähnlichen Verträgen passt und gerade deshalb plausibel wirkt.
Bei einem Gewerbemietvertrag meldete unsere Analyse als wichtigen Termin den 31. Dezember 2023. Sauber formatiert, korrekt einsortiert, plausibel. Das Datum stand nirgends im Dokument.
Für die Rechtsanwendung ist das eine besonders problematische Fehlerklasse. Ein offensichtlich falsches Ergebnis fällt auf. Ein plausibles wandert in die Fristenliste und steht dort, bis jemand es glaubt. Mehrere Prüfdurchgänge lösen das nicht: Ein plausibel erzeugter Termin kann auch beim zweiten Mal plausibel wirken.
Beleg oder nichts
Seither verlangt unser System für jede erkannte Frist ein wörtliches Zitat aus dem Dokument. Geprüft wird zweierlei: ob das Zitat wirklich im Vertragstext steht und ob es die Angabe überhaupt tragen kann. Ein Beleg für ein ausdrücklich genanntes Datum muss selbst eine Datumsangabe enthalten. Für berechnete Termine gilt diese Anforderung nicht. Fällt eine Prüfung durch, wird der Eintrag verworfen, nicht mit einem Warnhinweis versehen.
Wie diese Prüfung greift, zeigte ein Testlauf. Das Modell gab ein Datum aus, das es aus dem mitgelieferten Systemdatum abgeleitet hatte. Als Beleg reichte es eine leere Unterschriftszeile nach, „Ort, Datum: ___“. Die steht zwar im Vertrag, enthält aber kein Datum, und genau daran scheiterte der Eintrag. Kein Anwender hat ihn gesehen.
Daraus lässt sich ein allgemeines Prinzip ableiten: Nicht der Anwender muss nachweisen, dass die Maschine sich irrt. Die Maschine muss nachweisen, dass sie recht hat. Das Prinzip hat Grenzen: Der Abgleich sichert den Beleg, nicht die Auslegung. Ob eine belegte Frist juristisch richtig bewertet ist, entscheidet ein Mensch.
Was eine strenge Prüfung kostet
Diese Strenge hat einen Preis, den wir unterschätzt hatten. Erfundene Angaben konnten wir so aus den Ergebnissen herausfiltern. Allerdings verschwanden zunächst auch richtige. Aufgefallen ist es bei einem Tarifwerk. Korrekt erkannte Fristen wurden verworfen, obwohl sie im Dokument standen. Die Ursache lag beim Auslesen der PDF-Datei: Aus einem Zeilenumbruch war ein Leerzeichen geworden, aus einem getrennten Wort dadurch „fol- genden“. Das Modell zitierte richtig, der Abgleich scheiterte trotzdem.
Ein falsches Ergebnis kann man bemerken, ein fehlendes bemerkt oft niemand. Eine großzügigere Prüfung hätte auch erfundenen Angaben geholfen. Wir vereinheitlichen Zitat und Vertragstext deshalb nach denselben Regeln. Toleranz gegenüber der Schreibweise ist zulässig, gegenüber dem Inhalt nicht.
Woran sich Qualität erkennen lässt
Wer ein solches System beurteilt, kommt mit vier Fragen weit, die sich nicht um das Modell drehen. Wie wird das Dokument ausgelesen, gerade bei Scans? Wie werden lange Dokumente verarbeitet, und bleiben Klauseln dabei zusammen? Wie werden Ergebnisse gegen den Originaltext abgesichert? Und was geschieht, wenn das System unsicher ist oder keinen Beleg findet?
Die letzte Frage ist die aufschlussreichste. Wer unbelegte Aussagen nur mit einem Warnhinweis ausgibt, gibt die eigentliche Prüfungsarbeit an den Anwender zurück. Etwas anderes ist der offene Hinweis, dass eine Stelle nicht sicher ausgewertet werden konnte: Nichts gefunden und nicht sicher bestimmbar sind verschiedene Ergebnisse.
Autor: Noah Liebold ist Gründer und Entwickler von Contract AI, einer deutschen Plattform für KI-gestützte Vertragsanalyse, Fristenüberwachung und Vertragsverwaltung.
Der Beitrag Was KI-Vertragsanalyse zuverlässig macht – und was wir beim Bau eines solchen Systems gelernt haben erschien zuerst auf .
