Aktuelle Nachrichten
21/8269: Kleine Anfrage Informationen zu Sprachanforderungen beim Ehegattennachzug für die Jahre 2025 und 2026 (PDF)
Norton Rose Fulbright advises FMO on debut EUR green bond issuance
Legal AI wird jetzt messbar
Die Diskussion über künstliche Intelligenz im Recht bewegt sich zwischen großen Versprechen und grundsätzlichem Misstrauen. Für den Kanzleialltag zählt vor allem, bei welchen Aufgaben ein System unterstützt, wo seine Grenzen liegen und wie sich seine Leistung verbessern lässt.
Die Skepsis ist nachvollziehbar. Im Juni 2026 strich der Oregon Supreme Court Eingaben mit KI-generierten, erfundenen Fundstellen und beendete das Verfahren. Das zeigt die Bedeutung von Quellenkontrolle. Was sorgfältig entwickelte und geprüfte Systeme leisten können, muss jedoch gesondert untersucht werden.
Vom Eindruck zur überprüfbaren Leistung
Bei einer Vorführung erscheint auf eine Frage schnell eine überzeugende Antwort. Ob das System auch anders gelagerte Fragen zuverlässig bearbeitet, lässt sich so kaum beurteilen. Dafür braucht es Prüfungen mit festgelegten Aufgaben, Referenzlösungen und Bewertungskriterien. Solche Vergleichstests heißen Benchmarks.
Ihr Wert geht über eine Rangliste hinaus. Übersieht ein System regelmäßig eine Ausnahme, lässt sich gezielt daran arbeiten. Findet es die richtige Entscheidung, zieht aber den falschen Schluss, liegt ein anderes Problem vor als bei einer erfolglosen Suche. Wiederholte Tests zeigen, ob eine Änderung hilft.
Auch große Anbieter verfolgen diesen Weg. Harvey hat mit seinem Legal Agent Benchmark einen Test für umfangreichere juristische Arbeitsabläufe vorgestellt und berichtet über Verbesserungen durch gezieltes Nachtraining. Evaluation wird damit zu einem Werkzeug der Entwicklung: Sie hilft, Fehler einzugrenzen und Fortschritte zu prüfen. Das ist auch die Motivation für unseren eigenen Vergleich.
Recherche und juristisches Denken gehören zusammen
Rechtsrecherche verlangt zwei Fähigkeiten: einschlägige Quellen finden und auswerten sowie den Sachverhalt rechtlich einordnen und die Lösung begründen. Wer gut sucht, muss noch nicht gut subsumieren. Wer überzeugend argumentiert, kann eine entscheidende Quelle übersehen.
Der von uns entwickelte LegalGenius Score, kurz LG-Score, verbindet deshalb zwei Prüfungen. Zehn Arbeitsrechtsfälle untersuchen die Bearbeitung mit Recherche. Hinzu kommen 15 klausurartige Aufgaben aus BenGER, einem Benchmark für deutsches Recht aus dem Umfeld der TU München. Diese werden ohne zusätzliche Recherche bearbeitet. Beide Teile zählen gleich viel zum Gesamtergebnis.
KI-gestützte Bewerter beurteilen die Antworten anhand von Referenzlösungen; auch ihre Urteile sind überprüfungsbedürftig. Im Arbeitsrechtsteil zählt die juristische Korrektheit, im BenGER-Teil zusätzlich etwa die Problemerkennung und Argumentation. Der LG-Score führt diese Prüfungen zusammen.
Was ein Vergleich zeigen kann
Die Ergebnisse zeigen unterschiedliche Stärken. Mit geeigneter Rechercheunterstützung kommt ein günstiges Modell bei den geprüften Arbeitsrechtsfragen nahe an teurere Modelle heran. Bei der selbstständigen Lösung komplexer Sachverhalte bleiben größere Unterschiede. Dieses Leistungsprofil hilft bei der Auswahl eines Werkzeugs.
In den Vergleich haben wir auch Libra aufgenommen, ein kommerzielles Angebot für juristische Arbeit. Damit prüfen wir, ob sich derselbe Maßstab auch auf fertige Produkte anwenden lässt. Libra bearbeitet die Aufgaben mit seinem eigenen System, während die anderen getesteten Modelle für den Rechercheteil den LegalGenius-Agenten nutzen. Libra erreicht dabei einen LG-Score von 76,3 von 100 Punkten.
Ein Punktwert ist keine Erfolgsquote für beliebige Mandatsfragen. Die Benchmark-Seite veröffentlicht Teilwerte, Testbedingungen und Ergebnisdaten. Leser können sie damit selbst einordnen; einen vollständigen Einblick in die Technik externer Anbieter erhalten wir dabei nicht.
Warum auch günstige Modelle nützlich sein können
Hinter LegalGenius steht die Idee, Quellenarbeit und Auswertung in einem mehrstufigen Ablauf zu verbinden. Ein KI-Agent ist dabei ein System, das mehrere Arbeitsschritte selbstständig ausführt. Er zerlegt eine Frage, durchsucht deutsche Gesetze, Rechtsprechung und offen lizenzierte Fachliteratur, bewertet Treffer und recherchiert bei Bedarf erneut. Aus diesem Material entsteht eine Antwort mit überprüfbaren Fundstellen.
Das Sprachmodell muss nicht jede Entscheidung aus seinem erlernten Wissen kennen. Auch Quellenbestand und Arbeitsablauf tragen zum Ergebnis bei. Evaluation hilft, dieses Zusammenspiel weiterzuentwickeln. Sie macht das System nicht fehlerfrei, aber seine Stärken und Schwächen erkennbarer und seine Entwicklung besser steuerbar.
Für die Praxis zählt auch der Aufwand. Einige offen verfügbare KI-Modelle, etwa das getestete GLM Flash, ermöglichen eine sehr kostengünstige Verarbeitung. Offenheit allein garantiert allerdings weder niedrige Kosten noch hohe Qualität. Die veröffentlichten Ergebnisse helfen, Leistung und Wirtschaftlichkeit selbst zu vergleichen. Entscheidend sind die eigenen Aufgaben und die gesamten Nutzungskosten.
Ein Maßstab mit Grenzen
25 Aufgaben bilden die juristische Praxis nicht vollständig ab. Auch die Auswahl der Fälle, die verfügbaren Quellen und die Bewertung beeinflussen das Ergebnis. Kleine Rangunterschiede verdienen deshalb Zurückhaltung. Größere Fallbestände, wiederholte Tests und menschliche Kontrollen müssen den Vergleich weiter absichern.
Für Kanzleien bleibt die Prüfung an eigenen Aufgaben sinnvoll. Neben fachlicher Qualität zählen Datenschutz, Aktualität, nachvollziehbare Fundstellen und die Einbindung in den Arbeitsalltag. Benchmarks geben dieser Entscheidung eine zusätzliche Grundlage.
Legal AI wird damit schrittweise überprüfbar und gezielt verbesserbar. Das schafft die Grundlage für begründetes Vertrauen und einen bewussten Einsatz. Die anwaltliche Prüfung des konkreten Ergebnisses bleibt erforderlich.
Autor: Dr. Sten Rüdiger entwickelt LegalGenius.de. Seine Schwerpunkte sind das Training und die Evaluation von Sprachmodellen sowie KI-Agenten für juristische Recherche. Der vorgestellte LG-Score stammt aus seiner eigenen Entwicklungs- und Evaluationsarbeit.
Der Beitrag Legal AI wird jetzt messbar erschien zuerst auf .
Für Kostenerstattung muss ein Arzt ran
Berufungsgericht in Ungarn reduziert Haftstrafe: Maja T. zu sieben Jahren Haft verurteilt
Das Berufungsgericht in Ungarn hat die Haftstrafe gegen die non-binäre Person Maja T. von acht auf sieben Jahre verringert. Ihre Auslieferung nach Ungarn hatte das Bundesverfassungsgericht für rechtswidrig erklärt. Die Rücküberstellung ist eingeleitet.
