Praxisbeispiel

On-Premise-KI für eine Kanzlei mit Verschwiegenheitspflicht: Eine Fallstudie

Eine Sicherheitsberatung wollte die Produktivität moderner KI, ohne dass ein einziges Dokument je das Haus verlässt. So haben wir einen privaten Assistenten gebaut, der vollständig auf ihrer eigenen Hardware läuft — und was es wirklich dazu brauchte.

Have a nice dayHave a nice day13 Min. Lesezeit
On-Premise-KI für eine Kanzlei mit Verschwiegenheitspflicht: Eine Fallstudie

Manche Unternehmen können ihre Daten nicht in die Cloud eines anderen legen — nicht aus Paranoia, sondern weil Vertraulichkeit das eigentliche Produkt ist, das sie verkaufen. Dies ist die Geschichte einer solchen Firma und wie wir ihr die Geschwindigkeit eines modernen KI-Assistenten gegeben haben, ohne dass je eine einzige Mandantenakte die eigenen vier Wände verlassen hat. Kein Marketing-Glanz. Nur das, was wir versucht haben, was schiefging und was am Ende funktionierte.

Ein paar Mal im Jahr erreicht uns eine ganz bestimmte Art von Anfrage. Sie beginnt meist mit einem Satz wie: „Wir würden KI gerne nutzen, aber wir dürfen unsere Daten rechtlich nirgendwo hinschicken.“ Die Person am anderen Ende hat bereits mit angesehen, wie Kolleginnen und Kollegen sensibles Material in einen öffentlichen Chatbot kopiert haben, hat einen Schrecken bekommen und die ganze Kategorie still verboten. Diese Menschen sind keine Technikfeinde. Sie stecken fest zwischen einer echten Produktivitätschance und einer nicht verhandelbaren Verschwiegenheitspflicht.

Diese Fallstudie handelt von genau so einer Firma. Um die Vertraulichkeit zu wahren, die das Projekt überhaupt erst geprägt hat, haben wir alles anonymisiert — den Namen, die Personen, die Details ihrer Mandanten. Die Zahlen sind illustrativ und gerundet, keine geprüften Werte. Aber die Form des Problems und die Art, wie wir es gelöst haben, sind genau so, wie es geschehen ist.

Die Ausgangslage: Produktivität hinter einer Mauer der Verschwiegenheit

Der Kunde war eine mittelgroße Beratungsfirma in einem Feld, in dem Diskretion kein Nice-to-have ist — sondern der ganze Grund, warum Mandanten sie überhaupt beauftragen. Denken Sie an eine Praxis, die sensible unternehmensbezogene, rechtliche oder sicherheitsnahe Arbeit übernimmt, bei der ein Leck nicht nur peinlich wäre, sondern das Geschäft beenden würde. Rund dreißig Personen, eine ernste Fallauslastung und ein Berg langer, dichter Dokumente, die jede Woche jemand lesen, zusammenfassen und abgleichen muss.

Ihr Team hatte zugesehen, wie der Rest der Welt mit KI-Assistenten schneller wurde, und spürte, wie der Abstand größer wurde. Ein Junior konnte einen halben Tag damit verbringen, die Kernpunkte aus einem 90-seitigen Bericht herauszuziehen. Der erste Entwurf einer Zusammenfassung fraß Stunden, die niemand in Rechnung stellte. Die Arbeit war genau die Art von dichter, sprachlastiger Schwerstarbeit, in der moderne KI wirklich gut ist — und sie durften nichts davon anrühren.

Der Blocker war einfach und absolut. Ihre Mandantenvereinbarungen und ihre eigene interne Richtlinie verboten es, Mandantenmaterial an einen Drittdienst zu senden. Nicht anonymisiert, nicht verschlüsselt auf dem Übertragungsweg, nicht „der Anbieter verspricht, nicht damit zu trainieren“. Die Daten durften das Gelände nicht verlassen, Punkt. Jedes Cloud-KI-Werkzeug am Markt war damit per Definition ausgeschlossen, egal wie gut seine Datenschutzerklärung auf dem Papier aussah.

“Sie wollten nicht das Versprechen eines Anbieters, dass die Daten sicher seien. Sie wollten, dass die Daten nie in eine Lage geraten, in der ein Versprechen nötig ist.”
— was uns der geschäftsführende Partner im ersten Gespräch sagte

Diese letzte Unterscheidung ist das ganze Projekt in einem Satz. Viele „private KI“-Angebote sind in Wahrheit die Cloud eines anderen mit einem strengeren Vertrag. Für diesen Kunden reichte das nicht. Die einzig akzeptable Antwort war ein System, in dem die sensiblen Daten physisch nie unterwegs waren — bei dem man im Prinzip das Netzwerkkabel ziehen könnte und der Assistent trotzdem funktioniert.

Ein abgeschlossener Serverschrank in einem kleinen Büroraum, sanft leuchtend, mit einem sichtbar ausgesteckten Ethernet-Kabel, das daneben auf dem Boden liegt, als Sinnbild für KI, die vollständig offline funktioniert
Das gedankliche Modell, zu dem wir immer wieder zurückkehrten: Zieht man das Netzwerkkabel, sollte der Assistent trotzdem antworten.

Warum die naheliegenden Cloud-Antworten nicht passten

Bevor wir etwas gebaut haben, haben wir die einfacheren Wege sorgfältig geprüft — denn On-Premise ist mehr Aufwand, und wir empfehlen es nicht, wenn eine einfachere Option wirklich passt. Für diesen Kunden scheiterte jede Abkürzung an derselben Mauer.

Die großen Anbieter bieten alle Enterprise-Tarife mit „wir trainieren nicht mit Ihren Daten“ und regionalem Hosting an. Beruhigend, und für viele Unternehmen völlig ausreichend. Aber es bedeutet trotzdem, dass Mandantendateien das Haus verlassen und, sei es auch nur kurz, auf einer Infrastruktur liegen, die die Firma nicht kontrolliert. Für eine Praxis, deren Verträge das ausdrücklich verbieten, bleibt ein starkes Versprechen ein Versprechen — und Versprechen überleben keine Prüfungsfrage, die mit „Können Sie garantieren …“ beginnt.

Wir haben auch eine Private-Cloud-Instanz ausgeschlossen — eine dedizierte, isolierte Umgebung, die ein Anbieter hostet. Technisch stärker und für manche Firmen absolut passend. Aber es platzierte die Daten trotzdem auf gemieteter Hardware in einem Gebäude, das dem Kunden nicht gehörte, und es hielt eine Abhängigkeit von einem externen Anbieter für etwas aufrecht, das der Kunde vollständig unter dem eigenen Dach haben wollte. Er war bereit, für diese Kontrolle etwas Bequemlichkeit einzutauschen. Also wurde es On-Premise.

Was wir tatsächlich gebaut haben

Die Lösung, auf das Wesentliche reduziert, war ein privater KI-Assistent, der auf einem einzigen leistungsfähigen Server im Büro des Kunden läuft. Das Team erreicht ihn über eine ganz normale Webseite im Browser — es sieht sich an und fühlt sich an wie die Chat-Werkzeuge, die alle bereits kennen. Hinter diesem vertrauten Fenster verlässt nichts je das lokale Netzwerk.

Wir haben die Architektur bewusst langweilig gehalten. Langweilig ist zuverlässig, und zuverlässig ist genau das, was ein datenschutzkritisches System braucht. Drei bewegliche Teile sind es wert, benannt zu werden.

Ein Open-Weight-Modell, das lokal läuft

Statt ein gehostetes Modell aufzurufen, haben wir ein leistungsfähiges Open-Weight-Sprachmodell direkt auf der GPU des Servers laufen lassen. Open-Weight ist hier entscheidend: Die Modelldateien liegen auf der Festplatte des Kunden, laufen auf der Hardware des Kunden und beantworten Fragen ohne jeden Umweg über das Internet. Für ihre Arbeit — Zusammenfassen, Extrahieren, Entwerfen, Fragen zu den eigenen Dokumenten beantworten — war ein gut gewähltes mittelgroßes Modell mehr als ausreichend. Sie brauchten nicht die absolute Spitze; sie brauchten kompetent und privat.

Eine private Wissensschicht über ihren eigenen Dateien

Der eigentliche Wert war kein generischer Chatbot — es war ein Assistent, der Fragen zu ihren eigenen Fallakten beantworten konnte. Wir haben eine Retrieval-Schicht gebaut, die ihre Dokumente lokal indiziert, sodass das System, wenn jemand fragt „Was haben wir im Fall Müller zu X festgehalten“, die relevanten Passagen findet und daraus antwortet. Dieser Index sitzt, wie alles andere, vollständig auf der lokalen Maschine. Kein Dokument und kein Bruchstück davon wird je irgendwohin hochgeladen.

Zugriffskontrolle, die zu ihren bestehenden Regeln passt

Eine Firma wie diese hat bereits strenge Regeln, wer welche Dateien sehen darf. Der Assistent musste sie respektieren, nicht umgehen. Also spiegelte der Zugriff ihre bestehenden Berechtigungen: Sie können die KI nur zu Material fragen, das Sie ohnehin öffnen dürfen. Das klingt selbstverständlich, aber es ist der Teil, der aus einer cleveren Demo etwas macht, das ein Compliance-Verantwortlicher tatsächlich freigibt.

Ein klares redaktionelles Diagramm eines geschlossenen Kreislaufs vollständig innerhalb eines Gebäudeumrisses: eine Person am Laptop, ein Pfeil zu einem lokalen Server mit GPU, ein Pfeil zu einem Stapel Dokumentendateien und zurück — mit einer gestrichelten Linie zu einem durchgestrichenen Cloud-Symbol
Alles im Gebäude, nichts außerhalb. Die durchgestrichene Cloud war der ganze Punkt.

Wie wir es ausgerollt haben, ohne die Arbeit zu stören

Eine Firma mit Datenschutz an erster Stelle ist verständlicherweise vorsichtig mit neuen Systemen. Wir wollten kein Vertrauen gewinnen, indem wir einen Schalter umlegen und den Sieg verkünden. Also haben wir das Projekt als eine Reihe kleiner, umkehrbarer Schritte gefahren, jeder für sich nachweisbar, bevor der nächste begann.

  1. 1
    Zuerst eine schmerzhafte Aufgabe klar abgegrenzt
    Wir haben nicht versucht, ‚KI in die Firma einzuführen‘. Wir haben eine einzelne, häufige Aufgabe gewählt — das Zusammenfassen langer eingehender Dokumente — und dafür gebaut. Ein klares Ziel, leicht als Erfolg oder Misserfolg zu beurteilen.
  2. 2
    Auf einer Testmaschine mit Dummy-Daten gebaut
    Alles wurde zuerst auf einer isolierten Maschine mit erfundenen Dokumenten aufgesetzt, sodass keine echten Mandantendaten im Spiel waren, bis das System bewiesen und das Sicherheitsmodell geprüft war.
  3. 3
    Einen geschlossenen Pilot mit wenigen Power-Usern gefahren
    Eine Handvoll erfahrener Mitarbeiterinnen und Mitarbeiter hat es mehrere Wochen lang an echter Arbeit genutzt, parallel zum normalen Ablauf. Sie fanden die rauen Kanten — seltsame Formulierungen, ein paar Dokumente, die der Index schlecht verarbeitete — und wir haben sie behoben.
  4. 4
    Es gegen ihre eigene Richtlinie geprüft
    Vor jedem breiteren Rollout hat ihr Compliance-Verantwortlicher genau geprüft, wo Daten lagen und wohin sie sich bewegten. Weil die Antwort ‚nirgendwo außer hier‘ war, fiel diese Prüfung kurz aus — was das ganze Designziel war.
  5. 5
    Es dem Team mit einer einseitigen Anleitung geöffnet
    Erst als es Vertrauen genoss, haben wir es firmenweit ausgerollt, mit einer verständlichen Notiz dazu, worin es gut ist, worin nicht, und dem Hinweis, dass es nie erfindet — es zitiert.

Das Ergebnis: Stunden zurückgewonnen, und nichts hat das Haus verlassen

Innerhalb weniger Monate nach dem vollständigen Rollout war der Assistent still zu einem Teil des Arbeitsalltags geworden. Das wichtigste Ergebnis war das, das ihnen am meisten am Herzen lag: kein einziges Byte Mandantendaten hat je das Gelände verlassen, und sie konnten es jedem beweisen, der fragte. Das System läuft auf ihrem Server, in ihrem Büro, unter ihrer Kontrolle. Das allein rechtfertigte das Projekt für sie.

Die Produktivitätsseite war das Extra, das es lohnend machte. Der erste Entwurf einer Zusammenfassung eines langen Dokuments — vorher eine mehrstündige Aufgabe für einen Junior — sank auf Minuten zum Prüfen und Nachbearbeiten. Mitarbeitende hörten auf, ganze Akten erneut zu lesen, um eine einzige Sachfrage zu beantworten; sie fragten den Assistenten, bekamen eine zitierte Passage und verifizierten sie in Sekunden. Im ganzen Team summierte sich die gewonnene Zeit zu einem spürbaren Teil jeder Woche, umgelenkt vom Durcharbeiten von Dokumenten hin zur höherwertigen Analyse, für die Mandanten tatsächlich bezahlen.

Ebenso vielsagend war eine leisere Veränderung. Menschen, die still nervös gegenüber KI gewesen waren — die befürchteten, sie sei ein Leck, das nur darauf wartet zu passieren — wurden im Umgang mit ihr entspannt, gerade weil sie verstanden, warum sie sicher war. Vertrauen kam nicht daher, dass wir sie beruhigten. Es kam von einer Architektur, die sie einem Mandanten in einem Satz erklären konnten: Es verlässt nie das Haus.

AspektVorherNachher
Ein langes Dokument zusammenfassenEin halber Tag, von HandMinuten, um einen Entwurf zu prüfen
Eine Frage zu einer Akte beantwortenDie ganze Akte erneut lesenFragen, zitierte Passage erhalten
Wohin Mandantendaten gehenBleiben drin, aber KI tabuBleiben drin, und KI nutzbar
Compliance-Prüfung des WerkzeugsWürde am ersten Tag durchfallenKurz — nichts verlässt das Haus
Vertrauen des Teams in KIÄngstlich, meist gemiedenEntspannt, verstanden
Vorher und nachher, grob und illustrativ.
Ein Berater am Schreibtisch prüft eine knappe, KI-erstellte Zusammenfassung auf dem Bildschirm neben einem dicken Stapel Papierdokumente, sichtlich erleichtert, in warmem natürlichem Licht
Der alltägliche Gewinn: Aus einer halbtägigen Leseaufgabe wurden ein paar Minuten Prüfen und Verifizieren.
“Der Gewinn war nicht, dass die KI clever war. Er war, dass zum ersten Mal die Compliance-Antwort und die Produktivitäts-Antwort dieselbe Antwort waren.”
— unser Projektleiter darüber, was hier den Ausschlag gab

Was es gekostet hat, ehrlich gesagt

On-Premise-KI ist nicht die günstige Option, und wir würden Ihnen einen Bärendienst erweisen, etwas anderes zu behaupten. Es gibt einen echten Server mit einer echten GPU zu kaufen, ein Aufsetzprojekt zu finanzieren und laufende Wartung einzuplanen — Patches, Modell-Updates, das gelegentliche Nachjustieren. Für eine Firma, deren Vertraulichkeit vertraglich ist, ist diese Ausgabe leicht zu rechtfertigen. Für eine Firma, der die Idee von Datenschutz einfach nur gefällt, ist sie es oft nicht, und das sagen wir auch.

Der ehrliche Kompromiss sieht so aus: höhere Anschaffungskosten und etwas mehr Verantwortung im Tausch gegen vollständige Kontrolle und keine Cloud-Gebühren pro Nachricht, die mit der Nutzung steigen. Für ein Team mit hoher Nutzung, das sensibles Material bearbeitet, verbessert sich die Rechnung mit der Zeit sogar — Sie haben die Kapazität gekauft, statt sie pro Anfrage zu mieten. Für leichte oder gelegentliche Nutzung wäre ein Cloud-Werkzeug fast sicher günstiger. Zu wissen, auf welcher Seite dieser Linie Sie stehen, ist der Großteil der Entscheidung.

  • Ein leistungsfähiger Server mit passender GPU — eine einmalige Investition, kein Abonnement.
  • Ein Aufsetzprojekt: Modell installieren und tunen, den Dokumentenindex aufbauen, die Zugriffskontrolle verdrahten.
  • Laufende Wartung: Sicherheits-Patches, Modell-Updates, gelegentliches Nachjustieren, wenn sich der Bedarf ändert.
  • Interne Verantwortung: eine benannte Person, die ein Auge darauf hat, genau wie bei jedem Kernsystem.
  • Keine Cloud-Rechnung pro Anfrage — Nutzung, die in der Cloud teuer würde, ist im Grunde kostenlos, sobald die Hardware bezahlt ist.

Würde das zu Ihrem Unternehmen passen?

Das war kein Einzelfall. Dasselbe Muster passt zu jeder Firma, bei der die Sensibilität der Daten die Einschränkung ist und nicht das Budget: Anwaltskanzleien, medizinische und gesundheitsnahe Anbieter, sicherheits- und verteidigungsnahe Arbeit, Finanzberater, Forschungs- und Entwicklungsteams, die auf Geschäftsgeheimnissen sitzen. Wenn Sie sich dabei ertappt haben, sich KI-Unterstützung zu wünschen, aber beim Gedanken daran, wohin die Daten gingen, zusammenzuzucken, sind Sie das Publikum, für das dieser Ansatz gebaut wurde.

Genauso gilt: Wenn Ihre Daten nicht besonders sensibel sind und Sie nur einen Aufpreis für ein Gefühl zahlen würden, weisen wir Sie auf eine gute Cloud-Option hin und ersparen Ihnen die Ausgabe. Die richtige Antwort hängt ganz von Ihren Pflichten ab, nicht davon, welche Technologie beeindruckender klingt. Der nützlichste erste Schritt ist nicht die Wahl eines Modells — es ist, ehrlich zu werden, was Ihre Verschwiegenheitspflichten tatsächlich verlangen.

Hält Sie die Verschwiegenheitspflicht davon ab, KI zu nutzen?

Wenn Ihre Daten rechtlich das Haus nicht verlassen dürfen, haben Sie trotzdem Optionen — und sie sind praktischer, als die meisten annehmen. Schauen wir gemeinsam, ob ein On-Premise-Aufbau zu Ihren Pflichten passt, ganz ohne Verpflichtung, etwas zu bauen.

On-Premise-KI entdecken

Häufige Fragen

Bedeutet On-Premise-KI, dass meine Daten das Haus nie verlassen?
Genau darum geht es. Das Modell läuft auf einem Server, der Ihnen gehört, in Ihrem eigenen Netzwerk, und beantwortet Fragen ohne jeden Umweg über das Internet. In dem beschriebenen Aufbau könnten Sie das Netzwerkkabel ziehen und der Assistent würde trotzdem funktionieren. Kein Dokument und kein Bruchstück davon wird zu irgendeinem externen Dienst hochgeladen.
Ist ein lokal betriebenes Modell so gut wie die großen Cloud-Modelle?
Nicht an der absoluten Spitze — aber für die tägliche Arbeit, die die meisten Firmen brauchen, Zusammenfassen, Fakten extrahieren, Entwerfen und Fragen zu den eigenen Dokumenten beantworten, ist ein gut gewähltes Open-Weight-Modell mehr als leistungsfähig. Sie brauchen selten das größtmögliche Modell; Sie brauchen ein kompetentes, das Sie vollständig kontrollieren.
Ist On-Premise-KI nicht sehr teuer?
Sie kostet anfangs mehr als ein Cloud-Abonnement, weil Sie echte Hardware kaufen und ein Aufsetzprojekt finanzieren. Aber es gibt keine Cloud-Gebühren pro Anfrage, sodass sich die Rechnung bei intensiver Nutzung mit der Zeit verbessert. Es ist die richtige Wahl, wenn Vertraulichkeit vertraglich oder regulatorisch ist — und die falsche, überteuerte Wahl, wenn nicht. Wir sagen Ihnen ehrlich, auf welcher Seite Sie stehen.
Wie lange dauert es, ein solches Projekt aufzusetzen?
Weniger Zeit, als man befürchtet, wenn es eng abgegrenzt ist. Wir beginnen mit einer Aufgabe, weisen sie auf einer Testmaschine mit Dummy-Daten nach, fahren einen kurzen Pilot an echter Arbeit und rollen erst dann aus. Ein fokussierter erster Einsatz ist typischerweise eine Sache von Wochen, nicht Monaten, weil wir bewusst darauf verzichten, zu viel zu bauen.
Wer wartet das System, wenn es einmal läuft?
Es braucht dieselbe leichte Verantwortung wie jedes Kernsystem im Unternehmen: Sicherheits-Patches, gelegentliche Modell-Updates und eine benannte interne Person, die ein Auge darauf hat. Wir können die technische Wartung übernehmen oder sie mit Dokumentation übergeben — aber die Daten und die Hardware bleiben vollständig Ihre.
Have a nice day
Have a nice day
Redaktion

Have a nice day ist ein Software-Studio, das kleine und mittlere Unternehmen digitalisiert — Automatisierung, KI und maßgeschneiderte Software, die im Alltag funktioniert, nicht nur auf Folien.

Passende Leistungen