On-Premise-KI für eine Kanzlei mit Verschwiegenheitspflicht: Eine Fallstudie
Eine Sicherheitsberatung wollte die Produktivität moderner KI, ohne dass ein einziges Dokument je das Haus verlässt. So haben wir einen privaten Assistenten gebaut, der vollständig auf ihrer eigenen Hardware läuft — und was es wirklich dazu brauchte.

Manche Unternehmen können ihre Daten nicht in die Cloud eines anderen legen — nicht aus Paranoia, sondern weil Vertraulichkeit das eigentliche Produkt ist, das sie verkaufen. Dies ist die Geschichte einer solchen Firma und wie wir ihr die Geschwindigkeit eines modernen KI-Assistenten gegeben haben, ohne dass je eine einzige Mandantenakte die eigenen vier Wände verlassen hat. Kein Marketing-Glanz. Nur das, was wir versucht haben, was schiefging und was am Ende funktionierte.
Ein paar Mal im Jahr erreicht uns eine ganz bestimmte Art von Anfrage. Sie beginnt meist mit einem Satz wie: „Wir würden KI gerne nutzen, aber wir dürfen unsere Daten rechtlich nirgendwo hinschicken.“ Die Person am anderen Ende hat bereits mit angesehen, wie Kolleginnen und Kollegen sensibles Material in einen öffentlichen Chatbot kopiert haben, hat einen Schrecken bekommen und die ganze Kategorie still verboten. Diese Menschen sind keine Technikfeinde. Sie stecken fest zwischen einer echten Produktivitätschance und einer nicht verhandelbaren Verschwiegenheitspflicht.
Diese Fallstudie handelt von genau so einer Firma. Um die Vertraulichkeit zu wahren, die das Projekt überhaupt erst geprägt hat, haben wir alles anonymisiert — den Namen, die Personen, die Details ihrer Mandanten. Die Zahlen sind illustrativ und gerundet, keine geprüften Werte. Aber die Form des Problems und die Art, wie wir es gelöst haben, sind genau so, wie es geschehen ist.
Die Ausgangslage: Produktivität hinter einer Mauer der Verschwiegenheit
Der Kunde war eine mittelgroße Beratungsfirma in einem Feld, in dem Diskretion kein Nice-to-have ist — sondern der ganze Grund, warum Mandanten sie überhaupt beauftragen. Denken Sie an eine Praxis, die sensible unternehmensbezogene, rechtliche oder sicherheitsnahe Arbeit übernimmt, bei der ein Leck nicht nur peinlich wäre, sondern das Geschäft beenden würde. Rund dreißig Personen, eine ernste Fallauslastung und ein Berg langer, dichter Dokumente, die jede Woche jemand lesen, zusammenfassen und abgleichen muss.
Ihr Team hatte zugesehen, wie der Rest der Welt mit KI-Assistenten schneller wurde, und spürte, wie der Abstand größer wurde. Ein Junior konnte einen halben Tag damit verbringen, die Kernpunkte aus einem 90-seitigen Bericht herauszuziehen. Der erste Entwurf einer Zusammenfassung fraß Stunden, die niemand in Rechnung stellte. Die Arbeit war genau die Art von dichter, sprachlastiger Schwerstarbeit, in der moderne KI wirklich gut ist — und sie durften nichts davon anrühren.
Der Blocker war einfach und absolut. Ihre Mandantenvereinbarungen und ihre eigene interne Richtlinie verboten es, Mandantenmaterial an einen Drittdienst zu senden. Nicht anonymisiert, nicht verschlüsselt auf dem Übertragungsweg, nicht „der Anbieter verspricht, nicht damit zu trainieren“. Die Daten durften das Gelände nicht verlassen, Punkt. Jedes Cloud-KI-Werkzeug am Markt war damit per Definition ausgeschlossen, egal wie gut seine Datenschutzerklärung auf dem Papier aussah.
“Sie wollten nicht das Versprechen eines Anbieters, dass die Daten sicher seien. Sie wollten, dass die Daten nie in eine Lage geraten, in der ein Versprechen nötig ist.”
Diese letzte Unterscheidung ist das ganze Projekt in einem Satz. Viele „private KI“-Angebote sind in Wahrheit die Cloud eines anderen mit einem strengeren Vertrag. Für diesen Kunden reichte das nicht. Die einzig akzeptable Antwort war ein System, in dem die sensiblen Daten physisch nie unterwegs waren — bei dem man im Prinzip das Netzwerkkabel ziehen könnte und der Assistent trotzdem funktioniert.

Warum die naheliegenden Cloud-Antworten nicht passten
Bevor wir etwas gebaut haben, haben wir die einfacheren Wege sorgfältig geprüft — denn On-Premise ist mehr Aufwand, und wir empfehlen es nicht, wenn eine einfachere Option wirklich passt. Für diesen Kunden scheiterte jede Abkürzung an derselben Mauer.
Die großen Anbieter bieten alle Enterprise-Tarife mit „wir trainieren nicht mit Ihren Daten“ und regionalem Hosting an. Beruhigend, und für viele Unternehmen völlig ausreichend. Aber es bedeutet trotzdem, dass Mandantendateien das Haus verlassen und, sei es auch nur kurz, auf einer Infrastruktur liegen, die die Firma nicht kontrolliert. Für eine Praxis, deren Verträge das ausdrücklich verbieten, bleibt ein starkes Versprechen ein Versprechen — und Versprechen überleben keine Prüfungsfrage, die mit „Können Sie garantieren …“ beginnt.
Wir haben auch eine Private-Cloud-Instanz ausgeschlossen — eine dedizierte, isolierte Umgebung, die ein Anbieter hostet. Technisch stärker und für manche Firmen absolut passend. Aber es platzierte die Daten trotzdem auf gemieteter Hardware in einem Gebäude, das dem Kunden nicht gehörte, und es hielt eine Abhängigkeit von einem externen Anbieter für etwas aufrecht, das der Kunde vollständig unter dem eigenen Dach haben wollte. Er war bereit, für diese Kontrolle etwas Bequemlichkeit einzutauschen. Also wurde es On-Premise.
Was wir tatsächlich gebaut haben
Die Lösung, auf das Wesentliche reduziert, war ein privater KI-Assistent, der auf einem einzigen leistungsfähigen Server im Büro des Kunden läuft. Das Team erreicht ihn über eine ganz normale Webseite im Browser — es sieht sich an und fühlt sich an wie die Chat-Werkzeuge, die alle bereits kennen. Hinter diesem vertrauten Fenster verlässt nichts je das lokale Netzwerk.
Wir haben die Architektur bewusst langweilig gehalten. Langweilig ist zuverlässig, und zuverlässig ist genau das, was ein datenschutzkritisches System braucht. Drei bewegliche Teile sind es wert, benannt zu werden.
Ein Open-Weight-Modell, das lokal läuft
Statt ein gehostetes Modell aufzurufen, haben wir ein leistungsfähiges Open-Weight-Sprachmodell direkt auf der GPU des Servers laufen lassen. Open-Weight ist hier entscheidend: Die Modelldateien liegen auf der Festplatte des Kunden, laufen auf der Hardware des Kunden und beantworten Fragen ohne jeden Umweg über das Internet. Für ihre Arbeit — Zusammenfassen, Extrahieren, Entwerfen, Fragen zu den eigenen Dokumenten beantworten — war ein gut gewähltes mittelgroßes Modell mehr als ausreichend. Sie brauchten nicht die absolute Spitze; sie brauchten kompetent und privat.
Eine private Wissensschicht über ihren eigenen Dateien
Der eigentliche Wert war kein generischer Chatbot — es war ein Assistent, der Fragen zu ihren eigenen Fallakten beantworten konnte. Wir haben eine Retrieval-Schicht gebaut, die ihre Dokumente lokal indiziert, sodass das System, wenn jemand fragt „Was haben wir im Fall Müller zu X festgehalten“, die relevanten Passagen findet und daraus antwortet. Dieser Index sitzt, wie alles andere, vollständig auf der lokalen Maschine. Kein Dokument und kein Bruchstück davon wird je irgendwohin hochgeladen.
Zugriffskontrolle, die zu ihren bestehenden Regeln passt
Eine Firma wie diese hat bereits strenge Regeln, wer welche Dateien sehen darf. Der Assistent musste sie respektieren, nicht umgehen. Also spiegelte der Zugriff ihre bestehenden Berechtigungen: Sie können die KI nur zu Material fragen, das Sie ohnehin öffnen dürfen. Das klingt selbstverständlich, aber es ist der Teil, der aus einer cleveren Demo etwas macht, das ein Compliance-Verantwortlicher tatsächlich freigibt.

Wie wir es ausgerollt haben, ohne die Arbeit zu stören
Eine Firma mit Datenschutz an erster Stelle ist verständlicherweise vorsichtig mit neuen Systemen. Wir wollten kein Vertrauen gewinnen, indem wir einen Schalter umlegen und den Sieg verkünden. Also haben wir das Projekt als eine Reihe kleiner, umkehrbarer Schritte gefahren, jeder für sich nachweisbar, bevor der nächste begann.
- 1Zuerst eine schmerzhafte Aufgabe klar abgegrenztWir haben nicht versucht, ‚KI in die Firma einzuführen‘. Wir haben eine einzelne, häufige Aufgabe gewählt — das Zusammenfassen langer eingehender Dokumente — und dafür gebaut. Ein klares Ziel, leicht als Erfolg oder Misserfolg zu beurteilen.
- 2Auf einer Testmaschine mit Dummy-Daten gebautAlles wurde zuerst auf einer isolierten Maschine mit erfundenen Dokumenten aufgesetzt, sodass keine echten Mandantendaten im Spiel waren, bis das System bewiesen und das Sicherheitsmodell geprüft war.
- 3Einen geschlossenen Pilot mit wenigen Power-Usern gefahrenEine Handvoll erfahrener Mitarbeiterinnen und Mitarbeiter hat es mehrere Wochen lang an echter Arbeit genutzt, parallel zum normalen Ablauf. Sie fanden die rauen Kanten — seltsame Formulierungen, ein paar Dokumente, die der Index schlecht verarbeitete — und wir haben sie behoben.
- 4Es gegen ihre eigene Richtlinie geprüftVor jedem breiteren Rollout hat ihr Compliance-Verantwortlicher genau geprüft, wo Daten lagen und wohin sie sich bewegten. Weil die Antwort ‚nirgendwo außer hier‘ war, fiel diese Prüfung kurz aus — was das ganze Designziel war.
- 5Es dem Team mit einer einseitigen Anleitung geöffnetErst als es Vertrauen genoss, haben wir es firmenweit ausgerollt, mit einer verständlichen Notiz dazu, worin es gut ist, worin nicht, und dem Hinweis, dass es nie erfindet — es zitiert.
Das Ergebnis: Stunden zurückgewonnen, und nichts hat das Haus verlassen
Innerhalb weniger Monate nach dem vollständigen Rollout war der Assistent still zu einem Teil des Arbeitsalltags geworden. Das wichtigste Ergebnis war das, das ihnen am meisten am Herzen lag: kein einziges Byte Mandantendaten hat je das Gelände verlassen, und sie konnten es jedem beweisen, der fragte. Das System läuft auf ihrem Server, in ihrem Büro, unter ihrer Kontrolle. Das allein rechtfertigte das Projekt für sie.
Die Produktivitätsseite war das Extra, das es lohnend machte. Der erste Entwurf einer Zusammenfassung eines langen Dokuments — vorher eine mehrstündige Aufgabe für einen Junior — sank auf Minuten zum Prüfen und Nachbearbeiten. Mitarbeitende hörten auf, ganze Akten erneut zu lesen, um eine einzige Sachfrage zu beantworten; sie fragten den Assistenten, bekamen eine zitierte Passage und verifizierten sie in Sekunden. Im ganzen Team summierte sich die gewonnene Zeit zu einem spürbaren Teil jeder Woche, umgelenkt vom Durcharbeiten von Dokumenten hin zur höherwertigen Analyse, für die Mandanten tatsächlich bezahlen.
Ebenso vielsagend war eine leisere Veränderung. Menschen, die still nervös gegenüber KI gewesen waren — die befürchteten, sie sei ein Leck, das nur darauf wartet zu passieren — wurden im Umgang mit ihr entspannt, gerade weil sie verstanden, warum sie sicher war. Vertrauen kam nicht daher, dass wir sie beruhigten. Es kam von einer Architektur, die sie einem Mandanten in einem Satz erklären konnten: Es verlässt nie das Haus.
| Aspekt | Vorher | Nachher |
|---|---|---|
| Ein langes Dokument zusammenfassen | Ein halber Tag, von Hand | Minuten, um einen Entwurf zu prüfen |
| Eine Frage zu einer Akte beantworten | Die ganze Akte erneut lesen | Fragen, zitierte Passage erhalten |
| Wohin Mandantendaten gehen | Bleiben drin, aber KI tabu | Bleiben drin, und KI nutzbar |
| Compliance-Prüfung des Werkzeugs | Würde am ersten Tag durchfallen | Kurz — nichts verlässt das Haus |
| Vertrauen des Teams in KI | Ängstlich, meist gemieden | Entspannt, verstanden |

“Der Gewinn war nicht, dass die KI clever war. Er war, dass zum ersten Mal die Compliance-Antwort und die Produktivitäts-Antwort dieselbe Antwort waren.”
Was es gekostet hat, ehrlich gesagt
On-Premise-KI ist nicht die günstige Option, und wir würden Ihnen einen Bärendienst erweisen, etwas anderes zu behaupten. Es gibt einen echten Server mit einer echten GPU zu kaufen, ein Aufsetzprojekt zu finanzieren und laufende Wartung einzuplanen — Patches, Modell-Updates, das gelegentliche Nachjustieren. Für eine Firma, deren Vertraulichkeit vertraglich ist, ist diese Ausgabe leicht zu rechtfertigen. Für eine Firma, der die Idee von Datenschutz einfach nur gefällt, ist sie es oft nicht, und das sagen wir auch.
Der ehrliche Kompromiss sieht so aus: höhere Anschaffungskosten und etwas mehr Verantwortung im Tausch gegen vollständige Kontrolle und keine Cloud-Gebühren pro Nachricht, die mit der Nutzung steigen. Für ein Team mit hoher Nutzung, das sensibles Material bearbeitet, verbessert sich die Rechnung mit der Zeit sogar — Sie haben die Kapazität gekauft, statt sie pro Anfrage zu mieten. Für leichte oder gelegentliche Nutzung wäre ein Cloud-Werkzeug fast sicher günstiger. Zu wissen, auf welcher Seite dieser Linie Sie stehen, ist der Großteil der Entscheidung.
- Ein leistungsfähiger Server mit passender GPU — eine einmalige Investition, kein Abonnement.
- Ein Aufsetzprojekt: Modell installieren und tunen, den Dokumentenindex aufbauen, die Zugriffskontrolle verdrahten.
- Laufende Wartung: Sicherheits-Patches, Modell-Updates, gelegentliches Nachjustieren, wenn sich der Bedarf ändert.
- Interne Verantwortung: eine benannte Person, die ein Auge darauf hat, genau wie bei jedem Kernsystem.
- Keine Cloud-Rechnung pro Anfrage — Nutzung, die in der Cloud teuer würde, ist im Grunde kostenlos, sobald die Hardware bezahlt ist.
Würde das zu Ihrem Unternehmen passen?
Das war kein Einzelfall. Dasselbe Muster passt zu jeder Firma, bei der die Sensibilität der Daten die Einschränkung ist und nicht das Budget: Anwaltskanzleien, medizinische und gesundheitsnahe Anbieter, sicherheits- und verteidigungsnahe Arbeit, Finanzberater, Forschungs- und Entwicklungsteams, die auf Geschäftsgeheimnissen sitzen. Wenn Sie sich dabei ertappt haben, sich KI-Unterstützung zu wünschen, aber beim Gedanken daran, wohin die Daten gingen, zusammenzuzucken, sind Sie das Publikum, für das dieser Ansatz gebaut wurde.
Genauso gilt: Wenn Ihre Daten nicht besonders sensibel sind und Sie nur einen Aufpreis für ein Gefühl zahlen würden, weisen wir Sie auf eine gute Cloud-Option hin und ersparen Ihnen die Ausgabe. Die richtige Antwort hängt ganz von Ihren Pflichten ab, nicht davon, welche Technologie beeindruckender klingt. Der nützlichste erste Schritt ist nicht die Wahl eines Modells — es ist, ehrlich zu werden, was Ihre Verschwiegenheitspflichten tatsächlich verlangen.
Hält Sie die Verschwiegenheitspflicht davon ab, KI zu nutzen?
Wenn Ihre Daten rechtlich das Haus nicht verlassen dürfen, haben Sie trotzdem Optionen — und sie sind praktischer, als die meisten annehmen. Schauen wir gemeinsam, ob ein On-Premise-Aufbau zu Ihren Pflichten passt, ganz ohne Verpflichtung, etwas zu bauen.
On-Premise-KI entdeckenHäufige Fragen
Bedeutet On-Premise-KI, dass meine Daten das Haus nie verlassen?
Ist ein lokal betriebenes Modell so gut wie die großen Cloud-Modelle?
Ist On-Premise-KI nicht sehr teuer?
Wie lange dauert es, ein solches Projekt aufzusetzen?
Wer wartet das System, wenn es einmal läuft?

Have a nice day ist ein Software-Studio, das kleine und mittlere Unternehmen digitalisiert — Automatisierung, KI und maßgeschneiderte Software, die im Alltag funktioniert, nicht nur auf Folien.