KI
Ein LLM auf Ihrer eigenen Infrastruktur betreiben
Was ist ein großes Sprachmodell (Large Language Model)?
Ein großes Sprachmodell (LLM) ist ein neuronales Netzwerk, das auf großen Textmengen trainiert wurde, um menschliche Sprache zu verstehen und zu generieren. Zum Zeitpunkt der Inferenz (Anwendung) gibt ein Benutzer einen Prompt ein, das Modell verarbeitet diesen und eine Antwort wird zurückgegeben. Das Modell selbst verändert sich nach dem Training nicht mehr. Nur der Prompt und die Antwort bewegen sich zwischen dem Benutzer und dem System.
Genau dieser letzte Satz ist der Punkt, an dem die Datenresidenz relevant wird. Jeder Prompt ist potenziell sensibel. In einer Bank könnte er einen Kundennamen oder eine Kontonummer enthalten. In einem Krankenhaus könnte er eine Diagnose enthalten. In einer Anwaltskanzlei kann er privilegierte Mandantenanweisungen enthalten. Die Frage, wo das Modell ausgeführt wird, ist daher die Frage, wohin diese Daten fließen.
Warum die meisten LLM-Bereitstellungen Daten aus Ihrem Unternehmen heraussenden
Öffentliche LLM-APIs funktionieren so, dass Prompts an die Inferenz-Infrastruktur eines Drittanbieters weitergeleitet werden. Der Prompt verlässt Ihr Netzwerk, wird auf einer Hardware verarbeitet, die Sie nicht kontrollieren, und eine Antwort wird zurückgegeben. Die Datenverarbeitungsvereinbarung des Anbieters regelt, was mit diesen Daten während der Übertragung und im Ruhezustand geschieht.
Für Organisationen in regulierten Sektoren führt dies eher zu einem Nachweisproblem als zu einem Vertragsproblem. Die DSGVO verbietet den Einsatz eines Auftragsverarbeiters nicht. Sie verlangt jedoch, dass Sie wissen, was der Auftragsverarbeiter tut, dass Sie die Übermittlung bewerten, wenn die Verarbeitung in ein Drittland erfolgt, und dass Sie diese Bewertung auf Anfrage nachweisen können. Wenn der Anbieter oder dessen Muttergesellschaft dem Zugriffsregime einer ausländischen Regierung unterliegt, muss diese Bewertung auch Zugriffe berücksichtigen, die Ihr Vertrag nicht verhindern kann. Branchenaufsichten und interne Informationssicherheitsrichtlinien legen dann noch eigene Kontroll- und Dokumentationspflichten darüber.
Das Ergebnis ist in vielen Organisationen ein De-facto-Verbot der LLM-Nutzung für alle Aufgaben, bei denen echte Daten im Spiel sind, während einzelne Mitarbeiter dennoch sensible Prompts über öffentliche APIs senden. Dies ist Schatten-KI: unkontrolliert, ungeprüft und materiell nicht rechtskonform.
Was es bedeutet, ein LLM auf der eigenen Infrastruktur zu betreiben
Das Ausführen eines LLM auf Ihrer eigenen Infrastruktur bedeutet, dass das Modell auf Hardware innerhalb Ihrer Netzwerkgrenzen ausgeführt wird. Der Prompt verlässt diese Grenze nie. Die Antwort wird lokal generiert. Es werden keine Daten an Dritte übermittelt.
Dies ist heute technisch machbar, da leistungsfähige Open-Weight-Modelle für die On-Premise-Bereitstellung zur Verfügung stehen. Die Hardwareanforderungen hängen vom Modell und der Inferenz-Arbeitslast ab, aber Organisationen, die bereits ihre eigene Serverinfrastruktur betreiben, liegen absolut in dem Bereich, in dem private Inferenz betrieblich praktikabel ist.
Das Modell selbst ist nur eine Komponente. Darüber hinaus benötigt eine Organisation:
Bereitstellung (Deployment): eine validierte, reproduzierbare Methode zur Installation und Aktualisierung des Modells und der Inferenzschicht auf den eigenen Servern
Governance: eine Zugriffskontrolle, die festlegt, welche Benutzer, Systeme und Anwendungen Prompts unter welchen Richtlinien einreichen dürfen
Audit (Überprüfung): ein Protokoll jeder Inferenz, das ausreicht, um Regulierungsbehörden nachzuweisen, dass das System innerhalb seines genehmigten Rahmens genutzt wurde
Diese drei Anforderungen – und nicht das Modell selbst – sind das, was eine private KI-Infrastrukturplattform adressiert.
Wie Xinity die private LLM-Bereitstellung angeht
Xinity ist die Schicht um das Modell herum: Bereitstellung, Governance und Auditierung. Organisationen nutzen Xinity, um validierte offene Modelle auf von ihnen kontrollierter Hardware innerhalb ihres eigenen Netzwerks auszuführen – mit Zugriffskontrolle, Richtliniendurchsetzung und einem lückenlosen Audit-Trail für jede Inferenz.
Die Plattform wird als Software für On-Premise- und Private-Cloud-Umgebungen bereitgestellt. Daten verlassen Ihre Infrastruktur nie. Es besteht keine Abhängigkeit von einem öffentlichen Cloud-Anbieter.
Dieser Ansatz wird in der Positionierung von Xinity als „souverän durch Architektur, nicht durch Vertrag“ beschrieben. Ein Vertrag mit einem Cloud-Anbieter schränkt ein, was der Anbieter mit Ihren Daten tun darf. Eine Architektur, bei der das Modell auf Ihren eigenen Servern läuft, erübrigt diese Frage gänzlich.
Für wen das relevant ist
Die private LLM-Bereitstellung ist eine akute betriebliche Notwendigkeit für Organisationen, bei denen die Kontrolle über die Datenverarbeitung nachgewiesen und nicht bloß behauptet werden muss:
Finanzdienstleistungen: Beaufsichtigte Institute tragen dokumentierte Kontrollpflichten über die Verarbeitung von Kundendaten, einschließlich der Fähigkeit, einer Aufsichtsbehörde zu zeigen, wo die Verarbeitung stattfindet und wer darauf zugreifen kann. Die Konzentration auf eine kleine Anzahl externer Anbieter ist selbst zu einer regulatorischen Sorge geworden.
Gesundheitswesen: Patientendaten sind Daten besonderer Kategorien. Ein KI-System, das diese verarbeitet, erbt dieselben Zugriffskontroll-, Protokollierungs- und Vertraulichkeitspflichten wie die klinischen Systeme um es herum und in der Regel auch denselben internen Freigabepfad.
Öffentlicher Sektor: In Österreich und im gesamten DACH-Raum werden sensible Verwaltungsarbeitslasten in der Praxis auf staatlich betriebenen oder anderweitig kontrollierten Infrastrukturen gehalten, anstatt über die öffentliche Cloud von Drittanbietern geleitet zu werden. Die Beschaffung spiegelt dies wider, lange bevor eine rechtliche Frage überhaupt im Raum steht.
Rechtswesen: Das anwaltliche Berufsgeheimnis und Verschwiegenheitspflichten gelten für alle Daten, die eine Kanzlei in eine LLM-Anfrage eingeben würde.
Für Organisationen auf diesem Niveau digitaler Reife lautet die entscheidende Frage nicht, ob sie LLMs nutzen sollen, sondern wie sie diese so bereitstellen können, dass sie überprüfbar, kontrollierbar und rechtlich absicherbar sind.
Erste Schritte
Xinity bietet ein 30-tägiges Pilotprogramm für Organisationen an, die bereit sind, die private Inferenz auf ihrer eigenen Infrastruktur zu evaluieren. Das Pilotprojekt richtet sich an Organisationen, die bereits über ein KI-Team und eine eigene Serverumgebung verfügen und von der Evaluierung zu einer geregelten Produktionsbereitstellung übergehen möchten.
Um mehr zu erfahren, besuchen Sie xinity.ai oder kontaktieren Sie uns direkt.