KI
On-Premise-AI-Infrastruktur bewerten: Ein Leitfaden für Einkäufer
Wenn Sie in einer Bank, einem Krankenhaus, einer Anwaltskanzlei, einer Redaktion oder einer Behörde arbeiten, stellt sich nicht mehr die Frage, ob Ihre Teams KI nutzen werden. Sie tun es bereits. Die Frage ist vielmehr, ob Sie diese so betreiben können, dass sie einer Überprüfung standhält.
On-Premise-KI verspricht genau das: Modelle, die auf von Ihnen kontrollierter Hardware laufen, mit Daten, die Ihr Netzwerk nie verlassen. Aber „On-Premise“ allein sagt wenig darüber aus, ob eine Plattform für ein reguliertes Umfeld bereit ist. Zwei Angebote können beide in Ihrem Rechenzentrum laufen und sich dennoch völlig darin unterscheiden, was Sie damit nachweisen können.
Dieser Leitfaden führt Sie durch die wichtigsten Kriterien in der richtigen Reihenfolge und schließt mit zehn Fragen ab, die Sie in jedes Anbietergespräch mitnehmen sollten.
Beginnen Sie mit der Frage, die Ihr Auditor stellen wird
Die meisten Evaluierungen beginnen mit dem Modell: welches, wie groß, wie schnell. Das ist wichtig, aber es ist nicht das, was Ihr Auditor, Ihr Datenschutzbeauftragter oder Ihre Regulierungsbehörde zuerst fragen wird.
Sie werden drei Dinge wissen wollen: Wer hat die KI genutzt? Wofür? Und wohin flossen die Daten?
Wenn eine Plattform diese Fragen nicht klar beantworten kann, spielt das Modell, auf dem sie läuft, keine Rolle. Beginnen Sie Ihre Evaluierung also dort, wo die Prüfung stattfinden wird, und arbeiten Sie sich von dort aus zur Technologie vor.
1. Wo sie läuft
Die erste Prüfung ist die einfachste, und man kann dabei leicht Fehler machen. „On-Premise“ sollte bedeuten, dass die Inferenz auf Hardware läuft, die Sie besitzen oder ausgewählt haben, innerhalb eines von Ihnen kontrollierten Bereichs.
Prüfen Sie die Details:
Prompts und Antworten. Bleiben sie bei jedem Schritt in Ihrem Netzwerk oder läuft irgendein Teil der Anfrage über einen externen Dienst?
Protokolle und Telemetrie. Wo werden sie gespeichert und wird standardmäßig irgendetwas an den Anbieter zurückgesendet?
Abhängigkeiten. Benötigt die Plattform eine Internetverbindung, um zu funktionieren, oder kann sie bei Bedarf völlig autark (Air-Gapped) laufen?
Für Organisationen, die an das Berufsgeheimnis, Bankenvorschriften oder die ärztliche Schweigepflicht gebunden sind, ist dies das Fundament. Gemäß DSGVO Artikel 28 ist jeder zusätzliche externe Auftragsverarbeiter ein weiterer Vertrag, der verhandelt, und eine weitere Partei, die geprüft werden muss. Wenn die Inferenz innerhalb Ihres eigenen Netzwerks verbleibt, werden Prompts und Antworten niemals an einen externen Modellanbieter gesendet, wodurch eine ganze Kategorie von zu prüfenden Auftragsverarbeitern entfällt.
2. Zugriffskontrolle
Sobald die KI in Ihrem Haus läuft, stellt sich als Nächstes die Frage, wer darauf zugreifen kann. In den meisten Organisationen sollte die Antwort je nach Team unterschiedlich ausfallen. Ihre Rechtsabteilung und Ihr Marketingteam sollten wahrscheinlich nicht denselben Zugriff auf dieselben Daten unter denselben Regeln haben.
Achten Sie auf Folgendes:
Rollenbasierte Zugriffskontrolle (RBAC), damit Berechtigungen an Rollen und nicht an individuelle Absprachen gebunden sind.
Single Sign-On (SSO), angebunden an Ihren bestehenden Identitätsanbieter, damit ausscheidende Mitarbeiter automatisch den Zugriff verlieren.
Schlüssel pro Anwendung, damit jedes Tool, das ein Modell aufruft, identifiziert und separat abgeschaltet werden kann.
Der Test ist einfach: Können Sie den Zugriff pro Team und pro Anwendung über eine Einstellung steuern? Wenn die Antwort E-Mails und Excel-Tabellen beinhaltet, ist keine echte Zugriffskontrolle vorhanden.
3. Audit-Trail (Prüfpfad)
Hier scheitern viele Plattformen, und hier haben regulierte Organisationen den geringsten Spielraum für Kompromisse.
Ein brauchbarer Audit-Trail zeichnet jede Anfrage auf: wann sie gestellt wurde, über welche Anwendung, mit welchem Schlüssel und an welches Modell. Er sollte auf Ihrer Seite gespeichert werden, und Ihr Datenschutzbeauftragter sollte ihn lesen können, ohne ein Ticket beim Anbieter eröffnen zu müssen.
Fragen Sie, wie der Audit-Trail erstellt wird. Wenn die Protokollierung etwas ist, das Sie erst einschalten, pro Anwendung konfigurieren oder manuell pflegen müssen, wird es Lücken geben. Sie sollte standardmäßig für jede Anfrage erfolgen, ohne dass jemand darüber nachdenken muss.
Die Dokumentationspflichten der DSGVO, einschließlich der Verzeichnisse von Verarbeitungstätigkeiten und der Sicherheitsmaßnahmen nach Artikel 32, verbleiben bei Ihnen, unabhängig davon, wo das Modell läuft. Eine gute Plattform erleichtert die Einhaltung dieser Pflichten. Sie kann sie Ihnen jedoch nicht abnehmen.
4. Die Richtlinienebene (Policy Layer)
Die Zugriffskontrolle entscheidet, wer die KI erreichen kann. Die Richtlinienebene entscheidet, was passiert, wenn sie es tun.
Man kann sie sich als das Regelwerk vorstellen, das über den Modellen liegt: Welche Anfragen gehen an welches Modell, wie wird die Nutzung nachverfolgt, welche Anwendungen sind überhaupt zugelassen. Ohne diese Ebene muss jede Anwendung ihre eigenen Regeln mitbringen, was im Laufe der Zeit zu Abweichungen führt.
Diese Ebene fehlt am häufigsten, wenn Organisationen On-Premise-KI selbst zusammenstellen. Ein Modell auf eigener Hardware laufen zu lassen, ist mittlerweile unkompliziert. Die Steuerung der Nutzung durch Dutzende von Teams und Anwendungen ist der schwierigere Teil. Bei Xinity bauen wir genau das: ein Gateway und ein Dashboard, die vor Ihren Modellen liegen und Routing, Zugriffskontrolle, Aufzeichnung von Anfragen und Nutzungsanalyse an einem zentralen Ort verwalten.
5. Bereitstellung und Modellauswahl
Modelle ändern sich schnell. Das Modell, das heute am besten passt, ist in zwölf Monaten vielleicht nicht mehr das gewünschte. Ihre Infrastruktur sollte es Ihnen ermöglichen, zu wechseln, ohne alles drumherum neu aufbauen zu müssen.
Der praktische Test dafür ist die Kompatibilität. Eine Plattform mit einem OpenAI-kompatiblen Endpunkt ermöglicht es bestehenden Anwendungen, ohne Code-Änderungen einfach auf eine neue Basis-URL mit einem neuen Schlüssel zu verweisen. Viele Programmiertools, Chat-Oberflächen, Automatisierungsplattformen und Entwickler-Frameworks unterstützen dies bereits.
Prüfen Sie außerdem:
Welche Modelle Sie ausführen können und ob Sie Ihre eigenen mitbringen können.
Wie neue Modelle bereitgestellt werden und wie lange das realistisch dauert.
Ob mehrere Modelle parallel laufen können, sodass unterschiedliche Workloads auch unterschiedliche Modelle nutzen können.
6. Betrieb (Operations)
Stellen Sie schließlich die pragmatischen Fragen. Wer installiert es? Wer führt die Updates durch? Wer ist erreichbar, wenn an einem Montagmorgen um neun Uhr etwas ausfällt?
On-Premise gibt Ihnen die Kontrolle, überträgt Ihnen aber auch die Verantwortung. Klären Sie genau, welche Teile Sie selbst betreiben und welche der Anbieter unterstützt, und halten Sie diese Aufteilung schriftlich fest. Ein klares Modell der geteilten Verantwortung (Shared-Responsibility-Modell) ist ein gutes Zeichen. Ein vages ist eine Warnung.
Zehn Fragen für jedes Anbietergespräch
Bleiben Prompts und Antworten bei jedem Schritt in unserem Netzwerk?
Verlässt standardmäßig irgendetwas unsere Umgebung, einschließlich Protokollen oder Telemetrie?
Kann die Plattform völlig autark (Air-Gapped) betrieben werden?
Können wir den Zugriff pro Team und pro Anwendung steuern?
Lässt sie sich an unser bestehendes SSO anbinden?
Wird jede Anfrage standardmäßig protokolliert und wo wird dieses Protokoll gespeichert?
Kann unser Datenschutzbeauftragter den Audit-Trail ohne Ihre Hilfe einsehen?
Wo liegen die Regeln oberhalb der Modelle: Routing, Zugriff, Nutzungsanalyse?
Ist der Endpunkt OpenAI-kompatibel, sodass unsere Anwendungen nicht neu geschrieben werden müssen?
Welche Teile betreiben wir, welche unterstützen Sie, und ist das schriftlich vereinbart?
Eine Plattform, die alle zehn Fragen klar beantwortet, ist bereit für ein reguliertes Umfeld. Eine, die beim Audit-Trail oder der Richtlinienebene zögert, ist es wahrscheinlich noch nicht – ganz gleich, wie gut ihre Modelle sein mögen.
Sehen Sie es auf Ihrer eigenen Hardware
Wenn Sie diese Fragen lieber an echten Workloads statt an einer PowerPoint-Präsentation testen möchten: Xinity bietet ein 30-tägiges Pilotprojekt auf Ihrer eigenen Infrastruktur an. Sie sehen, wie KI genutzt wird, über welche Anwendungen und wohin jede Anfrage fließt – und entscheiden erst danach.
Starten Sie das Pilotprojekt oder entdecken Sie den Open-Source-Kern auf GitHub.
Dieser Artikel wurde mit Unterstützung von KI verfasst und natürlich vom Xinity-Team überprüft.