Unsere Kunden

Wer KI auf der eigenen Hardware ausführt

Xinity wird von Organisationen eingesetzt, die einen funktionierenden AI-Anwendungsfall haben und einen rechtlichen oder vertraglichen Grund, warum ihre Daten das Haus nicht verlassen dürfen. In der Praxis sind das regulierte Branchen im DACH-Raum: Banken, Gesundheitswesen, Recht, Medien, öffentliche Verwaltung und industrielle Produktion. Die Inferenz läuft auf Hardware, die der Organisation gehört. Kein Prompt, kein Dokument und keine Ausgabe erreicht einen externen Anbieter.

Drei Gründe, AI auf eigener Hardware zu betreiben

Pflicht

Regulierte Institutionen und öffentlicher Sektor

Für diese Organisationen ist On-Premise-Inferenz keine Präferenz, sondern die einzige Konfiguration, die ihre Aufsicht akzeptiert.

Gesundheitswesen, Rechts-, Finanz- und Behördenorganisationen unter strengem Datenschutzrecht, bei denen die vollständige Kontrolle über den Ort der Verarbeitung dokumentierte Anforderung ist.

✓DSGVO- und EU-AI-Act-konform durch Architektur
✓Audit-Protokoll bei jeder Inferenzanfrage
✓Keine Daten verlassen Ihre Infrastruktur
✓On-Premise-Deployment, keine Cloud-Abhängigkeit
Geheimnis

Industrie, Medien und Produktion

Hier ist das Risiko keine Geldbuße, sondern ein Wettbewerber oder eine Quelle, die etwas erfährt.

Fertigungs-, Ingenieur- und Medienunternehmen, die Geschäftsgeheimnisse, proprietäre Workflows und vertrauliche Quellen vor externen Systemen schützen.

✓Proprietäre Modelle und Trainingsdaten schützen
✓AI in air-gapped oder isolierten Netzwerken betreiben
✓Quellenschutz für Redaktionen
✓Kein Vendor Lock-in, offene Standard-APIs
Strategie

Datenorientierte Unternehmen

Keine Aufsicht verlangt es. Diese Unternehmen halten AI intern, weil die Daten das Geschäft sind.

Organisationen, die AI und Daten aus wettbewerblichen oder wirtschaftlichen Gründen intern halten, unabhängig von regulatorischen Anforderungen.

✓Feste Kapazitätskosten, keine Token-Überraschungen
✓Wettbewerbsvorteil durch Dateneigentum
✓Kosten sinken mit steigender interner Nutzung
✓Unabhängigkeit von US-Hyperscalern

Was regulierte Organisationen über die Inferenz hinaus brauchen

Die meisten technischen Teams wissen bereits, dass die Open-Source-Engines gut sind. Eine Inferenz-Engine beantwortet, ob Sie ein Modell auf einer GPU betreiben können. Sie war nie dafür gebaut, die Fragen zu beantworten, die darüber entscheiden, ob das System in den Produktivbetrieb darf. Um diese Fragen herum ist Xinity gebaut.

Wer darf das nutzen, und wer hat es freigegeben?

Rollenbasierte Zugriffskontrolle und SSO- oder LDAP-Integration. Der Zugriff folgt dem Identitätssystem, das Sie ohnehin betreiben, statt einem geteilten API-Schlüssel in einer Konfigurationsdatei.

Was wurde verarbeitet, von wem und wann?

Ein Audit-Protokoll bei jeder Inferenzanfrage, mit Filterung, Export und Einzelinstanz-Ansicht im Dashboard. Gebaut für die Person, die diese Frage Monate später beantworten muss.

Wer patcht das System, wenn eine Schwachstelle veröffentlicht wird?

Wir, und Sie entscheiden, wann eingespielt wird. Da das Deployment Ihnen gehört, laufen Updates durch Ihr eigenes Change Management und treffen nicht unangekündigt ein.

Wer haftet, wenn etwas ausfällt?

Ein Unternehmen in Wien mit unterschriebenem Vertrag, Auftragsverarbeitungsvertrag und schriftlichen Support-Zusagen. Selbst gebaute Infrastruktur hat keine Gegenpartei.

Wer antwortet vor der Vorstandsdemo?

Benannter Support mit vereinbarten Reaktionszeiten, gestaffelt nach Tarif. Kein Community-Forum und nicht der Kollege, der es vor zwei Jahren aufgesetzt hat.

Was zeigen wir der Revision konkret?

Das Deployment selbst. Es läuft auf Ihren Servern, der Kern ist Open Source, damit Ihr Security-Team den Code liest statt einer Beschreibung zu vertrauen, und die Nachweise liegen auf Ihrer Seite.

Heute im Produktivbetrieb

Wir haben jede Option geprüft. Nur architektonische Souveränität liefert, was journalistischer Quellenschutz und die Integrität öffentlicher Informationsplattformen wirklich verlangen: eine Infrastruktur, auf die niemand anderer zugreifen kann.
Martin Mair
CIO und Vorstandsmitglied, Mediengruppe Wiener Zeitung
Confare CIO of the Year 2026
97 %
geringere Kosten pro Anfrage
MeinDienstplan, nach der Verlagerung der Inferenz ins Haus

Die Kosten pro Anfrage sanken von 2,00 EUR auf 0,06 EUR. Wer die Inferenz besitzt, hat keinen Token-Zähler mehr. Die Kosten pro Anfrage sinken mit steigender interner Nutzung, statt mit ihr zu wachsen.

Finden Sie Ihre Branche

Jede Seite benennt die konkret geltende Regulierung und wie ein Deployment in dieser Branche aussieht.

Nicht in der Liste? Buchen Sie eine Demo und wir klären, ob ein On-Premise-Deployment zu Ihrer Situation passt.

Häufige Fragen

Für manche Teams ist das die richtige Antwort, und wir sagen das öffentlich. vLLM ist ausgezeichnete Inferenz-Software. Was sie nicht mitbringt: Zugriffskontrolle, ein Audit-Protokoll, das eine Revision akzeptiert, einen Patch-Prozess, einen Auftragsverarbeitungsvertrag oder eine Gegenpartei, die für die Software haftet. Die realistische Alternative zum Kauf einer Plattform ist nicht vLLM allein, sondern vLLM plus die Schicht, die Sie darum herum bauen und betreiben.

Die ehrliche Fassung lesen, inklusive der Fälle, in denen Sie nicht bei uns kaufen sollten