Souveräne AI-Infrastruktur,
einsatzbereit in Stunden.
Xinity betreibt validierte Open-Weight-Modelle auf Ihrer eigenen Hardware und liefert die Steuerungsebene darum herum: rollenbasierte Zugriffskontrolle, Single Sign-On und ein Audit-Protokoll pro Anfrage. Die API ist OpenAI-kompatibel, Ihre bestehenden Anwendungen müssen also nicht umgeschrieben werden.
Was passiert, wenn Sie die Kontrolle über Ihre AI verlieren?
Die meisten Unternehmen haben AI über Public APIs eingeführt, bevor sie verstanden, was das für Souveränität, Compliance und Kosten bedeutet. Das sind die tatsächlichen Kosten.
US-Server-Abhängigkeit
Ihre Daten liegen auf US-Servern, unterliegen dem CLOUD Act und sind außerhalb der EU-Jurisdiktion.
DSGVO- & AI-Act-Risiko
Bußgelder bis zu 4% des weltweiten Jahresumsatzes nach DSGVO und 7% nach dem AI Act. Public-API-LLMs verlagern Compliance weitgehend aus Ihrer Kontrolle.
Kein Audit-Trail
Sie können Regulierungsbehörden nicht nachweisen, welche Daten wohin gesendet wurden oder welches Modell welche Ausgabe erzeugt hat.
Unvorhersehbare Kosten
Per-Token-Preise werden bei Skalierung untragbar und sprengen jedes Jahresbudget.
Die Engine antwortet Ihren Entwicklern. Die Platform antwortet Ihrer Revision.
Jedes AI-Deployment in einer regulierten Organisation muss zwei Prüfungen bestehen. Können wir Modelle auf eigener Hardware betreiben? Und dürfen wir das in Produktion bringen? Xinity ist als zwei Schichten gebaut, weil das zwei verschiedene Fragen sind, gestellt von zwei verschiedenen Personen.
Xinity Engine
Der Open-Source-Kern, für immer kostenlos. Ersetzen Sie Public-LLM-APIs durch einen souveränen Endpunkt, indem Sie Ihre Anwendungen auf eine neue Basis-URL mit einem neuen API-Schlüssel richten.
- OpenAI-kompatible API. Drop-in-Ersatz.
- Multi-Modell-Routing über lokale GPUs.
- Eigene Modelle einbinden, Open Source oder proprietär.
- Per-Request-Observability und Audit-Log.
- Self-Hosting auf Laptop, Server oder Cluster.
Xinity Platform
Die Enterprise-Schicht: alles, was Ihr CISO, Ihr Betriebsrat und Ihre Revision brauchen, um zustimmen zu können. Ein haftender Anbieter, geregelter Zugriff und Nachweise auf Abruf.
- On-Prem-Deployment. Ihre Hardware. Ihr Gebäude.
- Vollständiges Audit-Protokoll bei jeder Inferenzanfrage.
- Rollenbasierte Zugriffskontrolle und SSO.
- Hardware-Sizing, Installation und Lifecycle-Support.
Von Public API zu souveräner AI, in Stunden.
Planung
Wir erfassen Ihre Use Cases, Datenresidenz-Anforderungen und Hardware in einer 30-Minuten-Session. Sie verlassen das Gespräch mit einem konkreten Deployment-Plan.
Deployment
Engine und Platform werden zusammen geliefert. Wir installieren die Hardware in Ihrer Einrichtung oder leiten Ihr Team an. Richten Sie Ihre Anwendungen auf den OpenAI-kompatiblen Endpunkt und starten Sie das erste Modell. In Stunden, nicht Monaten.
Betrieb
Routen Sie über Modelle, überwachen Sie jede Anfrage, weisen Sie Compliance nach und skalieren Sie Kapazität, ohne das öffentliche Internet zu berühren.
Wir sind nicht hier, um zu experimentieren. Wir sind hier, um zu liefern.
Sechs Gründe, warum europäische Unternehmen Xinity gegenüber Public APIs und US-Plattformen wählen.
Auf Ihrer Hardware, in Ihrem Gebäude
Keine Cloud, kein Hyperscaler, keine Daten verlassen Ihr Gebäude. Architektonische Souveränität ab Werk.
OpenAI-kompatibel, Drop-in
Richten Sie Ihre bestehenden Anwendungen auf eine neue Basis-URL mit einem neuen API-Schlüssel. Gleiches SDK, gleiche Prompts, souveräne Infrastruktur.
Deployed in Stunden, nicht Monaten
Engine, Platform und Hardware werden zusammen geliefert. Erstes Modell in Ihrer Umgebung in Stunden, nicht Monaten.
Audit-Trail ab Werk
Jede Anfrage, jedes Modell, jede Kostenposition. Geloggt und zugeordnet zu den EU-AI-Act-Artikeln, nach denen Ihr Auditor fragen wird.
100% europäisch, ausgerichtet durch Architektur
Durch die Architektur außerhalb der Reichweite des US CLOUD Act. Ausgerichtet an DSGVO, EU AI Act und NIS2-Kontrollen.
Planbare, kapazitätsbasierte Preise
Zahlen Sie für die GPUs, die Sie betreiben, nicht für jeden Token. Jahresbudgets, die Sie verteidigen können.
Alle Deployments unterstützen die Compliance für
Vertraut von Branchenführern
Wir haben Entwicklern die Schlüssel gegeben.
Xinity Engine ist live auf GitHub, Open Source und für immer kostenlos. Verbinden Sie sie mit Ihrem bestehenden AI-Setup und behalten Sie jede Anfrage auf Ihrer eigenen Infrastruktur. Wenn Sie bereit für Enterprise sind, ist die Platform-Schicht da.
Ihr Zeitfenster für Compliance schließt sich.
Die Transparenzpflichten nach Artikel 50 gelten seit dem 2. August 2026, die AI-Kompetenzpflicht nach Artikel 4 seit Februar 2025. Die Hochrisiko-Anforderungen treten vollständig in Kraft am 2. Dezember 2027. Deployen Sie jetzt in Ihrem eigenen Tempo, nicht unter dem Druck einer Regulierungsbehörde.
Häufig gestellte Fragen
Sovereign AI bedeutet generative AI-Infrastruktur, die vollständig unter Ihrer rechtlichen und physischen Kontrolle läuft. Auf Ihrer Hardware. In Ihrer Jurisdiktion. Ohne dass Daten Ihr Gebäude verlassen. Es ist die architektonische Antwort auf DSGVO, EU AI Act und den US CLOUD Act.
Mehr über Sovereign AI erfahrenSouveräne AI-Infrastruktur ist der vollständige Hardware- und Software-Stack, mit dem Sie AI-Workloads betreiben, ohne für Zugriff, Verfügbarkeit oder Datenhoheit von Dritten abhängig zu sein. Bei Xinity bedeutet das: Ihre eigenen GPUs, eine Inferenz-Engine unter Ihrer Kontrolle und eine Enterprise-Schicht für Compliance, alles in Ihrem eigenen Netzwerk. Nichts Kritisches liegt hinter dem Login oder den Nutzungsbedingungen eines anderen.
Eine Inferenz-Engine ist die Software, die ein großes Sprachmodell lädt und dessen Antworten an Ihre Anwendungen ausliefert. On-Premise bedeutet, dass sie auf Hardware läuft, die Sie besitzen und kontrollieren, statt in der Cloud eines Anbieters. Xinity Engine ist genau das: Sie lädt offene oder proprietäre Modelle auf Ihren lokalen GPUs und stellt sie über eine Standard-API bereit, sodass Prompts und Ausgaben Ihre Umgebung nie verlassen.
Es bedeutet, dass die Engine dieselbe API-Sprache spricht wie OpenAI. Anwendungen, die bereits mit dem OpenAI-SDK gebaut wurden, lassen sich auf Ihren selbst gehosteten Endpunkt umstellen, indem Sie die Basis-URL und den API-Schlüssel ändern, ohne Code oder Prompts neu zu schreiben. Xinity Engine implementiert diese OpenAI-kompatible Schnittstelle, sodass der Wechsel von einer Public API zu souveräner Infrastruktur eine Konfigurationsänderung ist, kein Entwicklungsprojekt.
Cloud-AI sendet Ihre Prompts und Daten an die Server eines Anbieters, oft außerhalb der EU, wo Sie auf dessen Sicherheit, Verfügbarkeit und Bedingungen angewiesen sind. On-Premise-AI betreibt dieselben Modelle auf Hardware in Ihrer eigenen Einrichtung, sodass Daten Ihr Haus nie verlassen und Sie volle Hoheit und Audit-Transparenz behalten. Der Nachteil war früher der Einrichtungsaufwand; Xinity nimmt den größten Teil davon ab, indem Engine, Platform und Hardware zusammen geliefert werden.
Regulierte Organisationen suchen in der Regel nach einer selbst gehosteten Engine, einer Compliance- und Audit-Schicht und einem klaren Migrationspfad weg von Public APIs. Xinity deckt alle drei in einem Stack ab: eine Open-Source-Engine mit OpenAI-kompatibler API, eine Enterprise-Plattform mit Audit-Trails, die EU-AI-Act-Artikeln zugeordnet sind, und On-Prem-Deployment auf Ihrer eigenen Hardware. Es ist gebaut für Finanzwesen, Gesundheit, öffentlichen Sektor und Medien, wo Datenresidenz und Auditierbarkeit nicht optional sind.
Indem sie die Modelle auf Infrastruktur in der eigenen Jurisdiktion betreiben, statt eine in den USA gehostete API aufzurufen. Xinity deployt offene oder proprietäre Modelle auf Hardware in Ihrem Gebäude, sodass jeder Prompt und jede Antwort in Ihrem Netzwerk und außerhalb der Reichweite des US CLOUD Act bleibt. Es gibt keinen transatlantischen Transfer zu dokumentieren, weil es gar keinen Transfer gibt.
Der größte Kostenhebel ist der Wechsel von Per-Token-Preisen zu kapazitätsbasierten Preisen, sobald Ihr Volumen planbar ist. Self-Hosting auf passend dimensionierten GPUs bedeutet, dass Sie für die betriebene Hardware zahlen statt für jede Anfrage. Ein Xinity-Kunde senkte die Kosten pro Anfrage von 2,00 € auf 0,06 €, eine Reduktion um 97%, nachdem die Inferenz on-prem verlagert wurde. Der Break-even hängt vom Volumen ab, das wir vor jeder Verpflichtung gemeinsam mit Ihnen dimensionieren.
Die OpenAI-API ist schnell startklar, sendet Ihre Daten aber an in den USA gehostete Server und rechnet pro Token ab. Xinity bietet dieselbe OpenAI-kompatible Schnittstelle, hält die Daten aber auf Ihrer eigenen Hardware, ergänzt einen vollständigen Audit-Trail und ersetzt die Per-Token-Abrechnung durch kapazitätsbasierte Preise. Sie tauschen ein wenig anfänglichen Aufwand gegen Souveränität, Compliance und planbare Kosten. Bestehende OpenAI-Integrationen wechseln durch Änderung von Endpunkt und Schlüssel.
Xinity ist darauf ausgelegt, die EU-AI-Act-Compliance zu unterstützen. Jede Anfrage wird mit einem vollständigen Audit-Trail geloggt, der den relevanten Artikeln zugeordnet ist, also genau dem Nachweis, den Regulierungsbehörden und Auditoren bei Hochrisiko-Systemen verlangen. Einige Pflichten gelten bereits: die Transparenzpflichten nach Artikel 50 seit dem 2. August 2026 und die AI-Kompetenzpflicht nach Artikel 4 seit Februar 2025. Die Hochrisiko-Pflichten für eigenständige Systeme folgen am 2. Dezember 2027, sodass Xinity es Ihnen ermöglicht, die technischen Kontrollen heute einzurichten, statt unter Zeitdruck. Xinity stellt die Infrastruktur bereit; die Klassifizierung Ihres konkreten Use Case bleibt Ihre Verantwortung.
Die DSGVO ist deutlich leichter zu erfüllen, wenn personenbezogene Daten Ihre Kontrolle nie verlassen. On-Premise-AI hält Prompts und Ausgaben in Ihrem eigenen Netzwerk und beseitigt den transatlantischen Datentransfer, den Public APIs erzeugen und der schwer zu legitimieren ist. Mit Xinity wird jede Anfrage geloggt, der Zugriff ist rollenbasiert, und es gibt keinen Drittverarbeiter, der Ihre Daten handhabt, was Ihr Verarbeitungsverzeichnis und Ihre DSFA vereinfacht.
Ja, sofern Daten und Verarbeitung innerhalb der erforderlichen Jurisdiktion bleiben. Der zuverlässige Weg, das zu garantieren, ist, die Modelle auf Infrastruktur zu betreiben, die Sie innerhalb der EU physisch kontrollieren. Xinity deployt auf Ihrer eigenen Hardware an Ihrem eigenen Standort, sodass Datenresidenz per Design erfüllt wird statt durch ein vertragliches Versprechen eines Cloud-Anbieters.
Er führt Pflichten ein, die mit dem Risiko skalieren. Viele geschäftliche Nutzungen von LLMs fallen bereits unter die Transparenzpflichten nach Artikel 50, die seit dem 2. August 2026 gelten, und jede Organisation, die AI einsetzt, unterliegt seit Februar 2025 der AI-Kompetenzpflicht nach Artikel 4. Nutzungen in Bereichen wie Einstellung, Kredit oder kritischer Infrastruktur können als hochriskant eingestuft werden, mit Anforderungen an Risikomanagement, Datengovernance, menschliche Aufsicht und Aufzeichnung; diese Pflichten gelten für eigenständige Systeme ab dem 2. Dezember 2027. LLMs auf Infrastruktur zu betreiben, die Sie kontrollieren, macht die Anforderungen an Logging, Audit-Trail und Aufsicht deutlich leichter erfüllbar.
Das hängt von den Modellen und dem benötigten Durchsatz ab. Die Engine allein läuft für Entwicklung und kleinere Workloads auf einer einzelnen Workstation-GPU. Produktions-Deployments nutzen eine oder mehrere Server-GPUs, und wir dimensionieren die genaue Konfiguration während der Planung mit Ihnen. Xinity kann auch validierte Hardware liefern, etwa die ASUS Ascent GX10, sodass Sie nichts selbst spezifizieren müssen.
Xinity Engine ist Open Source, für immer kostenlos und auf GitHub verfügbar. Die Platform-Schicht, die Enterprise-Deployment, Hardware-Bereitstellung, Compliance-Tooling und Support ergänzt, ist das kommerzielle Produkt. Sie können souveräne Inferenz heute auf der Open-Source-Engine betreiben und die Platform ergänzen, wenn Sie die Enterprise-Funktionen benötigen.
Open-Weight-Modelle wie Qwen, Mistral, Llama und Gemma, Ihre eigenen Fine-Tunes sowie proprietäre Modelle, für die Sie die Nutzungsrechte haben. Xinity routet automatisch zwischen mehreren Modellen basierend auf Ihren Richtlinien, sodass Sie jede Anfrage dem richtigen Modell für Kosten, Qualität oder Sensibilität zuordnen können, ohne Ihre Anwendungen zu ändern.
Der technische Aufwand für den Wechsel ist gering, weil die OpenAI-kompatible API bedeutet, dass bestehende Integrationen durch Ändern von Endpunkt und Schlüssel wechseln, nicht durch Neuschreiben von Code. Die Infrastrukturkosten hängen von der benötigten Hardware ab, die wir während der Planung an Ihrem Volumen dimensionieren. Viele Organisationen erreichen schnell den Break-even: Ein Kunde senkte die Kosten pro Anfrage um 97% nach dem Wechsel on-prem. Wir erstellen das vollständige Bild gemeinsam mit Ihnen vor jeder Verpflichtung.
Die Engine allein läuft in Minuten auf bestehender Hardware. Ein vollständiges Platform-Deployment mit On-Prem-GPUs dauert in der Regel Stunden, nicht die Monate herkömmlicher Enterprise-Infrastrukturprojekte, weil Engine, Platform und Hardware darauf ausgelegt sind, zusammen geliefert und installiert zu werden.
Nein. Xinity ist Software, die Sie auf Ihrer eigenen Hardware deployen. Wir hosten Ihre Daten nicht; wir bringen AI zu ihnen. Sie behalten Eigentum, Kontrolle und physische Hoheit über jedes Byte.
Ihnen. Immer. Xinity ist Software, die Sie betreiben; Ihnen gehören die Modelle, die Daten, die Logs und die Infrastruktur.
Die Engine ist Open Source. Sie behalten sie für immer. Die Platform läuft auf Ihrer Hardware ohne externe Abhängigkeiten. Im schlimmsten Fall arbeiten Sie genau so weiter wie heute.
Noch eine Frage? Kontaktieren Sie uns.






