Die Plattform

Xinity Runtime

dashboard.xinity.ai
Xinity Dashboard
01
Integration

Verbindet sich mit den Anwendungen, die Sie bereits betreiben

Xinity Runtime stellt eine OpenAI-kompatible API in Ihrem lokalen Netzwerk bereit. Ihre Anwendungen behalten SDKs, Prompts und Anfrageformate. Es ändern sich die Basis-URL und der API-Schlüssel.

OpenAI-kompatibler Endpunkt in Ihrem Netzwerk
Streaming, JSON-Modus und Function Calling unverändert
Keine neuen Tools, kein Retraining der Teams
02
Deployment

Modelle deployen, ohne zu raten

Wählen Sie aus validierten Open-Weight-Modellen mit Lizenzbedingungen und Release-Daten auf einen Blick. Bevor etwas läuft, zeigt das Dashboard, was Ihre Hardware trägt.

Treiber, unterstützte Features und VRAM pro Node
Kapazitäts- und Durchsatzschätzung vor dem Deployment
Benannter Grund, wenn ein Modell nicht deploybar ist
03
Kontrolle

Eine Steuerungsebene für jede AI-Anfrage

Der Zugriff folgt Ihrem Identitätssystem, jede Inferenzanfrage landet im Audit-Protokoll, und Nutzung und Kosten sind über die gesamte Flotte sichtbar.

Rollenbasierter Zugriff mit SSO oder LDAP
Audit-Protokoll mit Filterung und Export
Prometheus-kompatible Metriken für Ihr Monitoring

Schlüsselvorteile

Warum Xinity AI wählen?

Souveränität

Datensouveränität

Die Inferenz läuft auf Hardware, die Ihnen gehört. Es gibt keinen externen API-Aufruf im Pfad, also bleiben Prompts, Dokumente und Ausgaben in Ihrem Netzwerk.

Enterprise

Enterprise-ready

Rollenbasierter Zugriff über SSO oder LDAP, Multi-Node-Betrieb und Metriken für Prometheus und Grafana. Gebaut, um von Ihrem Ops-Team betrieben zu werden.

Kosten

Planbare Kosten

Fixe Infrastrukturkosten statt eines Token-Zählers. Kapazitätsschätzungen pro Node zeigen, was ein Modell trägt, bevor Sie Hardware dafür binden.

Migration

Schnelle Migration

Eine neue Basis-URL und ein API-Schlüssel. SDKs, Prompts, Streaming und Function Calling bleiben unverändert, bestehende Anwendungen wechseln in Tagen.

Compliance

Regulatorische Kontrolle

Ein Audit-Protokoll bei jeder Inferenzanfrage, mit Filterung und Export für alle, die später Fragen beantworten müssen. Gebaut für DSGVO- und EU-AI-Act-Anforderungen.

Open Source

Open-Core-Fundament

Die Engine ist Open Source. Ihr Security-Team liest den Code, statt einer Beschreibung zu vertrauen, und Sie können starten, ohne mit uns zu sprechen.

Aktuelle Modelle

Validierte Modelle

NEU · ALLROUNDER
NEU

Qwen3.8 27B FP8

qwen3.8-27b-fp8

Die bisher leistungsfähigste Qwen-Generation. Coding, agentische Workflows, Dokumente sowie natives Bild- und Videoverständnis in einem dichten Modell.

LizenzApache 2.0
ArchitekturDense, 27B, Vision
Kontext262K Tokens
HuggingFaceQwen/Qwen3.8-27B-FP8
MoE ALLROUNDER

Qwen3.6 35B A3B

qwen3.6-35b-a3b-fp8

Chat, Dokumente, agentische Workflows, Coding. Sparse-MoE-Effizienz für gemischte Enterprise-Workloads.

LizenzApache 2.0
ArchitekturMoE, 35B gesamt / 3B aktiv
Kontext262K Tokens
HuggingFaceQwen/Qwen3.6-35B-A3B-FP8
HOHES VOLUMEN

Ministral 3 3B

ministral-3b

Klassifikation, Extraktion, Routing und Zusammenfassung in großer Menge. Bildeingabe für die Verarbeitung von Dokumenten und Scans.

LizenzApache 2.0
ArchitekturDense, 3B, Vision
Kontext262K Tokens
HuggingFacemistralai/Ministral-3-3B-Instruct-2512
RETRIEVAL

EmbeddingGemma

embedding-gemma

Mehrsprachige Dokument-Embeddings für vollständig lokales RAG. Kombinierbar mit jedem Generierungsmodell oben.

LizenzGemma Terms of Use
TypEmbedding-Modell
SpeicherbedarfCPU-fähig
HuggingFacegoogle/embeddinggemma-300m
IHR MODELL

Nicht auf der Liste?

Xinity betreibt jedes Open-Weight-Modell mit OpenAI-kompatiblem Serving-Pfad. Die Validierung für regulierte Umgebungen dauert Tage, nicht Monate.

Kontakt aufnehmen