Kubermatic Branding-Element

Kubermatic AI

Beenden Sie nicht genutzte GPUs. Stellen Sie KI-Modelle sicher für alle Teams bereit.

Eine einheitliche KI-Plattform für Unternehmen, Neoclouds und Anbieter souveräner KI.

Stellen Sie das Modell einmal bereit. Nicht fünfmal.

Die GPU-Auslastung in Unternehmen kann bei nur 5 % liegen, was bedeutet, dass bis zu 95 % der teuren GPU-Kapazität ungenutzt bleibt.

Die übliche Vorgehensweise, um fünf Teams dasselbe Modell bereitzustellen, besteht aus fünf Bereitstellungen und fünf reservierten GPU-Pools, von denen der größte Teil ungenutzt bleibt.

Kubermatic AI führt den Vorgang einmal durch und stellt die Ergebnisse zur Verfügung, wobei jedes Team durch einen eigenen Schlüssel und ein eigenes Kontingent abgeschirmt ist.

Jede teure GPU, die tatsächlich genutzt wird

Ohne Kubermatic AI

  • Ein Modell pro Team, das separat bereitgestellt und ausgeführt wird
  • GPUs, die die meiste Zeit ungenutzt sind
  • Der Spike einer Mannschaft bringt die andere zum Verhungern
  • An die Roadmap eines einzigen Anbieters gebunden
  • Jeder neue Agent benötigt eine eigene Integration

Mit Kubermatic AI

  • Ein Modell, das sicher von allen Teams gemeinsam genutzt wird
  • GPUs machen ihre Kosten wieder wett und stehen nicht ungenutzt herum
  • Quoten, damit keine Mannschaft eine andere aushungert
  • Auf offenen Standards basierend
  • Lässt sich über MCP mit Ihren bestehenden KI-Agenten verbinden

Alles, was Sie über Kubermatic AI wissen müssen

Die Verwaltung der KI-Infrastruktur ist schwierig. GPUs, Modelle, Teams und Zugriffsregeln müssen alle miteinander harmonieren, und die meisten Unternehmen müssen das letztendlich manuell zusammenfügen.

Eine Kubernetes-native KI-Plattform, die eine fragmentierte GPU-Infrastruktur in gemeinsam nutzbare KI-Dienste für On-Premise-, Cloud- und souveräne Umgebungen verwandelt.

Es bietet eine gemeinsame Plattform, auf der Infrastruktur- und Plattformteams Cluster, GPUs, Modelle, Netzwerk, Sicherheit und Richtlinien zentral verwalten, während Entwickler KI über Self-Service-Schnittstellen und APIs nutzen. Kubermatic AI vereint Kubernetes-Flottenmanagement, den Betrieb von KI-Modellen, GPU-Orchestrierung, Netzwerk und Sicherheit in einer einzigen Plattform.

  • LLMs als Dienstleistung bereitstellen
  • Ein Modell einmal bereitstellen und sicher teamübergreifend freigeben
  • Maximierung der GPU-Auslastung durch Multi-Tenancy im Unternehmensbereich
  • KI-Infrastruktur zentral verwalten
  • Unterstützung von KI-Workloads in jeder Infrastruktur
Eine Roboterhand, die nach einer Tastatur greift, überlagert mit dem Kubermatic-AI-Logo

Wesentliche Merkmale

LLMs als Dienstleistung

Veröffentlichen Sie ein Modell einmalig als verwalteten Dienst. Jedes Team greift über eine sichere API darauf zu.

Optimierte GPU-Auslastung

Nutzen Sie die GPU-Kapazität, über die Sie bereits verfügen, anstatt neue zu kaufen, die dann ungenutzt bleiben.

Gemeinsam genutzte Modelle durch Multi-Tenancy

Jeder Mandant greift auf dieselbe Bereitstellung zu, verfügt jedoch über einen isolierten Zugriff und eine eigene Quote.

Fortgeschrittene KI-Netzwerktechnik

Leiten Sie den Datenverkehr entsprechend der tatsächlichen GPU-Auslastung und den Anforderungen an die Inferenz weiter.

Passt zu dem, was Sie bereits haben

Dank der integrierten MCP-Unterstützung lassen sich Ihre bestehenden KI-Agenten und -Tools direkt anbinden.

Keine Vertragsbindung

Jede Ebene ist Open Source und läuft mit Standard-Kubernetes-Tools – in jeder Cloud oder auf Ihrer eigenen Hardware.

Umfassende Prüfung

Integrierte Transparenz und Compliance-Unterstützung für Rahmenwerke wie SOC 2 und PCI-DSS.

Häufig gestellte Fragen

Wie kann ich die GPU-Auslastung verbessern?

Der wichtigste Hebel ist die Vermeidung doppelter Modellbereitstellungen. Die meisten Unternehmen reservieren für jedes Team, das ein Modell benötigt, dedizierte GPU-Kapazitäten, obwohl dieses Modell die meiste Zeit ungenutzt bleibt. Die gemeinsame Nutzung einer einzigen Bereitstellung durch mehrere Teams – mit Kontingenten und isoliertem Zugriff pro Mandant – kann die Auslastung erheblich verbessern, ohne dass zusätzliche Hardware erforderlich ist. Kubermatic AI ermöglicht diesen Ansatz durch sichere KI-Mandantenfähigkeit.

Warum ist die GPU-Auslastung in Unternehmen so gering?

Laut VentureBeat kann die GPU-Auslastung in Unternehmen bei nur 5 % liegen, da Teams häufig eine separate Kopie eines Modells bereitstellen, um die Isolation gegenüber anderen Teams zu gewährleisten. Jede Bereitstellung reserviert Speicher und Rechenleistung, unabhängig davon, ob sie aktiv Anfragen bearbeitet oder nicht, sodass die GPUs zwischen den Spitzenauslastungen ungenutzt bleiben, während andere Teams auf Kapazitäten warten. Kubermatic AI hilft dabei, dieses Problem zu lösen, indem es Teams ermöglicht, Modellbereitstellungen sicher gemeinsam zu nutzen.

Was versteht man unter KI-Multi-Tenancy?

Bei der KI-Multi-Tenancy handelt es sich um eine Architektur, bei der sich mehrere Teams, Kunden oder Geschäftsbereiche dieselbe zugrunde liegende Modellbereitstellung teilen, dabei jedoch vollständig voneinander isoliert bleiben und jeweils über eigene API-Schlüssel, Kontingente, Budgets und Richtlinien verfügen. Dies ist die Alternative zur Bereitstellung einer separaten Kopie eines Modells für jeden Mandanten. Kubermatic AI stellt die Plattformebene für diesen Ansatz der gemeinsamen Modellnutzung bereit.

Wie lassen sich die Kosten für die GPU-Infrastruktur senken?

Der schnellste Weg, die GPU-Kosten zu senken, besteht darin, keine Kosten mehr für doppelte Infrastruktur zu verursachen. Anstatt für die Modellbereitstellung jedes Teams einen separaten GPU-Pool zu reservieren, sollten Sie eine gemeinsame Bereitstellung mit teambezogenen Kontingenten betreiben, damit die Hardware Anfragen bedient, anstatt hinter separaten Bereitstellungen ungenutzt zu bleiben. Kubermatic AI hilft Unternehmen dabei, diese Workloads zu konsolidieren und mehr Nutzen aus der vorhandenen GPU-Kapazität zu ziehen.

Was ist Kubermatic AI?

Kubermatic AI ist eine Kubernetes-native Plattform, die Unternehmen dabei unterstützt, ihre KI-Infrastruktur effizienter zu betreiben. Es handelt sich um eine Plattformschicht, die auf den bereits von Ihnen betriebenen GPUs und Clustern aufsetzt und es Teams ermöglicht, ein Modell einmalig bereitzustellen und sicher gemeinsam zu nutzen, anstatt es für jedes Team separat zu duplizieren.

Auf welcher Infrastruktur läuft Kubermatic AI?

Kubermatic AI läuft auf den GPUs und Kubernetes-Clustern, die Sie bereits betreiben – vor Ort, am Netzwerkrand, in Hybridumgebungen oder über Cloud- und souveräne Umgebungen hinweg. Es basiert auf Open-Source-Komponenten wie KKP, KDP, KubeOne und KubeLB und lässt sich daher nahtlos in die von Ihnen bereits verwaltete Infrastruktur integrieren, anstatt diese zu ersetzen.