Zum Hauptinhalt springen
Bibha Startseite

Modellbereitstellung und Infrastruktur

Bringen Sie das Modell zum Einsatz. Verwalten Sie seine Betriebsgrundlage.

Stellen Sie ausgewählte Modelle bereit, führen Sie Verarbeitungsaufträge aus und verwalten Sie die Ressourcen Ihres KI-Systems. Bibha verbindet Inferenz, Rechenleistung und Bereitstellungskontrollen, von der Kapazitätsplanung bis zu Release-Änderungen und Wiederherstellung.

Was deckt Bibha bei Modelldiensten und Bereitstellung ab?

Bibha stellt ausgewählte Modelle für Anwendungen bereit und verwaltet die zugehörige Rechenleistung, GPU-Ressourcen und unterstützten Aufträge. Die Bereitstellungsfunktionen umfassen gehostete Umgebungen, Kunden-Clouds sowie lokale und gemischte Konfigurationen mit Kapazitätsverwaltung, Skalierung, Zustandsüberwachung, Rollout und Rollback, Sicherung und Wiederherstellung, Modell- oder Anbieterwechseln sowie Ressourcenbudgets. Der geprüfte Stack, die Ressourcen und Betriebsverantwortlichkeiten werden für die Arbeitslast festgelegt.

Machen Sie aus einem ausgewählten Modell einen betriebenen Dienst.

Inferenz bezeichnet den Schritt, in dem ein Modell eine Ausgabe erzeugt. Die Modellbereitstellung macht diese Funktion für die benötigte Anwendung verfügbar. Ein ausgewähltes Modell oder eine Version wechselt aus Entwicklung und Evaluierung in eine freigegebene Bereitstellungskonfiguration.

Das Modell ist ein Teil des betriebenen Systems. Auch seine Datenverbindungen, der Workflow, die Laufzeitumgebung und das Monitoring müssen zur Aufgabe passen. Planen Sie die Modellbereitstellung anhand der zu bearbeitenden Anfragen und des Ergebnisses, das die Anwendung benötigt.

KI-generierte Illustration

Stimmen Sie Ressourcen und Aufträge auf die Arbeitslast ab.

Stellen Sie die für unterstützte Arbeitslasten benötigte Rechenleistung und GPU-Ressourcen bereit oder binden Sie diese an. Die Auftragsausführung übernimmt Trainings- und andere Verarbeitungsaufgaben, die diese Ressourcen nutzen.

Definieren Sie vor der Kapazitätswahl die Arbeit: Modell, Verarbeitungsaufgabe, erwartetes Anfragemuster und Betriebsumgebung. So wird die Ressourcenzuweisung anhand der Arbeitslast entschieden und nicht allein aus der Modellgröße abgeleitet.

  • Rechenleistung und GPU-Ressourcen

    Nutzen Sie die für die Arbeitslast und ihre Betriebsanforderungen geprüften Ressourcen.

  • Auftragsausführung

    Führen Sie unterstützte Trainings- und Verarbeitungsaufträge als Teil des Modell- und Anwendungslebenszyklus aus.

  • Kapazität und Parallelität

    Definieren Sie anhand von Messungen, welches Arbeitsvolumen die konfigurierte Umgebung bewältigen kann.

Passen Sie die Kapazität innerhalb vereinbarter Grenzen an.

Skalierung und Ressourcenzuweisung passen die unterstützte Kapazität an eine veränderte Nachfrage an. Ressourcenbudgets und Kontingente geben Arbeitslasten definierte Verbrauchsgrenzen und machen Kosten sichtbar.

Kapazität, Parallelität und Antwortanforderungen sollten gemeinsam betrachtet werden. Die passende Ressourcenverteilung hängt von der Arbeitslast ab. Kein allgemeiner Durchsatz- oder Latenzwert beschreibt jedes System.

Platzieren Sie jede Komponente in der passenden Umgebung.

Betreiben Sie eine vereinbarte gehostete Umgebung, führen Sie den geprüften Stack in einer Kunden-Cloud aus oder nutzen Sie kundenseitig kontrollierte Einrichtungen oder lokale Infrastruktur. Gemischte Konfigurationen verteilen Komponenten auf freigegebene Umgebungen, wenn der Workflow diese Kombination benötigt.

Bilden Sie den vollständigen Weg ab: Wo läuft das Modell, wo werden Informationen verarbeitet, welche Geschäftssysteme erreicht es und wer betreibt jede Abhängigkeit? Eine Bereitstellungsbezeichnung allein beantwortet diese Fragen nicht.

  • Gehosteter Service

    Nutzen Sie eine vereinbarte Umgebung, die als Dienst betrieben wird.

  • Kunden-Cloud

    Führen Sie den geprüften Stack in Ihrem Cloud-Konto aus.

  • On-Premises oder lokal

    Nutzen Sie den geprüften Stack in kundenseitig kontrollierten Einrichtungen oder auf lokaler Infrastruktur.

  • Gemischte Konfigurationen

    Verteilen Sie Komponenten auf unterschiedliche freigegebene Umgebungen und definieren Sie deren Verbindungen und Verantwortlichkeiten.

Berücksichtigen Sie Release-Änderungen und Wiederherstellung im Entwurf.

Führen Sie eine freigegebene Konfiguration ein und stellen Sie bei Bedarf eine frühere wieder her. Zustandsüberwachung und Wiederherstellung erkennen fehlerhafte Komponenten und unterstützen die Wiederherstellung des vertraglich vereinbarten Dienstes.

Sicherung und Wiederherstellung schützen die vereinbarten Artefakte und umfassen Tests ihrer Wiederherstellung. Artefakte, Wiederherstellungsverfahren und Betriebsverantwortlichkeiten gehören neben dem regulären Release-Prozess zum Systemumfang.

  • Rollout und Rollback

    Führen Sie freigegebene Konfigurationen mit einem Weg zurück zu einer vorherigen Konfiguration ein, falls dies erforderlich wird.

  • Zustand und Wiederherstellung

    Erkennen Sie fehlerhafte Komponenten und führen Sie die vereinbarten Wiederherstellungsarbeiten durch.

  • Sicherung und Wiederherstellung

    Schützen Sie die vereinbarten Artefakte und testen Sie deren Wiederherstellung.

Halten Sie Modell- und Anbieterwechsel praktikabel.

Verlagern Sie Arbeitslasten auf kompatible Modelle oder Anbieter, sofern der Wechsel getestet wurde und die Lizenzen ihn zulassen. Die Modellwahl bleibt mit der Aufgabe, ihren Qualitätsanforderungen und Betriebsbedingungen verbunden.

Prüfen Sie die Kompatibilität, bevor Sie einen Wechsel als einfachen Austausch behandeln. Kontrollieren Sie die erwarteten Ein- und Ausgaben der Anwendung, evaluieren Sie den Ersatz und vereinbaren Sie seine Einführung.

Definieren Sie den Umfang des zu betreibenden Systems.

Bringen Sie die Arbeitslast, Umgebungsanforderungen und die Verantwortlichkeiten mit, die Ihr Team behalten möchte. Anschließend können wir Ressourcen, Bereitstellungskontrollen und das Betriebsmodell gemeinsam festlegen.

Entwickeln Sie gemeinsam mit unseren Ingenieuren oder vereinbaren Sie eine betreute Umsetzung und einen betreuten Betrieb. Zusagen zu Kapazität, Unterstützung und Wiederherstellung werden für die Zusammenarbeit festgelegt.

Fragen und Antworten

Beides beantwortet unterschiedliche Fragen. Die Modellbereitstellung macht ein ausgewähltes Modell für Anwendungsanfragen verfügbar. Die Bereitstellungsumgebung bestimmt, wo das Modell und andere Systemkomponenten laufen, womit sie verbunden sind und wer sie betreibt.

Rollout und Rollback unterstützen die Einführung einer freigegebenen Konfiguration und bei Bedarf die Wiederherstellung einer früheren. Die unterstützte Konfiguration, die Artefakte und das Wiederherstellungsverfahren werden für das System definiert. Ein Rollback ist keine Zusage, dass jede externe geschäftliche Aktion rückgängig gemacht werden kann.

Modell- und Anbieterwechsel werden unterstützt, wenn der Ersatz kompatibel, getestet und nach den geltenden Lizenzen zulässig ist. Evaluieren Sie den Wechsel anhand der Anwendungsanforderungen und vereinbaren Sie seine Freigabe.

Kapazität, Parallelität und Antwortanforderungen werden für die Arbeitslast geplant und gemessen. Sie hängen von Modell, Ressourcen, Verarbeitungsweg und Nachfrage ab. Die Zusammenarbeit legt die Konfiguration und mögliche Servicezusagen fest.