Sicherheit auf Unternehmensebene: ISO 27001 + SOC 2 Typ I konform.

Link to this sectionDeployment#

Die Ultralytics Platform bietet umfassende Modell-Deployment-Optionen, um deine YOLO-Modelle in die Produktion zu bringen. Teste Modelle mit browserbasierter Inferenz, deploye sie auf dedizierten Endpunkten in 42 globalen Regionen und überwache die Leistung in Echtzeit.



Watch: Get Started with Ultralytics Platform - Deploy

Link to this sectionÜbersicht#

Der Bereich Deployment hilft dir:

  • Modelle direkt im Browser über den Predict Tab zu testen
  • Bereitstellung auf dedizierten Endpunkten in 42 globalen Regionen
  • Anfragemetriken, Logs und Gesundheitschecks zu überwachen
  • Bei Leerlauf auf null zu skalieren (Bereitstellungen führen derzeit eine einzelne aktive Instanz aus)

Ultralytics Platform Deploy Page World Map With Overview Cards

Link to this sectionBereitstellungsoptionen#

Die Ultralytics Platform bietet mehrere Bereitstellungswege:

OptionBeschreibungAm besten für
Predict TabBrowserbasierte Inferenz mit Bild, Webcam und BeispielenEntwicklung, Validierung
Shared InferenceMulti-Tenant-Service in 3 RegionenGeringe Nutzung, Tests
Dedicated EndpointsSingle-Tenant-Dienste in 42 RegionenProduktion, niedrige Latenz

Link to this sectionWorkflow#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
PhaseBeschreibung
TestenModell validieren mit dem Predict tab
KonfigurierenWähle eine Region aus und überprüfe den bearbeitbaren, automatisch generierten Bereitstellungsnamen
BereitstellenDedizierten Endpunkt über den Deploy tab erstellen
ÜberwachenAnfragen, Latenz, Fehler und Logs in Monitoring nachverfolgen

Link to this sectionArchitektur#

Link to this sectionShared Inference#

Der Shared Inference Service läuft in 3 Hauptregionen und leitet Anfragen automatisch basierend auf deiner Datenregion weiter:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Region Router}:::decide
    Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegionBezeichnungStandortAm besten für
USAmerikaIowa, USANutzer aus Amerika, am schnellsten für Amerika
EUEuropa, Naher Osten & AfrikaBelgien, EuropaEuropäische Nutzer, DSGVO-konform
APAsien-PazifikTaiwan, Asien-PazifikNutzer im asiatisch-pazifischen Raum, geringste APAC-Latenz

Link to this sectionDedicated Endpoints#

Bereitstellung in 42 Regionen weltweit über Ultralytics Cloud:

  • Amerika: 14 Regionen
  • Europa: 13 Regionen
  • Asien-Pazifik: 12 Regionen
  • Naher Osten & Afrika: 3 Regionen

Jeder Endpunkt ist ein Single-Tenant-Service mit:

  • Standardressourcen von 1 CPU, 2 GiB Arbeitsspeicher, minInstances=0, maxInstances=1
  • Skalierung auf null bei Leerlauf
  • Eindeutiger Endpunkt-URL
  • Unabhängiges Monitoring, Logs und Gesundheitschecks

Link to this sectionSeite Bereitstellungen#

Rufe die globale Bereitstellungsseite über die Seitenleiste unter Deploy auf. Diese Seite zeigt:

  • Weltkarte mit Pins der bereitgestellten Regionen (interaktive Karte)
  • Übersichtskarten: Gesamtanfragen (24h), aktive Bereitstellungen, Fehlerrate (24h), P95-Latenz (24h)
  • Bereitstellungsliste mit drei Ansichtsmodi: Karten, kompakt und Tabelle
  • Neue Bereitstellung Schaltfläche, um Endpunkte aus jedem abgeschlossenen Modell zu erstellen

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Automatisches Polling

Die Seite fragt normalerweise alle 15 Sekunden ab. Wenn sich Bereitstellungen in einem Übergangszustand befinden (creating, deploying oder stopping), erhöht sich das Polling für schnelleres Feedback auf alle 3 Sekunden.

Link to this sectionHauptfunktionen#

Link to this sectionGlobale Abdeckung#

Stelle deine Modelle in der Nähe deiner Nutzer in 42 Regionen bereit, die Folgendes abdecken:

  • Nordamerika, Südamerika
  • Europa, Naher Osten, Afrika
  • Asien-Pazifik, Ozeanien

Link to this sectionSkalierungsverhalten#

Endpunkte verhalten sich derzeit wie folgt:

  • Auf Null skalieren: minInstances ist standardmäßig auf 0 gesetzt
  • Einzelne aktive Instanz: maxInstances ist derzeit in allen Plänen auf 1 begrenzt

Link to this sectionRegionale Bereitstellung#

Nutze die gemessene Latenz der Region, um einen Endpunkt in der Nähe seiner Aufrufer zu platzieren. Die tatsächliche Inferenzlatenz hängt vom Modell, der Eingabegröße, dem Endpunktstatus und dem Netzwerkpfad ab.

Link to this sectionGesundheitschecks#

Jede laufende Bereitstellung enthält einen automatischen Gesundheitscheck mit:

  • Live-Statusanzeige (gesund/ungesund)
  • Anzeige der Antwortlatenz
  • Automatischer erneuter Versuch bei Ungesundheit (Abfrage alle 20 Sekunden)
  • Schaltfläche für manuelle Aktualisierung

Link to this sectionKurzanleitung#

Erstelle eine Bereitstellung:

  1. Trainiere ein Modell oder lade es in ein Projekt hoch
  2. Gehe zum Deploy Tab des Modells
  3. Wähle eine Region aus der Latenztabelle aus
  4. Klicke auf Deploy und warte, bis der Bereitstellungsstatus Ready anzeigt
Schnellbereitstellung
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Sobald die Bereitstellung abgeschlossen ist, verwende die Endpunkt-URL mit deinem API-Schlüssel, um Inferenzanfragen von jeder Anwendung aus zu senden.

Link to this sectionSchnellzugriff#

Link to this sectionFAQ#

Link to this sectionWas ist der Unterschied zwischen Shared und Dedicated Inference?#

FunktionSharedDedicated
DienstWird von Platform-Benutzern gemeinsam genutztDediziert für eine Bereitstellung
SkalierungVerwaltet von PlatformSkalierung auf Null, eine Instanz
Regionen3 DatenregionenWähle aus 42 Bereitstellungsregionen
URLPlatform-Modell-APIGenerierte Bereitstellungs-Endpunkt-URL
TestenModell-Registerkarte PredictRegisterkarte Predict der Bereitstellungskarte oder API

Link to this sectionWie lange dauert die Bereitstellung?#

Die Bereitstellung bleibt im Status „Erstellung“ oder „Bereitstellung“, während ihr Dienst startet. Sie wird verwendbar, wenn sich der Status in Ready ändert; die Dauer variiert je nach Modell und Region.

Link to this sectionKann ich mehrere Modelle bereitstellen?#

Ja, jedes Modell kann über mehrere Endpunkte in verschiedenen Regionen verfügen. Die Anzahl der Deployments ist je nach Plan begrenzt: Free 3, Pro 10, Enterprise unlimited.

Link to this sectionWas passiert, wenn ein Endpunkt im Leerlauf ist?#

Bei aktiviertem Scale-to-Zero:

  • Der Endpunkt wird nach Inaktivität heruntergefahren
  • Die erste Anfrage löst einen Kaltstart aus
  • Nachfolgende Anfragen erfolgen schnell

Erste Anfragen nach einer Leerlaufzeit lösen einen Kaltstart aus.

Kommentare