[
Dedizierte Inferenz
]
Dedizierte GPUs in der EU,
für jedes offene Modell.
Qwen, Llama, Mistral oder Ihr eigenes Modell auf reservierten GPUs in der EU, hinter einem OpenAI-kompatiblen Endpoint. Kein geteilter Traffic, stabile Latenz, Abrechnung nach Kapazität statt pro Token. Ein eigenes Training brauchen Sie dafür nicht.
[
DEDIZIERTE INFERENZ
]
Vom offenen Modell zum eigenen Endpoint.
Sie wählen ein Modell, wir starten es auf reservierten GPUs in der EU und konfigurieren es auf Ihren Workload. Eine neuere Version oder ein eigenes Modell geht später hinter denselben Endpoint.
Deployments / Endpoints / qwen3-32b-prod
EU · Frankfurt
Dediziert
qwen3-32b-prod
Qwen3 32B
Live
Reservierte GPUs in Frankfurt, OpenAI-kompatibler Endpoint, Rollback jederzeit.
Modell wechseln
Latenz p50
240 ms
p99 610 ms im interaktiven Deployment
Durchsatz
1.400 Tok/s
über alle Replicas
Verfügbarkeit
99,95 %
letzte 30 Tage
Deployments
Deployment
Zweck
Auslastung
Prod
Interaktiv
62 %
Batch
Nachtlauf
88 %
Canary
A/B auf 5 %
11 %
Neue Modellversionen gehen hinter denselben Endpoint. Kippt eine Metrik im Canary, rollt das Deployment automatisch zurück.
Traces erfasst: 1,2 Mio. pro Woche
Zero Data Retention: aktiv
Traces exportieren
[
DEDIZIERTE INFERENZ
]
Auf Ihren Workload ausgelegt, nicht auf den Durchschnitt.
Ob offenes oder eigenes Modell: Es läuft auf reservierten GPUs in der EU, und jedes Deployment wird für ein Ziel aus Latenz und Durchsatz konfiguriert statt für einen Standardwert.
Serving-Konfiguration pro Workload.
Batch-Größe, Kontextlänge und Parallelität werden gegen Ihr Ziel aus Latenz und Durchsatz getunt. Interaktive Anwendungen und Batch-Jobs bekommen getrennte Deployments desselben Modells.
Autoscaling entlang Ihrer Nutzungskurve.
Kapazität folgt der Nachfrage, mit reservierten GPUs als Basis und definierten Grenzen nach oben und unten. Sie zahlen keine Spitzenlast, die nie eintritt.
Region und Isolation pro Deployment.
Die Region legen Sie beim Design fest. Single-Tenant und regionale Bindung für Anforderungen an Datenresidenz, Zero Data Retention auf Wunsch.
Verfügbarkeitsziele und Monitoring.
SLAs nach Ihren Produktanforderungen, mit Alerting auf Latenz, Fehlerrate und Sättigung, bevor Ihre Nutzer es merken.
[
NOCH ZU WENIG TRAFFIC?
]
Offene Modelle in der EU gibt es auch ohne eigene GPUs.
Solange sich reservierte Kapazität nicht lohnt, nutzen Sie Llama, Mistral oder Qwen über das Kontinent Gateway: europäische Provider, ein API-Key, Abrechnung pro Token. Wächst das Volumen, wechseln Sie auf dedizierte GPUs, über dieselbe OpenAI-kompatible API.
[
OPTIONAL: TRAINING
]
Aus Ihrem Traffic kann später Ihr eigenes Modell werden.
Kein Muss, aber eine Option: Wer ein offenes Modell dediziert betreibt, hat die Daten für ein spezialisiertes Modell schon in der Hand. Erfasst wird nur, was Sie freigeben.
Fragen zur dedizierten Inferenz
Welche Modelle kann ich dediziert betreiben?
Offene Modelle wie Qwen, Llama, Mistral oder DeepSeek, und ebenso ein Modell, das Sie selbst trainiert haben. Wir starten es auf reservierten GPUs in der EU, angesprochen wird es über eine OpenAI-kompatible API.
Muss ich ein Modell trainieren, um dedizierte Inferenz zu nutzen?
Wie wird ein Deployment auf meinen Workload konfiguriert?
Zahle ich pro Token oder pro GPU?
Wann lohnt sich dediziert statt Gateway?
Was passiert beim Wechsel auf eine neue Modellversion?
Kann ich später auf ein eigenes Modell umsteigen?
[
LOSLEGEN
]
Sprechen Sie mit einem Engineer.
Wir schauen uns Ihren Workload an, wählen mit Ihnen das passende Modell und dimensionieren das Deployment.