[

Dedizierte Inferenz

]

Dedizierte GPUs in der EU,
für jedes offene Modell.

Qwen, Llama, Mistral oder Ihr eigenes Modell auf reservierten GPUs in der EU, hinter einem OpenAI-kompatiblen Endpoint. Kein geteilter Traffic, stabile Latenz, Abrechnung nach Kapazität statt pro Token. Ein eigenes Training brauchen Sie dafür nicht.

  • Border Shape
  • Border Shape

[

DEDIZIERTE INFERENZ

]

Vom offenen Modell zum eigenen Endpoint.

Sie wählen ein Modell, wir starten es auf reservierten GPUs in der EU und konfigurieren es auf Ihren Workload. Eine neuere Version oder ein eigenes Modell geht später hinter denselben Endpoint.

Deployments

Endpoints

Checkpoints

Modell

Übersicht

Evals

Training

Traffic

Traces

Retraining

Governance

Audit-Log

Richtlinien

Dokumentation

Deployments / Endpoints / qwen3-32b-prod

EU · Frankfurt

Dediziert

qwen3-32b-prod

Qwen3 32B

Live

Reservierte GPUs in Frankfurt, OpenAI-kompatibler Endpoint, Rollback jederzeit.

Modell wechseln

Latenz p50

240 ms

p99 610 ms im interaktiven Deployment

Durchsatz

1.400 Tok/s

über alle Replicas

Verfügbarkeit

99,95 %

letzte 30 Tage

Deployments

Dasselbe Modell, drei Konfigurationen

Region Frankfurt

Deployment

Zweck

Hardware

Auslastung

Replicas

Prod

Interaktiv

4× H200

62 %

3

Batch

Nachtlauf

2× H200

88 %

2

Canary

A/B auf 5 %

1× H200

11 %

1

Neue Modellversionen gehen hinter denselben Endpoint. Kippt eine Metrik im Canary, rollt das Deployment automatisch zurück.

Traces erfasst: 1,2 Mio. pro Woche

Zero Data Retention: aktiv

Traces exportieren

  • Border Shape
  • Border Shape

[

DEDIZIERTE INFERENZ

]

Auf Ihren Workload ausgelegt, nicht auf den Durchschnitt.

Ob offenes oder eigenes Modell: Es läuft auf reservierten GPUs in der EU, und jedes Deployment wird für ein Ziel aus Latenz und Durchsatz konfiguriert statt für einen Standardwert.

Serving-Konfiguration pro Workload.

Batch-Größe, Kontextlänge und Parallelität werden gegen Ihr Ziel aus Latenz und Durchsatz getunt. Interaktive Anwendungen und Batch-Jobs bekommen getrennte Deployments desselben Modells.

Autoscaling entlang Ihrer Nutzungskurve.

Kapazität folgt der Nachfrage, mit reservierten GPUs als Basis und definierten Grenzen nach oben und unten. Sie zahlen keine Spitzenlast, die nie eintritt.

Region und Isolation pro Deployment.

Die Region legen Sie beim Design fest. Single-Tenant und regionale Bindung für Anforderungen an Datenresidenz, Zero Data Retention auf Wunsch.

Verfügbarkeitsziele und Monitoring.

SLAs nach Ihren Produktanforderungen, mit Alerting auf Latenz, Fehlerrate und Sättigung, bevor Ihre Nutzer es merken.

  • Border Shape

[

NOCH ZU WENIG TRAFFIC?

]

Offene Modelle in der EU gibt es auch ohne eigene GPUs.

Solange sich reservierte Kapazität nicht lohnt, nutzen Sie Llama, Mistral oder Qwen über das Kontinent Gateway: europäische Provider, ein API-Key, Abrechnung pro Token. Wächst das Volumen, wechseln Sie auf dedizierte GPUs, über dieselbe OpenAI-kompatible API.

  • Border Shape
  • Border Shape

[

OPTIONAL: TRAINING

]

Aus Ihrem Traffic kann später Ihr eigenes Modell werden.

Kein Muss, aber eine Option: Wer ein offenes Modell dediziert betreibt, hat die Daten für ein spezialisiertes Modell schon in der Hand. Erfasst wird nur, was Sie freigeben.

01

Ausliefern.

Jede Anfrage läuft über Ihren Endpoint. Auf Wunsch werden Prompt, Antwort und Tool-Ausgaben erfasst, in der EU und unter Ihrer Kontrolle.

01

Ausliefern.

Jede Anfrage läuft über Ihren Endpoint. Auf Wunsch werden Prompt, Antwort und Tool-Ausgaben erfasst, in der EU und unter Ihrer Kontrolle.

02

Verbessern.

Aus echtem Traffic entstehen Trainingsdaten: Self-Distillation gegen Fehlerfälle, Preference-Optimierung auf Korrekturen, Reinforcement Learning für neue Fähigkeiten.

02

Verbessern.

Aus echtem Traffic entstehen Trainingsdaten: Self-Distillation gegen Fehlerfälle, Preference-Optimierung auf Korrekturen, Reinforcement Learning für neue Fähigkeiten.

03

Neu ausrollen.

Der nächste Checkpoint geht Minuten nach dem Training hinter denselben Endpoint. API, Routing, Zugriffsrechte und Monitoring bleiben unverändert.

03

Neu ausrollen.

Der nächste Checkpoint geht Minuten nach dem Training hinter denselben Endpoint. API, Routing, Zugriffsrechte und Monitoring bleiben unverändert.

  • Border Shape
  • Border Shape

Fragen zur dedizierten Inferenz

Welche Modelle kann ich dediziert betreiben?

Offene Modelle wie Qwen, Llama, Mistral oder DeepSeek, und ebenso ein Modell, das Sie selbst trainiert haben. Wir starten es auf reservierten GPUs in der EU, angesprochen wird es über eine OpenAI-kompatible API.

Muss ich ein Modell trainieren, um dedizierte Inferenz zu nutzen?

Wie wird ein Deployment auf meinen Workload konfiguriert?

Zahle ich pro Token oder pro GPU?

Wann lohnt sich dediziert statt Gateway?

Was passiert beim Wechsel auf eine neue Modellversion?

Kann ich später auf ein eigenes Modell umsteigen?

  • Border Shape
  • Border Shape

[

LOSLEGEN

]

Sprechen Sie mit einem Engineer.

Wir schauen uns Ihren Workload an, wählen mit Ihnen das passende Modell und dimensionieren das Deployment.

  • Border Shape
  • Border Shape