KI- und GPU-Workloads über OCRE
Forschungsdaten, die die europäische Jurisdiktion nicht verlassen dürfen, lassen sich trotzdem trainieren, feintunen und ausliefern. Exoscale betreibt die GPUs, VSHN die Plattform darum herum, und beides wird über den GÉANT-OCRE-2024- Rahmenvertrag beschafft, mit 10% Rabatt auf Compute und Storage.
Welche KI-Modelle sind verfügbar?
Über OCRE werden Cloud-Services beschafft, nicht einzelne KI-Modelle. Der Rahmenvertrag kennt deshalb weder einen Modellkatalog noch eine Freigabeliste. Was du hier beschaffst, ist eine offene Plattform: du wählst das Modell, Exoscale und VSHN betreiben es auf europäischer Hardware.
- Dedicated Inference betreibt jedes Modell von Hugging Face, öffentlich,
gated oder privat, und daneben deine eigenen Gewichte. Konkret sind das die
Familien, nach denen Forschungsteams fragen: Apertus, das Schweizer
KI-Basismodell, dazu Llama, Mistral, Qwen, DeepSeek und Gemma, Whisper für
Sprache und offene Embedding-Modelle für RAG. Die Dokumentation von Exoscale
selbst nennt
openai/gpt-oss-20b,openai/gpt-oss-120bundQwen3-Coder-480Bals Beispiele dafür, was Teams dort ausrollen. Keine der beiden Aufzählungen ist ein Katalog; beide illustrieren einen Dienst, der alles von Hugging Face betreibt. - GPU-Server tragen alles, was du selbst baust: einen Fine-Tuning-Lauf, ein eigenes vLLM- oder llm-d-Deployment, ein Training über mehrere Karten.
- Ob ein Modell passt, entscheidet der GPU-Speicher in der gewählten Zone, von 16 GB auf einer V100 bis 8x 288 GB auf einer B300 HGX, und keine Freigabeliste.
Die Ausnahme sind geschlossene Modelle. GPT-4, Claude und Gemini gehören nicht zu diesem Angebot: ihre Gewichte sind ausserhalb der Anbieter und deren eigener Clouds nicht zum Betrieb lizenziert. Über OCRE führt der Weg dorthin nur über ein Hyperscaler-Angebot, mit genau der CLOUD-Act-Exposition, die der Rest dieser Seite vermeidet.
Schick uns Modell oder Modellgrösse, erwartete Last und Zone, und du bekommst einen schriftlichen Kostenvoranschlag zurück.
Dedicated Inference
Ab sofort verfügbar. Betreibe jedes Hugging-Face-Modell als produktiven API-Endpunkt auf dedizierten europäischen GPUs.
- OpenAI-kompatible API, bestehende Tools und SDKs funktionieren unverändert
- Öffentliche, gated oder private Modelle; Gewichte im Exoscale-Objektspeicher zwischengespeichert
- Exoscale betreibt die GPUs, das darunterliegende Kubernetes, die Load Balancer und das Model Serving
- Manuelle Replica-Skalierung und Scale-to-Zero, ein ungenutzter Endpunkt kostet also nichts
- Abrechnung pro GPU-Sekunde je GPU-Modell, keine Token-Gebühr, keine Grundgebühr, zuzüglich Modellspeicher
- 99.95% monatliche Endpunkt-Verfügbarkeit als SLA von Exoscale, mit Gutschriften
Verfügbar in at-vie-2, ch-dk-2, de-fra-1 und hr-zag-1.
Aktuelle Listenpreise auf exoscale.com; der OCRE-Rabatt kommt obendrauf.
GPU-Server
Sekundengenau abgerechnet, mit NGC-Containern, Terraform-Unterstützung und GPU-Node-Pools, die sich an einen SKS-Kubernetes-Cluster hängen lassen. ML-Pipelines werden damit wie jeder andere Workload auf GPUs eingeplant.
| GPU | Speicher | Generation | Zonen |
|---|---|---|---|
| RTX Pro 6000 | 96 GB | Blackwell | de-fra-1, ch-dk-2, hr-zag-1 |
| A40 | 48 GB | Ampere | de-fra-1 |
| A30 | 24 GB | Ampere | ch-gva-2 |
| RTX A5000 | 24 GB | Ampere, flüssigkeitsgekühlt | at-vie-2 |
| Tesla V100 | 16 GB HBM2 | Volta | at-vie-1 |
| B300 HGX | 8x 288 GB | Blackwell Ultra, NVSwitch | ch-gva-2, auf Anfrage |
Die RTX-A5000-Maschinen in Wien sind flüssigkeitsgekühlt, ihre Abwärme wird zurückgewonnen.
Vektorsuche, schon heute
Retrieval-Augmented Generation braucht einen Ort für die Embeddings, und beide Optionen sind Managed Services statt etwas, das dein Team selbst betreibt:
- Managed PostgreSQL mit pgvector, in jeder Zone, im Planpreis enthalten
- Managed OpenSearch mit Vektorsuche, für semantische Suche in grossem Umfang
Zusammen mit Dedicated Inference ergibt das einen vollständigen RAG-Stack innerhalb der EU- und Schweizer Jurisdiktion, ohne dass Daten sie verlassen.
Managed Inference: angekündigt, noch nicht verfügbar
Exoscale hat einen Managed-Inference-Dienst mit Token-Abrechnung angekündigt, mit einem kuratierten Katalog produktionsreifer Modelle hinter einer verwalteten API: keine GPUs zu dimensionieren, keine Leerlaufkosten. Geplant sind Assistenten, Coding-Modelle, kleine Modelle, Embeddings, OCR und Sprache, betrieben in Europa und der Schweiz.
Die Warteliste ist offen, der Dienst ist noch nicht allgemein verfügbar. Wenn er deine Architektur verändern würde, sag uns Bescheid, wir setzen dich darauf.
Warum das für die Forschung zählt
KI-Dienste von Hyperscalern werfen dieselben Schrems-II-Fragen auf wie jede andere US-kontrollierte Verarbeitung, und eine Förderauflage oder ein Ethikvotum mit Anforderung an europäische Datenresidenz macht bei einem Modell-Endpunkt keine Ausnahme. Jede Komponente hier läuft in einer Zone deiner Wahl, betrieben von Unternehmen ohne US-Muttergesellschaft.
Frag uns nach einem schriftlichen Kostenvoranschlag für deinen Workload oder nach einem Test-Gutschein, um dein eigenes Modell zu benchmarken, bevor du dich festlegst.