KI- und GPU-Workloads über OCRE

Forschungsdaten, die die europäische Jurisdiktion nicht verlassen dürfen, lassen sich trotzdem trainieren, feintunen und ausliefern. Exoscale betreibt die GPUs, VSHN die Plattform darum herum, und beides wird über den GÉANT-OCRE-2024- Rahmenvertrag beschafft, mit 10% Rabatt auf Compute und Storage.

Welche KI-Modelle sind verfügbar?

Über OCRE werden Cloud-Services beschafft, nicht einzelne KI-Modelle. Der Rahmenvertrag kennt deshalb weder einen Modellkatalog noch eine Freigabeliste. Was du hier beschaffst, ist eine offene Plattform: du wählst das Modell, Exoscale und VSHN betreiben es auf europäischer Hardware.

  • Dedicated Inference betreibt jedes Modell von Hugging Face, öffentlich, gated oder privat, und daneben deine eigenen Gewichte. Konkret sind das die Familien, nach denen Forschungsteams fragen: Apertus, das Schweizer KI-Basismodell, dazu Llama, Mistral, Qwen, DeepSeek und Gemma, Whisper für Sprache und offene Embedding-Modelle für RAG. Die Dokumentation von Exoscale selbst nennt openai/gpt-oss-20b, openai/gpt-oss-120b und Qwen3-Coder-480B als Beispiele dafür, was Teams dort ausrollen. Keine der beiden Aufzählungen ist ein Katalog; beide illustrieren einen Dienst, der alles von Hugging Face betreibt.
  • GPU-Server tragen alles, was du selbst baust: einen Fine-Tuning-Lauf, ein eigenes vLLM- oder llm-d-Deployment, ein Training über mehrere Karten.
  • Ob ein Modell passt, entscheidet der GPU-Speicher in der gewählten Zone, von 16 GB auf einer V100 bis 8x 288 GB auf einer B300 HGX, und keine Freigabeliste.

Die Ausnahme sind geschlossene Modelle. GPT-4, Claude und Gemini gehören nicht zu diesem Angebot: ihre Gewichte sind ausserhalb der Anbieter und deren eigener Clouds nicht zum Betrieb lizenziert. Über OCRE führt der Weg dorthin nur über ein Hyperscaler-Angebot, mit genau der CLOUD-Act-Exposition, die der Rest dieser Seite vermeidet.

Schick uns Modell oder Modellgrösse, erwartete Last und Zone, und du bekommst einen schriftlichen Kostenvoranschlag zurück.

Test-Gutschein anfragen

Dedicated Inference

Ab sofort verfügbar. Betreibe jedes Hugging-Face-Modell als produktiven API-Endpunkt auf dedizierten europäischen GPUs.

  • OpenAI-kompatible API, bestehende Tools und SDKs funktionieren unverändert
  • Öffentliche, gated oder private Modelle; Gewichte im Exoscale-Objektspeicher zwischengespeichert
  • Exoscale betreibt die GPUs, das darunterliegende Kubernetes, die Load Balancer und das Model Serving
  • Manuelle Replica-Skalierung und Scale-to-Zero, ein ungenutzter Endpunkt kostet also nichts
  • Abrechnung pro GPU-Sekunde je GPU-Modell, keine Token-Gebühr, keine Grundgebühr, zuzüglich Modellspeicher
  • 99.95% monatliche Endpunkt-Verfügbarkeit als SLA von Exoscale, mit Gutschriften

Verfügbar in at-vie-2, ch-dk-2, de-fra-1 und hr-zag-1.

Aktuelle Listenpreise auf exoscale.com; der OCRE-Rabatt kommt obendrauf.

GPU-Server

Sekundengenau abgerechnet, mit NGC-Containern, Terraform-Unterstützung und GPU-Node-Pools, die sich an einen SKS-Kubernetes-Cluster hängen lassen. ML-Pipelines werden damit wie jeder andere Workload auf GPUs eingeplant.

GPU Speicher Generation Zonen
RTX Pro 6000 96 GB Blackwell de-fra-1, ch-dk-2, hr-zag-1
A40 48 GB Ampere de-fra-1
A30 24 GB Ampere ch-gva-2
RTX A5000 24 GB Ampere, flüssigkeitsgekühlt at-vie-2
Tesla V100 16 GB HBM2 Volta at-vie-1
B300 HGX 8x 288 GB Blackwell Ultra, NVSwitch ch-gva-2, auf Anfrage

Die RTX-A5000-Maschinen in Wien sind flüssigkeitsgekühlt, ihre Abwärme wird zurückgewonnen.

Vektorsuche, schon heute

Retrieval-Augmented Generation braucht einen Ort für die Embeddings, und beide Optionen sind Managed Services statt etwas, das dein Team selbst betreibt:

  • Managed PostgreSQL mit pgvector, in jeder Zone, im Planpreis enthalten
  • Managed OpenSearch mit Vektorsuche, für semantische Suche in grossem Umfang

Zusammen mit Dedicated Inference ergibt das einen vollständigen RAG-Stack innerhalb der EU- und Schweizer Jurisdiktion, ohne dass Daten sie verlassen.

Managed Inference: angekündigt, noch nicht verfügbar

Exoscale hat einen Managed-Inference-Dienst mit Token-Abrechnung angekündigt, mit einem kuratierten Katalog produktionsreifer Modelle hinter einer verwalteten API: keine GPUs zu dimensionieren, keine Leerlaufkosten. Geplant sind Assistenten, Coding-Modelle, kleine Modelle, Embeddings, OCR und Sprache, betrieben in Europa und der Schweiz.

Die Warteliste ist offen, der Dienst ist noch nicht allgemein verfügbar. Wenn er deine Architektur verändern würde, sag uns Bescheid, wir setzen dich darauf.

Warum das für die Forschung zählt

KI-Dienste von Hyperscalern werfen dieselben Schrems-II-Fragen auf wie jede andere US-kontrollierte Verarbeitung, und eine Förderauflage oder ein Ethikvotum mit Anforderung an europäische Datenresidenz macht bei einem Modell-Endpunkt keine Ausnahme. Jede Komponente hier läuft in einer Zone deiner Wahl, betrieben von Unternehmen ohne US-Muttergesellschaft.

Frag uns nach einem schriftlichen Kostenvoranschlag für deinen Workload oder nach einem Test-Gutschein, um dein eigenes Modell zu benchmarken, bevor du dich festlegst.

Test-Gutschein anfordern

Möchtest du Exoscale oder VSHN-verwaltete Services in deiner Forschungs- oder Bildungsinstitution über OCRE 2024 nutzen? Schildere uns deine Workloads, und wir melden uns mit weiteren Informationen und einem Test-Gutschein.

Kostenloses Gespräch buchen

Oder stelle deine Frage