Aller au contenu
Cloud
Blog
Cloud8 min

Héberger un LLM en Suisse : l'IA souveraine sur GPU

Mattia Eleuteri11 août 2026

L'IA générative est entrée dans les entreprises, mais une question freine les projets sérieux en Suisse : où partent les données ? Envoyer des documents internes, des dossiers clients ou du code propriétaire à une API hébergée aux États-Unis est rarement acceptable pour les secteurs régulés. La réponse tient en deux mots : IA souveraine, c'est-à-dire faire tourner des modèles sur des GPU en Suisse, avec des données qui n'en sortent pas.

Pourquoi la souveraineté change tout pour l'IA

Un projet IA manipule par nature ce que l'entreprise a de plus sensible : ses documents, ses échanges, ses données clients. Or la plupart des offres GPU des hyperscalers ne garantissent pas la localisation des données pour les charges d'IA, et restent soumises à des lois extraterritoriales comme le CLOUD Act. Pour une banque, une assurance, un acteur de la santé ou une administration en Suisse, c'est rédhibitoire.

Faire tourner le modèle sur une infrastructure souveraine résout le problème à la racine : les données de contexte, les poids du modèle et les prompts restent physiquement en Suisse, sur une infrastructure opérée localement.

Ce que Hikube met à disposition

Hikube propose du GPU as a Service avec des cartes NVIDIA H100, A100 et L40S, accessibles de deux manières :

  • depuis des VM dédiées, pour une prise en main directe façon serveur GPU ;
  • depuis des pods Kubernetes via le device plugin NVIDIA, pour industrialiser l'entraînement et le service à l'échelle.

Autour du GPU, la plateforme apporte les briques qui manquent souvent dans une offre « GPU seul » : du stockage objet compatible S3 pour les jeux de données et les checkpoints, des bases de données managées, et de l'observabilité. Le tout en open source, répliqué sur trois datacenters suisses.

Trois cas d'usage concrets

Inférence + RAG. Le cas le plus fréquent : brancher un LLM open source sur vos documents internes (Retrieval Augmented Generation) pour répondre aux questions métier, sans exposer la base à un tiers. Rapide à mettre en place, fort impact.

Fine-tuning. Spécialiser un modèle sur votre domaine, votre vocabulaire ou votre ton. Utile quand l'inférence générique ne suffit pas, plus coûteux en GPU, à réserver aux cas où le gain est mesurable.

Entraînement et calcul scientifique. Pour les équipes R&D qui entraînent leurs propres modèles ou font du calcul intensif, avec des H100 et A100 dimensionnées à la charge.

Un exemple parlant côté Suisse romande : Novel-T utilise la plateforme pour lancer des entraînements complexes et valider des modèles à grande échelle, sans contrainte d'infrastructure et sans que les données quittent la Suisse.

Par où commencer

Inutile de viser l'entraînement d'un modèle géant dès le premier jour. La trajectoire pragmatique commence par un cas d'usage d'inférence + RAG sur un périmètre limité, mesure la valeur, puis étend. Le dimensionnement GPU (quelle carte, combien, VM ou Kubernetes) se décide en fonction du modèle et du débit visé, pas l'inverse.

Si vous avez un projet d'IA qui bute sur la question de la souveraineté des données, parlons-en : nos ingénieurs à Genève cadrent le cas d'usage, dimensionnent le GPU et opèrent la plateforme. Découvrez Hikube ou échangez avec un ingénieur.

Mattia Eleuteri

Responsable Produit Cloud

Responsable Produit Cloud chez Hidora. Spécialiste Kubernetes, IaC et observabilité.

CKACKSElastic Certified

Cet article vous parle ?

Hidora peut vous accompagner sur ce sujet.

Besoin d'un accompagnement ?

Parlons de votre projet. 30 minutes, sans engagement.