À quoi sert un serveur CPU dédié dans un pipeline IA

Nous ne vendons pas de nœuds GPU aujourd’hui. Si un entraînement ou une charge d’inférence à fort volume a besoin de débit GPU, nos équipes commerciales en font le devis directement plutôt que de le lister comme article catalogue. Ce qui sort du catalogue, c’est du bare metal CPU mono-locataire, qui couvre une plus grande partie d’un pipeline IA classique que le seul appel au modèle : retrieval, embeddings, pipelines de features et les étapes limitées par le CPU autour du modèle. Rien n’est partagé avec un autre client, donc le traitement par lots d’un voisin ne peut jamais apparaître comme de la latence sur votre point de terminaison d’inférence. Consultez les configurations actuelles sur notre page de serveurs dédiés.

Inférence CPU et embeddings

L’inférence quantifiée via llama.cpp, ONNX Runtime ou OpenVINO, ainsi que la génération d’embeddings, s’exécutent sur des cœurs qu’aucun autre client ne partage. Rien au-dessus de votre propre système d’exploitation ne décide quand votre processus s’exécute.

Recherche vectorielle et retrieval

L’étape de retrieval d’un pipeline RAG, un index vectoriel comme FAISS, Qdrant ou Milvus, ou un feature store, dépend davantage d’un débit disque local constant que d’un GPU. Le bare metal lui donne du NVMe dédié, pas un volume partagé.

Préparation des données et orchestration

La tokenisation, le nettoyage, le découpage et l’orchestration qui alimentent un entraînement sont des étapes limitées par le CPU. Elles n’ont pas besoin de GPU, et sur un hôte partagé, elles entrent en concurrence avec une tâche GPU pour l’attention de l’ordonnanceur.

  • Inférence
  • RAG
  • Recherche vectorielle
  • Pipelines de données

Où le CPU s’arrête et où commence un devis GPU

Le catalogue de cette page, c’est du bare metal CPU : mono-locataire, sans virtualisation, disponible à l’heure le temps de tester un pipeline dessus. Entraîner un modèle depuis zéro, ou faire tourner de l’inférence à une échelle qui demande du débit GPU, c’est un autre matériel que nous ne listons pas comme SKU. Nos équipes commerciales en font directement le devis ; les étapes limitées par le CPU du même pipeline peuvent, elles, passer directement en commande.

Ce qui tourne sur la plateforme

  • Images Windows Server et Linux en un clic
  • Accès root complet, provisionné depuis la console cloud
  • Stockage NVMe local pour les index vectoriels et les jeux de données
  • Facturation à l’heure le temps de tester un pipeline, au mois une fois en production

Réseau et fiabilité

  • AS55285 est notre propre réseau, réparti sur sept sites actifs : Amsterdam, Francfort, Londres, Chicago, Dallas, Los Angeles et New Jersey
  • SLA de disponibilité réseau de 100 % : 5 % du tarif mensuel crédités par heure d’indisponibilité que nous avons causée, plafonné au mois complet
  • Mitigation DDoS en ligne sur le port, active par défaut
  • Looking glass public pour tester vous-même le chemin depuis cinq de nos sept sites avant de commander

Réseau privé entre vos serveurs

  • Jeux de données et trafic d’entraînement passent par un réseau de couche 2 entre vos propres serveurs, hors de leurs interfaces publiques
  • Le même réseau privé peut s’étendre à vos serveurs dans nos autres centres de données
  • Disponible sans frais, géré depuis la console cloud ou par API

Questions fréquentes

Ce qui sort du catalogue aujourd’hui, ce qui demande un devis, et comment le réseau et le SLA s’appliquent à une charge de travail IA.

Pas comme article catalogue aujourd’hui. Ce qui sort de notre page de serveurs dédiés, c’est du bare metal CPU mono-locataire. Si votre charge de travail a besoin de débit GPU, pour l’entraînement ou l’inférence à fort volume, contactez nos équipes commerciales avec le modèle et l’échelle visés ; nous en ferons directement le devis.

Demandez un devis GPU à nos équipes commerciales

Bare metal CPU au catalogue, nœuds GPU sur devis
Commandez une configuration CPU directement depuis le catalogue, à l’heure ou au mois. Pour une capacité GPU, indiquez à nos équipes commerciales ce que vous entraînez ou servez et à quelle échelle ; ce matériel se commande sur devis, pas au catalogue.