À quoi sert un serveur CPU dédié dans un pipeline IA
Nous ne vendons pas de nœuds GPU aujourd’hui. Si un entraînement ou une charge d’inférence à fort volume a besoin de débit GPU, nos équipes commerciales en font le devis directement plutôt que de le lister comme article catalogue. Ce qui sort du catalogue, c’est du bare metal CPU mono-locataire, qui couvre une plus grande partie d’un pipeline IA classique que le seul appel au modèle : retrieval, embeddings, pipelines de features et les étapes limitées par le CPU autour du modèle. Rien n’est partagé avec un autre client, donc le traitement par lots d’un voisin ne peut jamais apparaître comme de la latence sur votre point de terminaison d’inférence. Consultez les configurations actuelles sur notre page de serveurs dédiés.
Inférence CPU et embeddings
L’inférence quantifiée via llama.cpp, ONNX Runtime ou OpenVINO, ainsi que la génération d’embeddings, s’exécutent sur des cœurs qu’aucun autre client ne partage. Rien au-dessus de votre propre système d’exploitation ne décide quand votre processus s’exécute.
Recherche vectorielle et retrieval
L’étape de retrieval d’un pipeline RAG, un index vectoriel comme FAISS, Qdrant ou Milvus, ou un feature store, dépend davantage d’un débit disque local constant que d’un GPU. Le bare metal lui donne du NVMe dédié, pas un volume partagé.
Préparation des données et orchestration
La tokenisation, le nettoyage, le découpage et l’orchestration qui alimentent un entraînement sont des étapes limitées par le CPU. Elles n’ont pas besoin de GPU, et sur un hôte partagé, elles entrent en concurrence avec une tâche GPU pour l’attention de l’ordonnanceur.
Ce qui tourne sur la plateforme
- Images Windows Server et Linux en un clic
- Accès root complet, provisionné depuis la console cloud
- Stockage NVMe local pour les index vectoriels et les jeux de données
- Facturation à l’heure le temps de tester un pipeline, au mois une fois en production
Réseau et fiabilité
- AS55285 est notre propre réseau, réparti sur sept sites actifs : Amsterdam, Francfort, Londres, Chicago, Dallas, Los Angeles et New Jersey
- SLA de disponibilité réseau de 100 % : 5 % du tarif mensuel crédités par heure d’indisponibilité que nous avons causée, plafonné au mois complet
- Mitigation DDoS en ligne sur le port, active par défaut
- Looking glass public pour tester vous-même le chemin depuis cinq de nos sept sites avant de commander
Réseau privé entre vos serveurs
- Jeux de données et trafic d’entraînement passent par un réseau de couche 2 entre vos propres serveurs, hors de leurs interfaces publiques
- Le même réseau privé peut s’étendre à vos serveurs dans nos autres centres de données
- Disponible sans frais, géré depuis la console cloud ou par API
Questions fréquentes
Ce qui sort du catalogue aujourd’hui, ce qui demande un devis, et comment le réseau et le SLA s’appliquent à une charge de travail IA.
Pas comme article catalogue aujourd’hui. Ce qui sort de notre page de serveurs dédiés, c’est du bare metal CPU mono-locataire. Si votre charge de travail a besoin de débit GPU, pour l’entraînement ou l’inférence à fort volume, contactez nos équipes commerciales avec le modèle et l’échelle visés ; nous en ferons directement le devis.
Demandez un devis GPU à nos équipes commerciales
Bare metal CPU au catalogue, nœuds GPU sur devis
Commandez une configuration CPU directement depuis le catalogue, à l’heure ou au mois. Pour une capacité GPU, indiquez à nos équipes commerciales ce que vous entraînez ou servez et à quelle échelle ; ce matériel se commande sur devis, pas au catalogue.
