Para qué sirve un servidor CPU dedicado en un pipeline de IA

Hoy no vendemos nodos GPU. Si un entrenamiento o una carga de inferencia de alto volumen necesita capacidad GPU, comercial te hace un presupuesto directamente en lugar de listarla como SKU de catálogo. Lo que sí sale del catálogo es bare metal de CPU monoinquilino, que cubre más de un pipeline de IA típico que la sola llamada al modelo: retrieval, embeddings, pipelines de features y las etapas ligadas a CPU alrededor del modelo. Nada de eso se comparte con otro cliente, así que el trabajo por lotes de un vecino nunca aparece como latencia en tu endpoint de inferencia. Consulta las configuraciones actuales en nuestra página de servidores dedicados.

Inferencia y embeddings en CPU

La inferencia cuantizada mediante llama.cpp, ONNX Runtime u OpenVINO, y la generación de embeddings, se ejecutan en núcleos que ningún otro cliente comparte. Nada por encima de tu propio sistema operativo decide cuándo se ejecuta tu proceso.

Búsqueda vectorial y retrieval

El paso de retrieval de un pipeline RAG, un índice vectorial como FAISS, Qdrant o Milvus, o un feature store, depende más de un rendimiento de disco local constante que de una GPU. El bare metal le da NVMe dedicado, no un volumen compartido.

Preparación de datos y orquestación

La tokenización, la limpieza, el troceado y la orquestación que alimentan un entrenamiento son etapas ligadas a CPU. No necesitan GPU, y en un host compartido compiten con una tarea de GPU por la atención del planificador.

  • Inferencia
  • RAG
  • Búsqueda vectorial
  • Pipelines de datos

Dónde termina la CPU y empieza un presupuesto de GPU

El catálogo de esta página es bare metal de CPU: monoinquilino, sin virtualización, disponible por hora mientras pruebas un pipeline en él. Entrenar un modelo desde cero, o ejecutar inferencia a una escala que necesite capacidad GPU, es otro tipo de hardware que no listamos como SKU. Comercial presupuesta la capacidad GPU directamente; las etapas ligadas a CPU del mismo pipeline puedes pedirlas ya mismo.

Qué corre en la plataforma

  • Imágenes de Windows Server y Linux con un clic
  • Acceso root completo, aprovisionado desde la consola cloud
  • Almacenamiento NVMe local para índices vectoriales y datasets
  • Facturación por hora mientras pruebas un pipeline, por mes cuando ya está en producción

Red y fiabilidad

  • AS55285 es nuestra propia red, en siete ubicaciones activas: Ámsterdam, Fráncfort, Londres, Chicago, Dallas, Los Ángeles y Nueva Jersey
  • SLA de disponibilidad de red del 100 %: 5 % de la cuota mensual acreditado por cada hora de caída que causemos, hasta el mes completo como máximo
  • Mitigación DDoS en línea en el puerto, activa por defecto
  • Looking glass público para probar tú mismo el camino desde cinco de nuestras siete ubicaciones antes de pedir

Red privada entre tus servidores

  • Los datasets y el tráfico de entrenamiento van por una red de capa 2 entre tus propios servidores, fuera de sus interfaces públicas
  • La misma red privada puede extenderse a tus servidores en nuestros otros centros de datos
  • Disponible sin coste, gestionada desde la consola cloud o por API

Preguntas frecuentes

Qué sale del catálogo hoy, qué necesita un presupuesto, y cómo se aplican la red y el SLA a una carga de trabajo de IA.

Hoy no como SKU de catálogo. Lo que sale de nuestra página de servidores dedicados es bare metal de CPU monoinquilino. Si tu carga de trabajo necesita capacidad GPU, para entrenamiento o inferencia de alto volumen, contacta con comercial con el modelo y la escala que buscas; te presupuestamos el hardware directamente.

Pregunta a comercial por capacidad GPU

Bare metal de CPU en el catálogo, nodos GPU por presupuesto
Pide una configuración de CPU directamente desde el catálogo, por hora o por mes. Para capacidad GPU, cuéntale a comercial qué entrenas o sirves y a qué escala; ese hardware se presupuesta, no se lista.