Para qué sirve un servidor CPU dedicado en un pipeline de IA
Hoy no vendemos nodos GPU. Si un entrenamiento o una carga de inferencia de alto volumen necesita capacidad GPU, comercial te hace un presupuesto directamente en lugar de listarla como SKU de catálogo. Lo que sí sale del catálogo es bare metal de CPU monoinquilino, que cubre más de un pipeline de IA típico que la sola llamada al modelo: retrieval, embeddings, pipelines de features y las etapas ligadas a CPU alrededor del modelo. Nada de eso se comparte con otro cliente, así que el trabajo por lotes de un vecino nunca aparece como latencia en tu endpoint de inferencia. Consulta las configuraciones actuales en nuestra página de servidores dedicados.
Inferencia y embeddings en CPU
La inferencia cuantizada mediante llama.cpp, ONNX Runtime u OpenVINO, y la generación de embeddings, se ejecutan en núcleos que ningún otro cliente comparte. Nada por encima de tu propio sistema operativo decide cuándo se ejecuta tu proceso.
Búsqueda vectorial y retrieval
El paso de retrieval de un pipeline RAG, un índice vectorial como FAISS, Qdrant o Milvus, o un feature store, depende más de un rendimiento de disco local constante que de una GPU. El bare metal le da NVMe dedicado, no un volumen compartido.
Preparación de datos y orquestación
La tokenización, la limpieza, el troceado y la orquestación que alimentan un entrenamiento son etapas ligadas a CPU. No necesitan GPU, y en un host compartido compiten con una tarea de GPU por la atención del planificador.
Qué corre en la plataforma
- Imágenes de Windows Server y Linux con un clic
- Acceso root completo, aprovisionado desde la consola cloud
- Almacenamiento NVMe local para índices vectoriales y datasets
- Facturación por hora mientras pruebas un pipeline, por mes cuando ya está en producción
Red y fiabilidad
- AS55285 es nuestra propia red, en siete ubicaciones activas: Ámsterdam, Fráncfort, Londres, Chicago, Dallas, Los Ángeles y Nueva Jersey
- SLA de disponibilidad de red del 100 %: 5 % de la cuota mensual acreditado por cada hora de caída que causemos, hasta el mes completo como máximo
- Mitigación DDoS en línea en el puerto, activa por defecto
- Looking glass público para probar tú mismo el camino desde cinco de nuestras siete ubicaciones antes de pedir
Red privada entre tus servidores
- Los datasets y el tráfico de entrenamiento van por una red de capa 2 entre tus propios servidores, fuera de sus interfaces públicas
- La misma red privada puede extenderse a tus servidores en nuestros otros centros de datos
- Disponible sin coste, gestionada desde la consola cloud o por API
Preguntas frecuentes
Qué sale del catálogo hoy, qué necesita un presupuesto, y cómo se aplican la red y el SLA a una carga de trabajo de IA.
Hoy no como SKU de catálogo. Lo que sale de nuestra página de servidores dedicados es bare metal de CPU monoinquilino. Si tu carga de trabajo necesita capacidad GPU, para entrenamiento o inferencia de alto volumen, contacta con comercial con el modelo y la escala que buscas; te presupuestamos el hardware directamente.
Pregunta a comercial por capacidad GPU
Bare metal de CPU en el catálogo, nodos GPU por presupuesto
Pide una configuración de CPU directamente desde el catálogo, por hora o por mes. Para capacidad GPU, cuéntale a comercial qué entrenas o sirves y a qué escala; ese hardware se presupuesta, no se lista.
