Cluster HPC en la nube - MLOps en Meta (Facebook)

Empezá tu Proyecto

Cluster HPC cloud con GPUs para investigación de ML a gran escala

Caso de Estudio

Nuestra solución

La explosión de la IA/ML cambió de la noche a la mañana la economía de la infraestructura de investigación. Meta (ex Facebook) necesitaba escalar su capacidad de GPU rápido — más investigadores, más cómputo, más experimentos corriendo en paralelo — pero los clusters HPC on-premises no daban abasto. La infraestructura on-premises tiene ventajas reales: personalización, performance, seguridad y control. Pero también carga desventajas serias: una inversión inicial enorme, ciclos de retorno largos, cronogramas de construcción de años, y hardware que queda obsoleto antes de aprovecharse por completo. Cuando la demanda de investigación en IA se acelera, esperar años para ampliar capacidad no es una opción. El Cloud HPC ofrecía un trade-off distinto: más flexibilidad, aprovisionamiento más rápido y eficiencia de costos para capacidad de desborde y pruebas de hardware de punta. El desafío era que las ofertas de Cloud HPC tienen funcionalidades nativas limitadas y son notoriamente difíciles de adoptar a escala enterprise. La integración con los servicios internos era un requisito duro — no un nice-to-have.

Solución entregada

Renaiss diseñó y desplegó un cluster HPC Slurm listo para producción en AWS usando AWS ParallelCluster como capa base, fuertemente customizado para cumplir con los requisitos enterprise.
La arquitectura fue mucho más allá de un despliegue estándar de ParallelCluster. Entre las capacidades clave construidas sobre la capa base se incluyeron acceso seguro para usuarios internos, gestión de usuarios Unix, autenticación de dos factores, pipelines de datos en S3, soporte de FSx for Lustre en múltiples configuraciones, particiones y límites de Slurm, accounting de Slurm, observabilidad de hardware, frameworks de testing de hardware, login nodes y soporte multi-tenant entre distintas cuentas de AWS. También se implementaron directorios $HOME persistentes, políticas de desalojo de Lustre y herramientas de planificación de capacidad para soportar flujos de investigación a escala.

Se construyeron resguardos personalizados específicamente para los servicios de AWS, para prevenir costos descontrolados y reforzar la gobernanza. Con el tiempo, se sumó al stack un cluster en Azure usando Cycle Cloud, expandiendo la solución a un entorno multi-cloud real. Stack tecnológico completo: Terraform, Packer, AWS (EC2, EFA, FSx, EFS, S3, SES, SNS, SQS, Step Functions, Cognito, DynamoDB, CloudWatch), PyTorch, NCCL, DUO.

Resultados del proyecto

  • La plataforma escaló para soportar más de 500 investigadores en más de 20 clusters, distribuidos en más de 5 cuentas y tenants. En el pico, la infraestructura gestionó más de 6000 GPUs bajo administración activa y múltiples petabytes de datos en S3 y FSx.
  • El proyecto tuvo impacto más allá del cliente: AWS ParallelCluster incorporó a su roadmap varias ideas desarrolladas durante este proyecto, un reconocimiento a la profundidad técnica y la novedad del trabajo que aportó Renaiss.
  • El resultado fue una infraestructura de investigación capaz de escalar con la demanda de IA — aprovisionando nuevos clusters en horas en lugar de años, soportando a cientos de investigadores en simultáneo, e integrándose sin fricciones con los sistemas enterprise internos.

+500 investigadores

+500 investigadores

Un equipo de investigación a máxima velocidad, sin la fricción que generan los entornos on-prem.

+20 clusters

+20 clusters

+Veinte entornos corriendo en paralelo, cada uno afinado para su equipo y su carga de trabajo.

+5 cuentas/tenants

+5 cuentas/tenants

Entornos aislados por equipo, con gobernanza centralizada en todas las cuentas.

+5000 GPUs bajo administración

+5000 GPUs bajo administración

Cinco mil GPUs orquestadas, programadas y facturadas con precisión de nivel productivo.

múltiples PB en S3/FSx

múltiples PB en S3/FSx

Cinco mil GPUs orquestadas, programadas y facturadas con precisión de nivel productivo.

AWS ParallelCluster tomó muchas ideas de este proyecto

AWS ParallelCluster tomó muchas ideas de este proyecto

El trabajo influyó en el roadmap de AWS ParallelCluster. Una señal de que la arquitectura iba un paso adelante del producto.

De las limitaciones on-premises a 5000 GPUs en la nube

Diagnóstico y diseño de arquitectura

Mapeamos los flujos de investigación del cliente, los volúmenes de datos y la demanda de GPU para definir una arquitectura de Cloud HPC capaz de escalar sin sacrificar seguridad ni control.

Despliegue de infraestructura

Mapeamos los flujos de investigación del cliente, los volúmenes de datos y la demanda de GPU para definir una arquitectura de Cloud HPC capaz de escalar sin sacrificar seguridad ni control.

Configuración de seguridad y accesos

Mapeamos los flujos de investigación del cliente, los volúmenes de datos y la demanda de GPU para definir una arquitectura de Cloud HPC capaz de escalar sin sacrificar seguridad ni control.

Integración de storage y pipeline de datos

Conectamos múltiples sistemas de archivos FSx for Lustre y pipelines de S3 para soportar datasets a escala de petabytes, con políticas de desalojo automatizadas para mantener los costos bajo control.

Observabilidad y operación continua

Configuramos accounting de Slurm, monitoreo con CloudWatch y herramientas de planificación de capacidad para que el equipo del cliente pudiera operar de forma autónoma — con visibilidad completa sobre uso, costo y performance del hardware.

AWS ParallelCluster tomó muchas ideas de este proyecto

El trabajo influyó en el roadmap de AWS ParallelCluster. Una señal de que la arquitectura iba un paso adelante del producto.

¿Con qué tipo de empresas trabaja Renaiss?

Trabajamos sobre todo con bancos y empresas del mercado de capitales en proyectos de modernización tecnológica: infraestructura, sistemas core e incorporación de IA a procesos reales. También tomamos proyectos de otros sectores cuando la exigencia técnica es la misma — varios de los casos de esta sección lo son. En todos los casos, entramos como equipo técnico senior embebido, no como una mesa de soporte tercerizada.

¿Desde dónde opera el equipo de Renaiss?

Tenemos base en Rosario, Argentina, y trabajamos con clientes en toda Latinoamérica. Eso significa conocimiento directo del contexto regulatorio y operativo de la región — por ejemplo la normativa del BCRA para fintechs argentinas — y coordinación en el mismo huso horario, sin la fricción de trabajar con un equipo a 10 horas de diferencia.

¿En qué servicios de cloud se especializa Renaiss?

Nuestro trabajo está en la intersección de infraestructura cloud, arquitectura de aplicaciones e IA: diseño de arquitectura cloud-native, automatización de infraestructura, plataformas, pipelines de datos e integración de GenAI. No hacemos soporte cloud genérico — construimos y operamos sistemas que necesitan escalar.

¿Trabajan con AWS, Azure o GCP?

Nuestra mayor profundidad es en AWS. También trabajamos con Azure y GCP según el stack que ya tenga el cliente — el objetivo siempre es adaptarnos a tu entorno, no imponer un proveedor.

¿Pueden ayudarnos a modernizar una aplicación legacy?

Sí — es uno de los problemas en los que más trabajamos. Modernizar una aplicación suele implicar alguna combinación de: separar un monolito en servicios, migrar a infraestructura cloud-native, reemplazar dependencias obsoletas o mejorar el pipeline de CI/CD para que el equipo entregue más rápido. Siempre arrancamos con un diagnóstico técnico antes de recomendar un camino.