Caso de Estudio
La explosión de la IA/ML cambió de la noche a la mañana la economía de la infraestructura de investigación. Meta (ex Facebook) necesitaba escalar su capacidad de GPU rápido — más investigadores, más cómputo, más experimentos corriendo en paralelo — pero los clusters HPC on-premises no daban abasto. La infraestructura on-premises tiene ventajas reales: personalización, performance, seguridad y control. Pero también carga desventajas serias: una inversión inicial enorme, ciclos de retorno largos, cronogramas de construcción de años, y hardware que queda obsoleto antes de aprovecharse por completo. Cuando la demanda de investigación en IA se acelera, esperar años para ampliar capacidad no es una opción. El Cloud HPC ofrecía un trade-off distinto: más flexibilidad, aprovisionamiento más rápido y eficiencia de costos para capacidad de desborde y pruebas de hardware de punta. El desafío era que las ofertas de Cloud HPC tienen funcionalidades nativas limitadas y son notoriamente difíciles de adoptar a escala enterprise. La integración con los servicios internos era un requisito duro — no un nice-to-have.
Renaiss diseñó y desplegó un cluster HPC Slurm listo para producción en AWS usando AWS ParallelCluster como capa base, fuertemente customizado para cumplir con los requisitos enterprise.
La arquitectura fue mucho más allá de un despliegue estándar de ParallelCluster. Entre las capacidades clave construidas sobre la capa base se incluyeron acceso seguro para usuarios internos, gestión de usuarios Unix, autenticación de dos factores, pipelines de datos en S3, soporte de FSx for Lustre en múltiples configuraciones, particiones y límites de Slurm, accounting de Slurm, observabilidad de hardware, frameworks de testing de hardware, login nodes y soporte multi-tenant entre distintas cuentas de AWS. También se implementaron directorios $HOME persistentes, políticas de desalojo de Lustre y herramientas de planificación de capacidad para soportar flujos de investigación a escala.
Se construyeron resguardos personalizados específicamente para los servicios de AWS, para prevenir costos descontrolados y reforzar la gobernanza. Con el tiempo, se sumó al stack un cluster en Azure usando Cycle Cloud, expandiendo la solución a un entorno multi-cloud real. Stack tecnológico completo: Terraform, Packer, AWS (EC2, EFA, FSx, EFS, S3, SES, SNS, SQS, Step Functions, Cognito, DynamoDB, CloudWatch), PyTorch, NCCL, DUO.
Un equipo de investigación a máxima velocidad, sin la fricción que generan los entornos on-prem.
+Veinte entornos corriendo en paralelo, cada uno afinado para su equipo y su carga de trabajo.
Entornos aislados por equipo, con gobernanza centralizada en todas las cuentas.
Cinco mil GPUs orquestadas, programadas y facturadas con precisión de nivel productivo.
Cinco mil GPUs orquestadas, programadas y facturadas con precisión de nivel productivo.
El trabajo influyó en el roadmap de AWS ParallelCluster. Una señal de que la arquitectura iba un paso adelante del producto.
Diagnóstico y diseño de arquitectura
Mapeamos los flujos de investigación del cliente, los volúmenes de datos y la demanda de GPU para definir una arquitectura de Cloud HPC capaz de escalar sin sacrificar seguridad ni control.

Despliegue de infraestructura
Mapeamos los flujos de investigación del cliente, los volúmenes de datos y la demanda de GPU para definir una arquitectura de Cloud HPC capaz de escalar sin sacrificar seguridad ni control.

Configuración de seguridad y accesos
Mapeamos los flujos de investigación del cliente, los volúmenes de datos y la demanda de GPU para definir una arquitectura de Cloud HPC capaz de escalar sin sacrificar seguridad ni control.

Integración de storage y pipeline de datos
Conectamos múltiples sistemas de archivos FSx for Lustre y pipelines de S3 para soportar datasets a escala de petabytes, con políticas de desalojo automatizadas para mantener los costos bajo control.

Observabilidad y operación continua
Configuramos accounting de Slurm, monitoreo con CloudWatch y herramientas de planificación de capacidad para que el equipo del cliente pudiera operar de forma autónoma — con visibilidad completa sobre uso, costo y performance del hardware.

AWS ParallelCluster tomó muchas ideas de este proyecto
El trabajo influyó en el roadmap de AWS ParallelCluster. Una señal de que la arquitectura iba un paso adelante del producto.
Trabajamos sobre todo con bancos y empresas del mercado de capitales en proyectos de modernización tecnológica: infraestructura, sistemas core e incorporación de IA a procesos reales. También tomamos proyectos de otros sectores cuando la exigencia técnica es la misma — varios de los casos de esta sección lo son. En todos los casos, entramos como equipo técnico senior embebido, no como una mesa de soporte tercerizada.
Tenemos base en Rosario, Argentina, y trabajamos con clientes en toda Latinoamérica. Eso significa conocimiento directo del contexto regulatorio y operativo de la región — por ejemplo la normativa del BCRA para fintechs argentinas — y coordinación en el mismo huso horario, sin la fricción de trabajar con un equipo a 10 horas de diferencia.
Nuestro trabajo está en la intersección de infraestructura cloud, arquitectura de aplicaciones e IA: diseño de arquitectura cloud-native, automatización de infraestructura, plataformas, pipelines de datos e integración de GenAI. No hacemos soporte cloud genérico — construimos y operamos sistemas que necesitan escalar.
Nuestra mayor profundidad es en AWS. También trabajamos con Azure y GCP según el stack que ya tenga el cliente — el objetivo siempre es adaptarnos a tu entorno, no imponer un proveedor.
Sí — es uno de los problemas en los que más trabajamos. Modernizar una aplicación suele implicar alguna combinación de: separar un monolito en servicios, migrar a infraestructura cloud-native, reemplazar dependencias obsoletas o mejorar el pipeline de CI/CD para que el equipo entregue más rápido. Siempre arrancamos con un diagnóstico técnico antes de recomendar un camino.