Reducción de Costes de Entrenamiento con Amazon SageMaker

El entrenamiento de modelos avanzados de inteligencia artificial, como el recientemente lanzado Llama 3, que cuenta con 70 mil millones de parámetros, plantea considerables desafíos para la computación moderna. Generalmente, estos procesos necesitan de sistemas distribuidos que integran cientos o incluso miles de instancias aceleradas, operando durante períodos prolongados, que en ocasiones se extienden por semanas o meses para completar un único trabajo. Por ejemplo, el preentrenamiento del modelo Llama 3, que requirió el procesamiento de 15 billones de tokens, demandó unas impresionantes 6.5 millones de horas de GPU H100. Este trabajo específico utilizó 256 instancias de Amazon EC2 P5, cada una equipada con 8 GPUs NVIDIA H100, lo que llevó un total aproximado de 132 días en completarse.

Los trabajos de entrenamiento distribuidos se realizan de manera sincrónica, lo que significa que cada etapa de entrenamiento requiere que todas las instancias participantes terminen sus cálculos antes de avanzar al siguiente paso. Esta configuración crea un punto crítico, ya que un fallo en una sola instancia puede interrumpir todo el progreso del entrenamiento. A medida que se incrementa el tamaño del clúster de instancias, también aumenta la probabilidad de fallos, debido a la complejidad y cantidad de componentes de hardware involucrados. La fiabilidad de estos sistemas se mide a través de métricas como el tiempo medio entre fallos (MTBF), lo que pone de manifiesto que un simple fallo de hardware no solo puede provocar la pérdida de horas de GPU, sino que también dilata el tiempo necesario para acomodar y resolver el problema.

Estudios realizados en procesos de entrenamiento, como los llevados a cabo por Meta AI con los modelos OPT-175B y Llama 3.1, indicaron que las tasas de fallo se mantuvieron entre 0.02% y 0.06% por hora. A medida que el tamaño del clúster crece, la probabilidad de fallos también incrementa considerablemente, dado que la entropía del sistema se eleva mientras que el MTBF disminuye. Por ejemplo, utilizando una tasa de fallo del 0.04% por hora, un clúster de 512 instancias podría experimentar un fallo aproximadamente cada cinco horas. Esta tendencia, que muestra el aumento de las tasas de fallo en clústeres más grandes, presenta un desafío significativo para los equipos de ingeniería, quienes necesitan atender rápidamente estos problemas y reducir los tiempos de sustitución.

Para enfrentar estos desafíos, Amazon SageMaker HyperPod se posiciona como una solución innovadora que busca optimizar el tiempo de entrenamiento y minimizar costos operativos. Gracias a su capacidad de automatizar la detección y reemplazo de instancias defectuosas, SageMaker HyperPod permite reanudar el entrenamiento desde el último punto guardado, lo que es crucial en entornos tan intensivos. Mediciones prácticas sugieren que esta plataforma podría reducir el tiempo total de entrenamiento en un 32% en un clúster de 256 instancias, considerando una tasa de fallo del 0.05%. Como resultado, se estima que esto podría generar un ahorro de aproximadamente 25 millones de dólares para las empresas involucradas.

La creciente necesidad de entrenar modelos de inteligencia artificial punteros de manera eficaz obliga a las empresas a buscar soluciones que les permitan concentrarse en la innovación en lugar de en la gestión de la infraestructura. SageMaker HyperPod proporciona a los equipos de IA la tranquilidad de saber que cualquier falla de hardware será manejada automáticamente, lo que reduce significativamente las intervenciones manuales y las interrupciones en el proceso de entrenamiento. Con el apoyo de esta tecnología, las empresas pueden impulsar su potencial de innovación, dedicando más recursos a la creación de modelos avanzados y menos a solventar problemas operativos.

TequilaDigital
Desplazamiento al inicio