Почему тысячи GPU начинают ждать друг друга?

343 подписчика

12+
12+

14 часов назад

ПожаловатьсяНарушение авторских прав

343 подписчика

12+
12+

14 часов назад

ПожаловатьсяНарушение авторских прав
12+
12+

14 часов назад

В этом видео разберёмся, почему современные AI-кластеры начинают упираться не только в мощность видеокарт, но и в скорость связи между ними. Когда один GPU заканчивает свою часть работы, ему часто приходится ждать данные от других ускорителей. И чем больше становится система, тем сложнее заставить тысячи отдельных чипов работать как один компьютер. Поговорим о пропускной способности и задержке, о NVLink, InfiniBand, all-reduce и разных типах параллельных вычислений. Разберём, почему модели приходится распределять между множеством GPU, зачем ускорители постоянно синхронизируются и как даже один медленный узел способен замедлить огромный кластер. Вы узнаете, почему увеличение количества GPU не даёт линейного роста производительности, что такое эффективность масштабирования, зачем дата-центрам специализированные сетевые топологии и почему внутренняя сеть AI-суперкомпьютера становится почти такой же важной, как сами вычислители. Покажем, как проблемы памяти, связи, оптики и охлаждения складываются в одну большую инженерную задачу. И главное — почему будущее ИИ зависит не только от того, насколько быстрым будет следующий GPU, но и от того, насколько быстро тысячи ускорителей смогут обмениваться данными и синхронизировать работу.

Название:

Почему тысячи GPU начинают ждать друг друга?

Категория:

Разное