О чём рассказывается в презентации:
Презентация посвящена архитектуре GLaM, которая использует подход Mixture-of-Experts для эффективного масштабирования языковых моделей. В ней рассматриваются преимущества разреженной активации, позволяющей существенно увеличить количество параметров модели при снижении вычислительных затрат. Также обсуждаются ограничения плотных моделей и возможности GLaM в контексте энергозатрат и производительности.


