Огромный спрос на вычисления для дата-центров, преодолевает новые барьеры.

  • Автор записи:
  • Рубрика записи:Блог

Термин «стена памяти» был придуман в начале 1990-х годов для описания узкого места в производительности компьютеров: разрыва в скорости работы процессоров и пропускной способностью подсистемы памяти (в частности, «оперативки» DRAM). Эта предпосылка быстро вошла в инженерный лексикон, а сама оперативная память с её ограничениями, стала восприниматься, как отстающая технология, снижающая эффективность вычислений. Эта стена сохраняется, но в эпоху искусственного интеллекта метафора приобретает новое значение, поскольку DRAM и высокоскоростная память на её основе (HBM) стремятся удовлетворить стремительно растущие потребности для больших языковых моделей (LLM).

За последние 30 лет производители удовлетворяли требования масштабируемости и производительности серверов и компьютеров, благодаря инновационным методам, таким как иерархия кэша, предварительная выборка и метод организации доступа к памяти, названный чередованием (или расслоением). Разработчики создали более крупные и быстрые кэши на кристалле и внедрили методы прогнозирования и предварительной загрузки данных до того, как они понадобятся. Однако это не решило фундаментальную проблему масштабируемости пропускной ёмкости. Современные быстро развивающиеся нейросети создают беспрецедентную нагрузку на способность традиционных архитектур памяти увеличивать емкость в опережении спроса на хранение данных. Признаки этого повсюду — рост стоимости проектирования и производства DRAM и HBM, увеличение энергопотребления и тепловыделения в центрах обработки данных, а также сокращение возможностей роста и масштабируемости.

Моделирование при использовании искусственного интеллекта переопределяет приоритеты поиска данных. Ограничения, накладываемые на оперативную и графическую (GDDR) память, даже с удвоенной скоростью передачи данных, возникают по мере того, как LLM-модели увеличиваются с миллиардов до триллионов параметров. В то же время размеры контекста для вывода результата по запросу — обусловленные сложными подсказками, генерацией с расширенным поиском (RAG), рассуждениями по принципу цепочки мыслей и данными, специфичными для пользователя, — часто требуют кэшей типа «ключ-значение» (KV), размеры которых превышают размеры самих моделей.

Архитектура DRAM, используемая сегодня в качестве системной памяти, менее актуальна для задач вывода результатов большой языковой моделью (такой, например, как ChatGPT), которые преимущественно связаны с чтением и устойчивостью к задержкам. Это происходит благодаря предсказуемым шаблонам доступа к памяти, позволяющим осуществлять предварительную выборку и буферизацию. Но даже такой подход делает узкую ориентацию HBM на пропускную способность недостаточной для задач, требующих, как повышенной ёмкости, так и пропускной способности.

Эти проблемы подчёркивают необходимость разработки принципиально новых архитектур (либо вообще принципов работы оперативной памяти), которые оптимизируют эти показатели, приблизив их к вычислительным мощностям процессоров, специально для систем искусственного интеллекта. Вместо того чтобы полагаться на согласованные, удобные для кэширования шаблоны доступа, модели обрабатывают сильно варьирующиеся и многомерные типы данных. Доступ к памяти при этом является детерминированным, удобным для предварительной выборки и отличается высокой степенью детализации. Всё это делает иерархии кэширования менее актуальными, чем чистая последовательная пропускная способность.

В результате, вычислительная парадигма ИИ достигает успеха не за счет грубого увеличения пропускной способности памяти, а посредством оптимизации времени и способа извлечения данных. В этом контексте такая парадигма позволяет использовать альтернативные технологии, разработанные для повышения ёмкости и последовательной пропускной способности, как более разумный способ решения этой проблемы. Новая задача заключается в оптимизации мозаики потоковых данных, а не в линейном увеличении скорости обмена информацией.

Исторически сложилось так, что проектировщики центров обработки данных решали проблему дисбаланса между вычислительными мощностями и потребностями в памяти путем разделения и распределения рабочих нагрузок по выполнению задач искусственного интеллекта между несколькими дорогостоящими акселераторами. Этот метод часто приводил к нерациональному использованию вычислительных мощностей, но дополнительные затраты и энергопотребление оправдывались, если их распределять между крупными дата-центрами с большой базой пользователей, запросы которых можно было обрабатывать большими партиями. Только когда распределённая обработка стала применяться к небольшим ЦОДам с ограниченной базой серверов, обслуживающим разрозненных клиентов, пакетная обработка стала неэффективной.

По мере роста сложности задач, высокоскоростная флэш-память становится альтернативой. В отличие от DRAM и HBM, которые являются дорогостоящими, энергоёмкими и имеют ограниченный объём, высокоскоростная флэш-память использует преимущества высокой плотности NAND. Благодаря использованию методов многослойной компоновки и соединения пластин, таких как технология CMOS, непосредственно соединенная с массивом (CBA), эти новые архитектуры демонстрируют большую эффективность, чем HBM.

Хотя задержка во флэш-памяти выше, чем в DRAM, рабочие нагрузки при выполнении задач искусственного интеллекта всё чаще зависят от пропускной способности, а не от задержки. В новых конструкциях используется технология NAND высокой плотности, разработанная для таких задач при операциях чтения с большой детализацией. Происходит это за счёт одновременного доступа к нескольким массивам ячеек, что делает их подходящими для хранения данных LLM и выполнения задач с интенсивным чтением. В условиях использования оперативки, где рассеивание энергии очень велико, термическая стабильность при высоких температурах является крайне важным требованием. NAND-технология потенциально более стабильна и лучше подходит для таких условий, чем традиционная DRAM. Энергонезависимость и повышенная износостойкость также позволяют использовать данные кэша KV (ключ-значение) повторно, имитируя долговременную память.

Поскольку потребности в вычислительных ресурсах для ИИ продолжают расти, использование исключительно DRAM и HBM может ограничить архитектурные инновации. Высокоскоростная флэш-память предлагает разработчикам центров обработки данных и устройств для периферийных вычислений ИИ масштабируемую и эффективную альтернативу, адаптированную к меняющимся потребностям, где производительность определяется не задержкой, а эффективностью управления данными.