Треть выручки российского рынка смартфонов приходится на Apple Треть выручки российского рынка смартфонов приходится на Apple YouTube и есть телевидение YouTube и есть телевидение Kandinsky научили управлять временем Kandinsky научили управлять временем Европа объявила войну умным очкам Европа объявила войну умным очкам

SSD вместо оперативной памяти

1 мин

На обычном MacBook Air с 8 ГБ оперативной памяти запустили ИИ-модель на 26 миллиардов параметров. Обычно в память такого ноутбука она не помещается. Разработчик TurboFieldfare решил проблему иначе – вместо оперативной памяти большую часть модели хранят на SSD и берут оттуда нужные фрагменты во время ответа. Речь идёт о Gemma 4 от Google, но потенциально подобное можно сделать для любой MoE модели.

Gemma 4 хорошо подошла для этого эксперимента, потому что состоит из специализированных блоков и для генерации каждого следующего слова использует только часть из них. Обычно эти блоки заранее загружают в быструю память, но TurboFieldfare действует наоборот: держит их на SSD, сначала определяет, какие понадобятся, после чего считывает с диска. Часто используемые фрагменты остаются в кэше.

Учитывая, что это костыль, без минусов не обошлось. На MacBook Air M2 модель выдаёт около 5–6 токенов в секунду, а на более мощном M3 Max около 23. Если загрузить модель в память целиком, она работает заметно быстрее. С другой стороны, без этого способа запустить модель на подобном железе не выйдет, а 6 токенов в секунду лучше, чем 0. Тем более что это только начала пути, и мы наверняка увидим ещё больше разных оптимизаций под ограничения конкретного железа и локальный запуск. Причём, возможно, даже на уровне больших серверов – всё-таки оперативная память не дешевеет.

// Илья Власов