Компьютерный энтузиаст Оскар Мольнар рассказал, как за 266 долларов собрал систему с 32 ГБ общей видеопамяти для локального запуска больших языковых моделей. Основой проекта стала бывшая в эксплуатации серверная видеокарта Nvidia Tesla V100 SXM2 с 16 ГБ памяти HBM2, которую удалось приобрести по низкой цене вместе с адаптером SXM2-to-PCIe.
Главной проблемой ускорителя оказался штатный вентилятор, уровень шума которого достигал около 82 дБ. Чтобы сделать систему пригодной для повседневного использования, энтузиаст подключил охлаждение к обычному PWM-разъему материнской платы. После доработки вентилятор работал примерно на 10% мощности, сохраняя температуру Tesla V100 ниже 50 градусов даже под полной нагрузкой.
В результате Tesla V100 работала вместе с GeForce RTX 4080, добавив к уже имеющимся 16 ГБ памяти еще 16 ГБ VRAM. Для использования обоих ускорителей Мольнар применил NixOS и совместимый драйвер Nvidia, поддерживающий сразу две разные архитектуры — Volta и Ada.
Получившаяся конфигурация смогла запускать локальную языковую модель с 27 миллиардами параметров, обеспечивая производительность около 32 токенов в секунду. По словам автора проекта, этого достаточно для комфортной интерактивной работы, а скорость оказалась выше, чем у многих облачных сервисов. Энтузиаст отмечает, что подобные серверные ускорители могут стать интересной альтернативой покупке дорогостоящих современных видеокарт для локальной работы с ИИ.




















