Назад к ленте

RAM Pooling for AI Models — Как объединение оперативной памяти помогает запускать большие модели AI

RAM Pooling for AI Models — Как объединение оперативной памяти помогает запускать большие модели AI
🛠 Сложности с ростом цен на оперативную память заставили разработчика искать нестандартные решения. Вместо покупки новой машины, он начал объединять RAM старых устройств. В последнем тесте модель на 30B запустилась на мини-компьютере с 12 ГБ и Mac mini с 5.5 ГБ, обеспечив производительность в 30 токенов в секунду. Интересно, что устройство для хранения базы знаний можно отделить от модели — это позволяет более мощному компьютеру сосредоточиться на выводе, а менее мощному — хранить документы. Разработчик также добавил шаг восстановления данных, если одно из устройств отключится. Вопрос: кто-то пробовал хранить RAG индекс в RAM на нескольких машинах вместо векторной БД на диске?
Источник: www.reddit.com

Похожие проекты