7900 XTX Quants — Сравнение 7900 XTX: два кванта Qwen 3.8 против обычного
🧪 В ходе эксперимента выяснили, что новые кванты Qwen 3.8 действительно производят меньше токенов. В среднем, базовый квант генерирует около 66k токенов, в то время как ThinkingCap и Swift выдают 49k и 45k соответственно. Интересно, что в скорости декодирования Swift показывает наибольшее снижение, но в предзаполнении он стал самым быстрым. ThinkingCap, напротив, медленнее всех в предзаполнении, но завершает общий процесс быстрее. Качество моделей остаётся на уровне 84-87, что сопоставимо с базовым вариантом. Полные данные запуска можно посмотреть здесь.
Источник:
www.reddit.com