#benchmark

7 публикаций
Как разработчик создал платформу для тестирования локальных моделей AI

Как разработчик создал платформу для тестирования локальных моделей AI

🧪 У разработчика возникли сомнения в тестировании локальных моделей AI. Он понимал, что задача не из лёгких: нужно было ...
Сравнение производительности 7 JS фреймворков с помощью Fable и Opus

Сравнение производительности 7 JS фреймворков с помощью Fable и Opus

🧪 Два мощных инструмента — Fable 5.1 и Opus 5.5 — провели тесты на одном и том же JS-бенчмарке. Они использовали одинако...
Сравнение 24 LLM с человеческими писателями по 475 запросам

Сравнение 24 LLM с человеческими писателями по 475 запросам

🧪 Вышел первый релиз Creative Writing benchmark, в котором сравнили 24 LLM с человеческими писателями по 475 творческим ...
Сравнение локальных моделей: Qwen3.8-Flash-Next NVFP4 против 27B

Сравнение локальных моделей: Qwen3.8-Flash-Next NVFP4 против 27B

🧪 Результаты тестирования впечатляют: Qwen3.8-Flash-Next NVFP4 показал почти самый высокий балл среди всех локальных мод...
Результаты эксперимента QWEN3.8-27B на RTX 6000 Pro

Результаты эксперимента QWEN3.8-27B на RTX 6000 Pro

🧪 Что получится, если протестировать QWEN3.8-27B на RTX 6000 Pro с использованием FP8? Разработчики приглашают участнико...
Обновленный бенчмарк DeepSeek V4 Flash на SlopCodeBench

Обновленный бенчмарк DeepSeek V4 Flash на SlopCodeBench

🧪 Обновленные результаты бенчмарка DeepSeek V4 Flash на SlopCodeBench показывают, что локальный запуск на MacBook M5 Max...
LLMstats: мониторинг моделей Groq и OpenRouter

LLMstats: мониторинг моделей Groq и OpenRouter

🧪 5000 пингов за месяц! Разработан LLMstats — инструмент, который каждые 3 часа проверяет бесплатные модели Groq и OpenR...