Новый бенчмарк SWE-sweep для обнаружения ошибок в коде
🧪 Новый бенчмарк SWE-sweep, созданный совместно с учеными из Meta, Стэнфорда и Гарварда, показывает впечатляющие результаты. Модели Luna и Sol успешно находят и исправляют ошибки в коде, прежде чем пользователи столкнутся с ними. Интересно, что Luna xhigh демонстрирует высокую эффективность, получая почти половину от результата Sol при значительно меньших затратах. Полный рейтинг и подробности о создании бенчмарка можно найти на сайте. SWE-sweep также открыт для всех желающих. Открытый код доступен на GitHub. Готов ответить на вопросы!
Источник:
www.reddit.com