Назад к ленте

Как Model Grafting преобразует Qwen3.5-4B в причинный энкодер-декодер

Как Model Grafting преобразует Qwen3.5-4B в причинный энкодер-декодер
🛠 Недавно была представлена новая архитектура DeepSeek-V4.1-Flash, демонстрирующая работу причинного энкодера-декодера. Однако теперь метод Model Grafting позволяет преобразовать существующую модель, такую как Qwen3.5-4B. Он включает в себя обрезку модели и использование нижних слоев для обработки промпта, в то время как верхние слои отвечают за поток остатков энкодера. Созданы две варианта: graft8 с ускорением ~3.7x и graft16 с 2.0x ускорением, минимально теряющими точность. Подробности можно найти в блоге здесь.
Источник: www.reddit.com

Похожие проекты