Тестирование Qwen3.6-35B-A3B
Удивительный прогресс всего за несколько месяцев в развитии моделей и llama.cpp. До этого я тестировал модель Qwen3.6-27B, она не влезала в мои 16 гигабайт видеопамяти, работала довольно медленно, генерация была 12-18 токенов в секунду.
С моим тестовым заданием (маркдаун редактор на Rust и GTK под Linux) она справилась за примерно 20 часов.
Как эксперимент было интересно, но с практической точки зрения бесполезно. Слишком долго.
И вот за это время и вышла модель Qwen3.6-35B-A3B на архитектуре MoE - 35B параметров всего, но на каждый токен активируется только ~3B (8 routed-экспертов + 1 shared из 256). За счёт этого модель работает как значительно более лёгкая по вычислениям, сохраняя при этом качество, близкое к куда более крупным моделям того же класса. В llama.cpp появилась и поддержка этой архитектуры, и куча улучшений производительности, и MTP (Multi-Token Prediction) — дополнительная "голова" предсказания нескольких токенов вперёд, обученная вместе с моделью. MTP даёт ~1.4-2.2x ускорение генерации без потери точности, хотя для MoE-моделей прирост обычно скромнее (~1.15-1.25x).
Так вот, сегодня я решил этой модели скормить своё тестовое задание. Предварительно Claude Code погонял разные тесты и нашёл оптимальные настройки для этой модели.
Сказать, что я удивлён, ничего не сказать. Во-первых, модель целиком влезает в видеопамять. Во-вторых, я получил размер контекста 256k, чего ранее с другими моделями не бывало (даже с небольшими моделями были проблемы).
Скорость обработки промпта примерно 260-400 токенов в секунду. Скорость генерации на пустом контексте была под 100 токенов в секунду, по мере заполнения контекста скорость снизилась до 62-65 токенов в секунду. Но это всё равно чертовски быстро.
От первого промпта до запуска приложения, в котором был кривой и неработающий UI, модель 27B у меня добралась часов за 10. Модель 35B сегодня добралась за 50 минут!
Я воодушевился скоростью, начал говорить модели что исправить и всего за 4 часа получил приложение, которое работает и в котором исправлены все огрехи, даже мелочи.
Интересно будет теперь погонять эту модель на своих реальных проектах. Кто знает, может мечта о годной локальной модели для кода не так уж и далека от осуществления.