Вышла open weight модель Qwen38-27b, пожалуй, новый дефолт для локальных домашних моделей!
Вышла Qwen3.8-27B — 27B dense, vision, 262K контекста и MTP
Qwen наконец выложили Qwen3.8-27B.
Это, пожалуй, самый интересный размер в новой линейке именно с точки зрения локального запуска. 27 миллиардов параметров — это уже достаточно большая модель для серьёзной работы, но ещё не тот случай, когда для запуска нужен небольшой датацентр.
Модель dense, мультимодальная: понимает текст, изображения и видео. Из коробки заявлены coding, research, professional workloads и длинные agentic-задачи.
По архитектуре тоже есть интересные изменения.
Внутри:
- 27B параметров;
- hidden size 5120;
- 64 слоя;
- vocabulary / embedding — 248 320;
- гибрид Gated DeltaNet + обычный Attention;
- схема слоёв:
16 × (3 × DeltaNet → FFN + 1 × Attention → FFN); - FFN — 17 408;
- MTP — Multi-Token Prediction, причём модель обучалась сразу с несколькими prediction steps.
То есть это уже не обычный Transformer, где на каждом слое приходится считать полноценный quadratic attention. Большая часть слоёв использует Gated DeltaNet, а классический attention появляется периодически.
Из практического интереса здесь ещё и MTP. Если inference-движки нормально его реализуют, это потенциально хороший источник дополнительной скорости при локальной генерации.
Контекст
Нативное окно — 262 144 токена.
До 1 000 000 токенов его можно расширить через YaRN. Причём сами Qwen отдельно предупреждают, что статический YaRN может немного ухудшать качество на коротком контексте и рекомендуют включать scaling только тогда, когда он действительно нужен.
Для 524K, например, они рекомендуют factor=2.0, а для миллиона — factor=4.0.
Это приятная деталь: вместо привычного «у нас миллион токенов» мелким шрифтом прямо написано, как этот миллион получается и какие у него есть компромиссы.
Thinking mode
По умолчанию модель работает с reasoning включённым и пишет reasoning в <think>...</think>.
Есть три официальных уровня:
xhigh— максимальное рассуждение, используется по умолчанию;medium— баланс скорости и качества;low— упор на скорость.
Thinking можно полностью отключить.
Ещё появилась интересная штука preserve_thinking: модель по умолчанию сохраняет reasoning из предыдущих сообщений в многоходовом диалоге. В первую очередь это рассчитано на агентов, чтобы модель не начинала каждый следующий шаг размышлять над задачей заново.
А теперь цифры
Официальная таблица Qwen выглядит довольно бодро:
| Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 |
| NL2Repo-Bench | 42.3 | 36.2 | 41.1 | — | 47.6 |
| DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | — | — |
| QwenSWEBench | 79.0 | 49.3 | 59.2 | — | 63.8 |
| CoWorkBench | 70.7 | 61.0 | 65.1 | — | 68.2 |
| JobBench | 33.4 | 21.8 | 27.6 | — | — |
| IFBench | 79.5 | 69.1 | 79.1 | 77.0 | 62.5 |
| GPQA Diamond | 89.2 | 87.8 | 90.3 | 83.5 | 91.3 |
| HLE | 30.8 | 24.0 | 34.7 | 22.0 | 40.0 |
| LiveCodeBench v6 | 90.3 | 83.9 | 89.6 | — | 88.8 |
Для 27B особенно впечатляют результаты по coding.
SWE-bench Pro — 61.7, DeepSWE 1.1 — 42.2, QwenSWEBench — 79.0, LiveCodeBench v6 — 90.3.
Причём это не только задачки вида «напиши функцию сортировки». В таблице отдельно есть repo-level code generation, software engineering и agentic terminal coding.
Vision и computer use
Поскольку модель изначально vision-language, есть отдельная пачка мультимодальных тестов:
| Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|---|
| OSWorld-Verified | 84.3 | 63.9 | 73.3 | 65.9 | 72.7 |
| WebArena-Verified | 64.8 | 48.8 | 55.3 | — | — |
| AndroidWorld | 81.9 | 70.3 | 81.0 | — | 62.0 |
| RecreationBench | 47.1 | 29.8 | 30.2 | — | — |
| SWE-MM | 38.6 | 25.7 | 30.0 | — | 27.1 |
| Vision2Web | 62.9 | 45.0 | 42.1 | — | — |
| OmniDocBench 1.5 | 91.1 | 89.4 | 91.4 | 75.8 | 86.6 |
| RealWorldQA | 85.9 | 84.1 | 86.9 | — | 73.9 |
| ERQA | 65.5 | 62.5 | 69.8 | — | 40.8 |
OSWorld 84.3, WebArena 64.8 и AndroidWorld 81.9 намекают, что модель довольно серьёзно затачивали не просто на чат, а именно на работу агентом с интерфейсами, браузером и приложениями.
Плюс она умеет непосредственно принимать видео. В документации есть отдельный пример работы с video_url, а для длинных видео предусмотрена настройка частоты выборки кадров. Разработчики прямо говорят про обработку видео продолжительностью порядка часа.
Поддержка на старте заявлена для Transformers, vLLM, SGLang и TokenSpeed.
Ждём GGUF :)
Модель:


