LINUX.ORG.RU

Вышла open weight модель Qwen38-27b, пожалуй, новый дефолт для локальных домашних моделей!

 ,


3

3

Вышла Qwen3.8-27B — 27B dense, vision, 262K контекста и MTP

Qwen наконец выложили Qwen3.8-27B.

Это, пожалуй, самый интересный размер в новой линейке именно с точки зрения локального запуска. 27 миллиардов параметров — это уже достаточно большая модель для серьёзной работы, но ещё не тот случай, когда для запуска нужен небольшой датацентр.

Модель dense, мультимодальная: понимает текст, изображения и видео. Из коробки заявлены coding, research, professional workloads и длинные agentic-задачи.

По архитектуре тоже есть интересные изменения.

Внутри:

  • 27B параметров;
  • hidden size 5120;
  • 64 слоя;
  • vocabulary / embedding — 248 320;
  • гибрид Gated DeltaNet + обычный Attention;
  • схема слоёв: 16 × (3 × DeltaNet → FFN + 1 × Attention → FFN);
  • FFN — 17 408;
  • MTP — Multi-Token Prediction, причём модель обучалась сразу с несколькими prediction steps.

То есть это уже не обычный Transformer, где на каждом слое приходится считать полноценный quadratic attention. Большая часть слоёв использует Gated DeltaNet, а классический attention появляется периодически.

Из практического интереса здесь ещё и MTP. Если inference-движки нормально его реализуют, это потенциально хороший источник дополнительной скорости при локальной генерации.

Контекст

Нативное окно — 262 144 токена.

До 1 000 000 токенов его можно расширить через YaRN. Причём сами Qwen отдельно предупреждают, что статический YaRN может немного ухудшать качество на коротком контексте и рекомендуют включать scaling только тогда, когда он действительно нужен.

Для 524K, например, они рекомендуют factor=2.0, а для миллиона — factor=4.0.

Это приятная деталь: вместо привычного «у нас миллион токенов» мелким шрифтом прямо написано, как этот миллион получается и какие у него есть компромиссы.

Thinking mode

По умолчанию модель работает с reasoning включённым и пишет reasoning в <think>...</think>.

Есть три официальных уровня:

  • xhigh — максимальное рассуждение, используется по умолчанию;
  • medium — баланс скорости и качества;
  • low — упор на скорость.

Thinking можно полностью отключить.

Ещё появилась интересная штука preserve_thinking: модель по умолчанию сохраняет reasoning из предыдущих сообщений в многоходовом диалоге. В первую очередь это рассчитано на агентов, чтобы модель не начинала каждый следующий шаг размышлять над задачей заново.

А теперь цифры

Официальная таблица Qwen выглядит довольно бодро:

BenchmarkQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus 4.6 Max
Terminal Bench 2.173.063.464.051.778.2
SWE-bench Pro61.753.557.651.253.4
NL2Repo-Bench42.336.241.147.6
DeepSWE 1.142.213.314.2
QwenSWEBench79.049.359.263.8
CoWorkBench70.761.065.168.2
JobBench33.421.827.6
IFBench79.569.179.177.062.5
GPQA Diamond89.287.890.383.591.3
HLE30.824.034.722.040.0
LiveCodeBench v690.383.989.688.8

Для 27B особенно впечатляют результаты по coding.

SWE-bench Pro — 61.7, DeepSWE 1.1 — 42.2, QwenSWEBench — 79.0, LiveCodeBench v6 — 90.3.

Причём это не только задачки вида «напиши функцию сортировки». В таблице отдельно есть repo-level code generation, software engineering и agentic terminal coding.

Vision и computer use

Поскольку модель изначально vision-language, есть отдельная пачка мультимодальных тестов:

BenchmarkQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus 4.6 Max
OSWorld-Verified84.363.973.365.972.7
WebArena-Verified64.848.855.3
AndroidWorld81.970.381.062.0
RecreationBench47.129.830.2
SWE-MM38.625.730.027.1
Vision2Web62.945.042.1
OmniDocBench 1.591.189.491.475.886.6
RealWorldQA85.984.186.973.9
ERQA65.562.569.840.8

OSWorld 84.3, WebArena 64.8 и AndroidWorld 81.9 намекают, что модель довольно серьёзно затачивали не просто на чат, а именно на работу агентом с интерфейсами, браузером и приложениями.

Плюс она умеет непосредственно принимать видео. В документации есть отдельный пример работы с video_url, а для длинных видео предусмотрена настройка частоты выборки кадров. Разработчики прямо говорят про обработку видео продолжительностью порядка часа.

Поддержка на старте заявлена для Transformers, vLLM, SGLang и TokenSpeed.

Ждём GGUF :)

Модель:

https://huggingface.co/Qwen/Qwen3.8-27B



Последнее исправление: gagarin0 (всего исправлений: 1)
Ответ на: комментарий от PPP328

Сколько требует памяти

Qwen36-27b (предыдущая) у меня отлично работала на q8 (с максимальным контекстом в 256к) и занимала около 40GB VRAM

Чтобы оценить память, нужно подождать пока сделают квантование, примерные цифры такие

GGUFОжидаемый размер
Q4_0~15–16 GB
Q4_K_M~16–17 GB
Q5_K_M~19–20 GB
Q6_K~22–23 GB
Q8_0~29–30 GB
BF16~55–56 GB

насколько зацензуренная?

цензура определенно есть, нужно подождать некоторое время пока появятся fine-tuning версии heretic и uncensored (для qwen36-27b над этим работали два разных человека)

Классический тест всех китайских моделей на вопрос о событиях в Китае 1989 года не пройден, цензура сработала

https://i.redd.it/ylmi4dw8pdjh1.png

gagarin0
() автор топика
Последнее исправление: gagarin0 (всего исправлений: 2)

Читаю и думаю - «Хренасе Дядя Степа прокачался! Наконец то начал читаемые новости делать.». Дочитал доконца, а там не он… Давненько я до конца не дочитывал новости.

LightDiver ★★★★★
()
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария