LINUX.ORG.RU

Вышла open weight модель Qwen38-27b, пожалуй, новый дефолт для локальных домашних моделей!

 ,


7

4

Вышла Qwen3.8-27B — 27B dense, vision, 262K контекста и MTP

Qwen наконец выложили Qwen3.8-27B.

Это, пожалуй, самый интересный размер в новой линейке именно с точки зрения локального запуска. 27 миллиардов параметров — это уже достаточно большая модель для серьёзной работы, но ещё не тот случай, когда для запуска нужен небольшой датацентр.

Модель dense, мультимодальная: понимает текст, изображения и видео. Из коробки заявлены coding, research, professional workloads и длинные agentic-задачи.

По архитектуре тоже есть интересные изменения.

Внутри:

  • 27B параметров;
  • hidden size 5120;
  • 64 слоя;
  • vocabulary / embedding — 248 320;
  • гибрид Gated DeltaNet + обычный Attention;
  • схема слоёв: 16 × (3 × DeltaNet → FFN + 1 × Attention → FFN);
  • FFN — 17 408;
  • MTP — Multi-Token Prediction, причём модель обучалась сразу с несколькими prediction steps.

То есть это уже не обычный Transformer, где на каждом слое приходится считать полноценный quadratic attention. Большая часть слоёв использует Gated DeltaNet, а классический attention появляется периодически.

Из практического интереса здесь ещё и MTP. Если inference-движки нормально его реализуют, это потенциально хороший источник дополнительной скорости при локальной генерации.

Контекст

Нативное окно — 262 144 токена.

До 1 000 000 токенов его можно расширить через YaRN. Причём сами Qwen отдельно предупреждают, что статический YaRN может немного ухудшать качество на коротком контексте и рекомендуют включать scaling только тогда, когда он действительно нужен.

Для 524K, например, они рекомендуют factor=2.0, а для миллиона — factor=4.0.

Это приятная деталь: вместо привычного «у нас миллион токенов» мелким шрифтом прямо написано, как этот миллион получается и какие у него есть компромиссы.

Thinking mode

По умолчанию модель работает с reasoning включённым и пишет reasoning в <think>...</think>.

Есть три официальных уровня:

  • xhigh — максимальное рассуждение, используется по умолчанию;
  • medium — баланс скорости и качества;
  • low — упор на скорость.

Thinking можно полностью отключить.

Ещё появилась интересная штука preserve_thinking: модель по умолчанию сохраняет reasoning из предыдущих сообщений в многоходовом диалоге. В первую очередь это рассчитано на агентов, чтобы модель не начинала каждый следующий шаг размышлять над задачей заново.

А теперь цифры

Официальная таблица Qwen выглядит довольно бодро:

BenchmarkQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus 4.6 Max
Terminal Bench 2.173.063.464.051.778.2
SWE-bench Pro61.753.557.651.253.4
NL2Repo-Bench42.336.241.1—47.6
DeepSWE 1.142.213.314.2——
QwenSWEBench79.049.359.2—63.8
CoWorkBench70.761.065.1—68.2
JobBench33.421.827.6——
IFBench79.569.179.177.062.5
GPQA Diamond89.287.890.383.591.3
HLE30.824.034.722.040.0
LiveCodeBench v690.383.989.6—88.8

Для 27B особенно впечатляют результаты по coding.

SWE-bench Pro — 61.7, DeepSWE 1.1 — 42.2, QwenSWEBench — 79.0, LiveCodeBench v6 — 90.3.

Причём это не только задачки вида «напиши функцию сортировки». В таблице отдельно есть repo-level code generation, software engineering и agentic terminal coding.

Vision и computer use

Поскольку модель изначально vision-language, есть отдельная пачка мультимодальных тестов:

BenchmarkQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus 4.6 Max
OSWorld-Verified84.363.973.365.972.7
WebArena-Verified64.848.855.3——
AndroidWorld81.970.381.0—62.0
RecreationBench47.129.830.2——
SWE-MM38.625.730.0—27.1
Vision2Web62.945.042.1——
OmniDocBench 1.591.189.491.475.886.6
RealWorldQA85.984.186.9—73.9
ERQA65.562.569.8—40.8

OSWorld 84.3, WebArena 64.8 и AndroidWorld 81.9 намекают, что модель довольно серьёзно затачивали не просто на чат, а именно на работу агентом с интерфейсами, браузером и приложениями.

Плюс она умеет непосредственно принимать видео. В документации есть отдельный пример работы с video_url, а для длинных видео предусмотрена настройка частоты выборки кадров. Разработчики прямо говорят про обработку видео продолжительностью порядка часа.

Поддержка на старте заявлена для Transformers, vLLM, SGLang и TokenSpeed.

Ждём GGUF :)

Модель:

https://huggingface.co/Qwen/Qwen3.8-27B

★

Последнее исправление: gagarin0 (всего исправлений: 1)
Ответ на: комментарий от PPP328

Сколько требует памяти

Qwen36-27b (предыдущая) у меня отлично работала на q8 (с максимальным контекстом в 256к) и занимала около 40GB VRAM

Чтобы оценить память, нужно подождать пока сделают квантование, примерные цифры такие

GGUFОжидаемый размер
Q4_0~15–16 GB
Q4_K_M~16–17 GB
Q5_K_M~19–20 GB
Q6_K~22–23 GB
Q8_0~29–30 GB
BF16~55–56 GB

насколько зацензуренная?

цензура определенно есть, нужно подождать некоторое время пока появятся fine-tuning версии heretic и uncensored (для qwen36-27b над этим работали два разных человека)

Классический тест всех китайских моделей на вопрос о событиях в Китае 1989 года не пройден, цензура сработала

https://i.redd.it/ylmi4dw8pdjh1.png

gagarin0 ★
() автор топика
Последнее исправление: gagarin0 (всего исправлений: 2)
Ответ на: комментарий от James_Holden

нет ножек - нет мультиков

gagarin0 ★
() автор топика
Последнее исправление: gagarin0 (всего исправлений: 1)

Читаю и думаю - «Хренасе Дядя Степа прокачался! Наконец то начал читаемые новости делать.». Дочитал доконца, а там не он… Давненько я до конца не дочитывал новости.

LightDiver ★★★★★
()
Ответ на: комментарий от gagarin0
> ollama pull qwen3.8:27b
pulling manifest 
pulling ac3714bfddde: 100% ▕███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ ▏ 931 MB/931 MB  8.4 MB/s      0s
pulling f5f1dd8920d4: 100% ▕███████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████ ▏  16 GB/ 16 GB   11 MB/s      0s
verifying sha256 digest 
writing manifest 
success 
unclestephen ★★★★★
()
Ответ на: комментарий от gagarin0

Классический тест всех китайских моделей на вопрос о событиях в Китае 1989 года не пройден, цензура сработала

Подозреваю, что по крайней мере в том виде как на скриншоте, данная цензура должна элементарно обходиться. Правда бредогенератор я не запускал и не собираюсь, так что проверять ничего не буду.

firkax ★★★★★
()
Ответ на: комментарий от firkax

данная цензура должна элементарно обходиться.

Правда бредогенератор я не запускал

я так полагаю что своим обходишься?

gagarin0 ★
() автор топика
Ответ на: комментарий от yvv1

В общем, выглядит как будто эта моделька вполне подойдёт для имплементации чётко сформулированных небольших задач, что очень круто. Для планирования, разработки архитектуры и оркестрации агентов всё равно нужна большая облачная модель.

yvv1 ★★
()
Ответ на: комментарий от gagarin0

Да и частичный оффлоадинг на GPU помогает только быстро контекст разбирать, если видеопамяти только 8G. Да =(

anonymous
()
Ответ на: комментарий от gagarin0

А можете посоветовать модель для современных Ryzen 7, чтобы как-то можно использовать? Хочу локальную LLM загрузить созданием аннотаций текстов.

Ну или где это можно посмотреть. Конечно, можно спросить у нелокальных моделей. Но реальный опыт интереснее.

vitruss ★★★★★
()
Последнее исправление: vitruss (всего исправлений: 1)
Ответ на: комментарий от vitruss

Cpu не супер важен, весь упор в память, так что чем меньше модель тем лучше.
Для хорошего русского языка выбор мелких моделей не велик, считай только гемма.

vazgen05 ★★★
()

попробовал qwen38-27B, мои впечатления:

сделал контекст в 514k, по памяти это заняло около 80GB VRAM, Q8 с MTP + компьютерное виденье (mmproj)

справилось с первого раза с задачей которая не поддалась deepseek v4 0731 IQ3_XXS, с разработкой GUI приложения, впечатления положительные, контекста потрачено на 404k, время около 4ч30м, токеногеренация на этом этапе составила около 20t/s (в начале задачи 45 t/s, prompt eval около 4000 t/s).

gagarin0 ★
() автор топика
Последнее исправление: gagarin0 (всего исправлений: 3)

Хорошая модель, да. По бенчмаркам только так 3.6-35B-A3B разносит, а ещё полгода назад была достойнейшая модель. Жду квантов теперь.

Из недостатков: она всё оверсынкает до такого абсурда, что дефолт надо выставлять максимум на medium.

einszwei
()
Последнее исправление: einszwei (всего исправлений: 1)
Ответ на: комментарий от einszwei

читал по диагонали после того как увидел что автор тестирует на Q4. на Q8 не заметил таких проблем, да thinking явно стало больше по сравнению с qwen3.6-27b, но по сравнению с deepseek v4 flash 0731 это детский лепет :)

gagarin0 ★
() автор топика

Вот это интересно https://wccftech.com/alibabas-tsmc-built-5nm-risc-v-chip-xuantie-c950-now-runs-qwen-3-8-27b-model-natively-unlocking-massive-vertical-integration-tailwinds/

5-нанометровый чип XuanTie C950 на архитектуре RISC-V, разработанный TSMC для Alibaba, теперь изначально поддерживает модель Qwen-3.8 27B, открывая широкие возможности для вертикальной интеграции

Компания Alibaba внедрила поддержку своей последней модели Qwen-3.8 27B на чипе XuanTie C950, обеспечив скорость декодирования 30 токенов в секунду и время до первого токена (Time To First Token, TTFT) всего 1,9 секунды.

Чип представляет собой 64-битный процессор RISC-V серверного уровня с 64 вычислительными ядрами, расположенными на одном кристалле, с масштабируемой тактовой частотой до 3,20 ГГц и несколькими кластерами по 8 ядер в каждом, которые изначально связаны между собой с помощью высокоскоростных матриц AMBA CHI. Более того, для выполнения ресурсоемких задач, связанных с искусственным интеллектом, в чип встроены механизмы матричного и векторного ускорения, что избавляет от необходимости использовать графические процессоры.

yvv1 ★★
()

Источник:
https://www.reddit.com/r/LocalLLaMA/comments/1vvu15m/qwen3827b_one_week_later_the_rlocalllama/

TL;DR

Qwen3.8-27B выглядит одной из лучших локальных моделей именно для agentic coding.

Главное улучшение относительно Qwen3.6 — не столько «IQ модели», сколько:

  • стабильный tool calling;
  • длинные agent loops;
  • лучшее продолжение работы после результатов tools;
  • меньше развала workflow;
  • хорошая работа с MCP/RAG/search;
  • возможность долго автономно выполнять задачу.

Практически это выглядит так:

Qwen3.6 хорошо решает отдельную задачу.
Qwen3.8 лучше управляет процессом решения задачи.


Reasoning effort важнее quant

Заводской default — xhigh, но он часто неоправданно дорогой.

Один из тестов:

effortthinking tokensвремяscore
low4.4k112 сек21.8
medium5.9k127 сек22.5
xhigh39.4k718 сек24.0

xhigh потратил примерно 6.4× больше времени ради небольшого улучшения результата.

В других тестах xhigh потреблял в 7–11× больше reasoning tokens.

Практический вывод:

  • low — простые задачи;
  • medium — хороший default для agentic workload;
  • xhigh — сложный debugging, SWE, поиск всех ошибок, задачи с чётко проверяемым правильным ответом.

Q4 оказался почти не хуже Q8

Perplexity:

QuantразмерPPL
Q8_027.0 GB6.956
Q4_K_M17.1 GB6.958
IQ4_XS14.6 GB7.013
Q3_K_XL12.5 GB7.111
NVFP414.4 GB7.200

Q4_K_M практически совпадает с Q8_0.

В большом task-level benchmark:

  • AWQ INT4 — 90.0%
  • NVFP4 — 89.3%
  • GGUF Q4_K_M — 89.3%
  • FP8 — 88.7%
  • NInfer — 88.0%

Главный вывод:

Разница между reasoning presets зачастую больше, чем разница между quant’ами.

При этом для очень длинных agent sessions Q6 всё ещё может быть безопаснее Q4 из-за сообщений о reasoning loops.


KV cache лучше квантовать осторожно

Для agent loops разумный минимум:

Q4 weights + Q8 KV

Если VRAM позволяет — FP16 KV ещё лучше, особенно на очень длинном контексте.

Экономить память за счёт KV зачастую опаснее для качества, чем квантовать сами веса.


Важная проблема: chat template

У официального шаблона Qwen3.8 нашли несколько проблем:

  • enable_thinking=false может работать некорректно;
  • multi-turn history загрязняется пустыми think-блоками;
  • tool call arguments иногда ломаются;
  • system messages внутри истории могут теряться;
  • длинные agent loops начинают деградировать.

В Pi также наблюдали странное поведение, когда модель во время reasoning начинала придумывать несуществующие user instructions.

Комьюнити рекомендует исправленные шаблоны:

froggeric/Qwen-Fixed-Chat-Templates

Для agentic использования это стоит проверить одним из первых пунктов.


Tool calling сильно зависит от описания tools

Интересный эксперимент:

  • 8 плохо описанных tools → нужный tool: 0/6;
  • тот же tool отдельно → 15/15;
  • 13 tools, нужный в середине → 0/5;
  • нужный tool переставили ближе к концу → 3/3.

Практические выводы:

  • каждый tool должен иметь хорошее description;
  • не перегружать description примерами;
  • критичные tools имеет смысл размещать ближе к концу списка;
  • слишком большое количество похожих MCP tools ухудшает routing.

Производительность

На RTX 4090:

  • UD-Q4_K_XL + MTP, 130k ctx → ~60 t/s;
  • Q4_K_XL + DFlash2, 250k ctx → ~73.7 t/s;
  • 150k + Q8 KV → ~75 t/s;
  • 90k + FP16 KV → ~80.6 t/s.

На RTX PRO 6000:

  • DFlash2 → ~153.9 t/s;
  • coding workload + ngram → до ~304.9 t/s.

DFlash2 выглядит одним из самых интересных ускорений:

  • примерно 2.2–4.7× ускорение на подходящих workload;
  • цена — около +2.7 GB VRAM;
  • n-max=5 в некоторых тестах оказался лучше 7.

Где Qwen3.8 хуже Qwen3.6

Есть regression в factual recall / знаниях из весов.

Qwen3.8 чаще ведёт себя примерно так:

«Не знаю — воспользуюсь search/tool/RAG».

Вместо:

«Попробую вспомнить ответ из параметров модели».

Поэтому модель особенно хорошо раскрывается при наличии:

  • web search;
  • MCP;
  • RAG;
  • repository search;
  • documentation search.

Практический конфиг для agentic workload

Для Pi / coding agent разумная стартовая точка:

Qwen3.8-27B Q4/Q6 → Q8 KV → fixed chat template → reasoning_effort=medium → MCP / web / search доступны постоянно

xhigh использовать как escalation mode, например когда:

  • medium не может найти bug;
  • тесты несколько раз не проходят;
  • агент повторяет одинаковые проверки;
  • результаты противоречат друг другу;
  • нужен exhaustive debugging.

Главный вывод

Qwen3.8-27B — это не столько скачок в качестве отдельных ответов относительно Qwen3.6, сколько заметный скачок в agency.

Для локального coding agent важнее всего оказались:

  1. правильный reasoning_effort;
  2. хороший chat template;
  3. качественные descriptions MCP/tools;
  4. web/RAG/search;
  5. только потом — выбор между близкими quant’ами;
  6. DFlash2 для ускорения decode.
gagarin0 ★
() автор топика
Последнее исправление: gagarin0 (всего исправлений: 1)
Ответ на: комментарий от gagarin0

применил рецепты описанные в этом выше:

чтобылостало
decode45 t/s91 t/s
prompt eval2100 t/s1800 t/s

полый кофниг запуска

image: llama-cpp:dflash2-pr27342-cuda12-sm89
container_name: qwen38-27b
restart: unless-stopped
gpus: all
environment:
  CUDA_DEVICE_ORDER: PCI_BUS_ID
  NVIDIA_DRIVER_CAPABILITIES: compute,utility
ports:
  - 8093:8080
volumes:
  - /var/lib/llama-cpp/models:/models:ro
  - /var/lib/llama-cpp/cache/qwen38-27b:/root/.cache/llama.cpp
command:
  - --model
  - /models/Qwen3.8-27B/Qwen3.8-27B-Q8_0.gguf
  - --spec-draft-model
  - /models/Qwen3.8-27B-DFlash2/Qwen3.8-27B-DFlash2-Q4_K_M.gguf
  - --alias
  - qwen38-27b
  - --ctx-size
  - '524288'
  - --n-predict
  - '8192'
  - --parallel
  - '1'
  - --device
  - CUDA0,CUDA1
  - --split-mode
  - layer
  - --tensor-split
  - 1,1
  - --n-gpu-layers
  - all
  - --main-gpu
  - '0'
  - --flash-attn
  - 'on'
  - --spec-type
  - draft-dflash
  - --spec-draft-n-max
  - '6'
  - --spec-draft-ngl
  - all
  - --cache-type-k
  - q8_0
  - --cache-type-v
  - q8_0
  - --spec-draft-type-k
  - f16
  - --spec-draft-type-v
  - f16
  - --batch-size
  - '4096'
  - --ubatch-size
  - '1024'
  - --jinja
  - --reasoning
  - 'on'
  - --reasoning-budget
  - '-1'
  - --rope-scaling
  - yarn
  - --rope-scale
  - '2'
  - --yarn-orig-ctx
  - '262144'
  - --override-kv
  - qwen35.context_length=int:524288
  - --temp
  - '1.0'
  - --top-k
  - '20'
  - --top-p
  - '0.95'
  - --min-p
  - '0'
  - --presence-penalty
  - '0'
  - --repeat-penalty
  - '1.0'
  - --poll
  - '100'
  - --poll-batch
  - '1'
  - --metrics
  - --no-webui
  - --host
  - 0.0.0.0
  - --port
  - '8080'
healthcheck:
  test:
    - CMD
    - curl
    - -fsS
    - http://127.0.0.1:8080/health
  interval: 30s
  timeout: 10s
  retries: 5
  start_period: 300s
gagarin0 ★
() автор топика
Последнее исправление: gagarin0 (всего исправлений: 1)
Ответ на: комментарий от gagarin0

Спасибо за содержательное сравнение, хотя непричастным может показаться, что приведённый текст является просто портянкой ИИ бреда. В принципе что и ожидалось, в эпоху перехода к агентам модель улучшает именно управление, а значит теряет в глубине поиска. Это и подтверждено. Также продолжается тенденция того, что локальные модели, пусть через время и с потреблением большего ресурса, догоняют по возможностям коммерческие модели - здесь мы видим упор на агентов. Мы движемся к тому, что и то и другое должно работать вместе, когда черновую работу проделывает дешёвая локальная модель, а финальный результат или комплексные агенты выполняет коммерческая.

VIT ★★★
()
Ответ на: комментарий от Beewek

Это для чего конфиг?

это кусок от файла docker-compose.yml, все модели запускаю внутри докера, так удобнее менять версии llama-cpp и cuda

reasoning_effort?

у свежей llama-cpp это работает из коробки и настраивается аргументом

--reasoning-effort low|medium|high
gagarin0 ★
() автор топика
Ответ на: комментарий от Beewek

Или переменной окружения или из консоли /effort. Зависит от того, как вы используете модель и effort чего вы хотите установить.

VIT ★★★
()
Ответ на: комментарий от anonymous

на ноутбуке не советовал бы, чтобы минимально получать маломальский профит тебе нужна конфигурация где будет 24-32GB VRAM, можно обойтись и 16GB VRAM, и то что не поместится в видео память выгружать в RAM, но ты потеряешь в скорости.

gagarin0 ★
() автор топика
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария