LINUX.ORG.RU

DeepSeek v4 Flash local inference

 ,


0

3

DeepSeek v4 Flash

Это модель фронтирного уровня. С выходом версии от 0731 - стала даже лучше по benchmark, но на мой взгляд, это benchmaxing По крайней мере, русский у этой модели стал хуже.

Что нужно для инференса в домашних условиях?

Видеокарта современная NVidia от 16Гб (с поддержкой mxfp4) Память - чем быстрее, тем лучше, желательно DDR5 от 128Гб Камень какой-нибудь хотя бы ядер на 8

Какого результата можно добиться?

  • Можно комфортно общаться с сетью, задавать вопросы, получать ответы (замена Google если вопрос касается общеизвестных вещей, фактов итд.)

  • Можно добиться неспешного выполнения агентских задач, например, программирование с использованием OpenCode.

Какая скорость ожидается?

Скорость будет зависеть от железа, конечно же, от применения оптимизаций, а так же от квантования модели.

  • Скорость prefill (чтение промпта) - сотни токенов в секунду (200+)
  • Скорость decode (генерация) - более 10 токенов в секунду - неспешно читаешь и успеваешь обдумывать прочитанное, но не ждешь жадно каждого токена.

Мое железо

Не так давно я приобрел desktop именно под нейросети, хотя уже 20+ лет я пользовался ноутбуками и не было желания поставить себе в комнату большую шумную коробку. Но все изменилось.

  • Процессор Ryzen 9950x3d
  • RAM DDR5-5600 192Гб
  • GPU RTX Pro 4000 Blackwell

Мои результаты

В целом за пару месяцев моих попыток завести эту модель я продвинулся от 8ts до 17ts генерации, от 40ts decode до 360. Сейчас получил такие результаты:

  • Неквантованная модель: 11ts генерация (decode) 250ts промптпроцессинг (prefill)
  • iq3xxs квантованная: 14ts генерация (decode) 360ts промптпроцессинг (prefill)

Параметры

"%LLAMA_PATH%\llama-server.exe" ^
    -m "%MODEL_PATH%" ^
    --no-mmap ^
    --no-repack ^
    --device CUDA0 ^
    --main-gpu 0 ^
    --direct-io ^
    --kv-offload ^
    --fit on ^
    --ctx-size 384000 ^
    --cache-type-k q8_0 ^
    --cache-type-v q8_0 ^
    -fa 1 ^
    --mlock ^
    --parallel 1 ^
    --jinja ^
    --chat-template-file "%TEMPLATE_PATH%" ^
    --temp 0.7 ^
    -t 8 ^
    -b 4096 ^
    -ub 4096 ^
    -lv 4 ^
    --host 0.0.0.0 ^
    --port 1234

Как видим, контекст 384000 токенов - это достаточно хороший объем, чтобы комфортно вести разработку, при этом он квантован до q8, что экономит кучу памяти, но наверное немного добавляет забывчивости. Так же подобраны оптимальные параметры -batch -ubatch 4096. Обратите внимание, -t 8 говорит нам о том, что используются всего 8 ядер процессора. Больше нет смысла - потому что все упирается в пропускную способность памяти, сколько ни ставь - прироста скорости не будет, а может быть даже наоборот. Так что экономим электроэнергию, именно она составляет основную стоимость домашнего инференса.

Экономика

Мне лень подключать компьютер через ваттметр в данный момент, хотя если будет запрос - я это сделаю. В моем компьютере стоит блок питания на 1.2КВт, при этом он взят с запасом под несколько видеокарт. Допустим, при инференсе компьютер потребляет 700Вт, на основе этого можно понять, сколько стоит инференс. Стоимость обычно указывается за 1млн токенов. Возьмем за основу данные - 9ts в среднем (к концу контекста скорость обычно падает) decode - 200ts. Электричество возьмем по 5 ₽ (хотя у меня 3.50 ₽). Расчет такой: считаем, сколько часов нужно, чтобы сгенерировать 1млн токенов и умножаем на стоимость электричества, которое потребит компьютер мощностью 0.7КВт.

  • Стоимость входных токенов : 1 000 000 / (3600 * 200) * 5 * 0.7 = 4.86 ₽
  • Стоимость выходных токенов : 1 000 000 / (3600 * 9) * 5 * 0.7 = 108.02 ₽
  • Стоимость кэша : в подарок (сложно посчитать)

Что предлагают провайдеры? Например, я сейчас пользуюсь одним провайдером, цены:

  • Стоимость входных токенов : 55,75 ₽
  • Стоимость выходных токенов : 167,24 ₽
  • Стоимость кэша : 1,77 ₽

Как видим, получилось даже дешевле!

Но есть еще дополнительная цена - это наличие железа и терпения в ожидании решения задачи. Считаем, что хороший компьютер у вас уже есть. А терпение - это плата за контроль. Здесь вас не отключат, и тем более никто не украдет ваши наработки (да кому они нужны?) Или, постойте… Сейчас идет охота за данными - нейросетевые гиганты скупают книги тоннами и сканируют их, только чтобы накормить свои ненасытные нейросети данными, которых уже сейчас катастрофически не хватает для обучения нейросетей (скормили все, что плохо лежало). Поэтому я не удивлюсь, если провайдеры действительно собирают ваши сессии, а затем продают их в качестве датасетов для обучения нейросетей. Так что куски кода вашего секретного суперпроекта рискуют уже завтра появится в агентской сессии ваших конкурентов.

Как добиться лучших результатов по скорости?

  1. Конечно же, купить несколько видеокарт последнего (Blackwell), пред-последнего (Ada), пред-пред-последнего поколений (Ampere), чтобы поднять VRAM до 128-192 Гб.

  2. Собрать комп на многоканальной памяти - 4, 8, 12… Пусть даже на DDR4. Например, если взять EPYC с памятью на 8 каналов, получаем пропускную способность 200Гб/с - а это уже сравнимо с Ryzen AI, где пропускная способность в районе 250Гб/с!

Предлагаю делиться своими результатами. Быть может вместе мы сможем придумать, как лучше задействовать потенциал нашего железа.



Последнее исправление: EvilSpirit (всего исправлений: 6)

когда перелез с qwen3.6-27b на deepseek v4 0731 это просто было неба и земля, по бенчмаркам это почти облачная opus 4.8, а это очень хорошо!

я тоже начинал с кванта, контекст 512k

IQ3_XXS получал на своем железе около 45 decode t/s, 700 Prompt eval

основная проблема, слишком много путался в траекториях рассуждения, что приводило к лишней токеногенерцаии и времени.


Q3_X_KL получал около 38 decode t/s, 600 Prompt eval

стало медленнее, а траектории рассуждений все так же могли завернуть не туда


IQ4_XS стало поинтереснее, 30 decode t/s, 450 Prompt eval

стало поумнее, и помедленнее


Q4_K_XL стало очень хороша в рассуждениях, но decode 25 t/s, prompt eval 320 t/s :(

на этом кванте я и сижу, чего и автору топика советую, автор топика видимо не нагуглил основную профит Q4_K_XL, я не знаю как это правильно трактовать, но Q4_K_XL максимально близка по характеристикам к Q8_X_KL, привожу таблицу:

QuantРазмерMean KLD ↓KLD 99.9% ↓PPL ↓Top-1 match ↑Практическая оценка
UD-IQ1_S82.5 GB0.6615511.36678.093272.30%слишком сильная деградация
UD-IQ1_M86.9 GB0.5896210.45557.738474.08%экспериментальный минимум
UD-IQ2_XXS90.9 GB0.484879.78377.090976.60%заметно повреждён
UD-IQ2_M90.9 GB0.483889.72457.089476.56%почти то же
UD-Q2_K_XL96.8 GB0.407669.05576.678278.57%минимально приемлемый
UD-IQ3_XXS104.2 GB0.307897.77326.197281.93%performance quant
UD-IQ3_S116.1 GB0.268957.31906.026683.06%небольшой шаг вверх
UD-Q3_K_M128.1 GB0.157344.95715.702887.06%хороший Q3
UD-Q3_K_XL128.2 GB0.157514.97085.708587.05%хороший баланс Q3
UD-IQ4_XS136.7 GB0.115253.91215.552288.79%★ сильный баланс
UD-IQ4_NL136.7 GB0.115253.91215.552288.79%фактически = IQ4_XS
UD-Q4_K_XL155.1 GB0.013240.55125.338096.04%★ почти reference
UD-Q8_K_XL161.9 GB≈00.00015.3322100%lossless reference

«%LLAMA_PATH%\llama-server.exe»

это во первых выкинуть вместе с виндой, и запустить llama-server отсюда

https://github.com/spiritbuun/buun-llama-cpp

там появилаь опция –moe-cache, когда экперты кешируются в RAM, это сходу дало мне на LDDR4 +25% к decode t/s

и да, переход на cuda12 с cuda13 дал мне 10-15% для Prompt eval

на всякий случай мой конфиг:

(я использовал llama-fit-params для лучшего расположения весов в VRAM)

[
  "--model",
  "/models/DeepSeek-V4-Flash-0731/UD-Q4_K_XL/DeepSeek-V4-Flash-0731-UD-Q4_K_XL-00001-of-00005.gguf",
  "--alias",
  "deepseek-v4-flash-q4-k-xl",
  "--host",
  "0.0.0.0",
  "--port",
  "8080",
  "--ctx-size",
  "524288",
  "--n-predict",
  "8192",
  "--parallel",
  "1",
  "--device",
  "CUDA0,CUDA1",
  "--split-mode",
  "layer",
  "--n-gpu-layers",
  "44",
  "--tensor-split",
  "14,30",
  "--fit",
  "off",
  "-ot",
  "blk\\.13\\.ffn_(gate|up|gate_up|down).*=CUDA1,blk\\.25\\.ffn_(gate|up|gate_up|down).*=CPU,blk\\.20\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.21\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.22\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.23\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.24\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.25\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.26\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.27\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.28\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.29\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.30\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.31\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.32\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.33\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.34\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.35\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.36\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.37\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.38\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.39\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.40\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.41\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.42\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU,blk\\.43\\.ffn_(up|down|gate_up|gate)_(ch|)exps=CPU",
  "--moe-cache",
  "on",
  "--moe-cache-expert-parallel",
  "0",
  "--flash-attn",
  "on",
  "--kv-offload",
  "--cache-type-k",
  "q4_0",
  "--cache-type-v",
  "q4_0",
  "--batch-size",
  "4096",
  "--ubatch-size",
  "1024",
  "--no-mmap",
  "--jinja",
  "--reasoning",
  "on",
  "--reasoning-format",
  "deepseek",
  "--reasoning-budget",
  "4096",
  "--reasoning-budget-message",
  "Enough reasoning. Provide the final answer now.",
  "--threads",
  "18",
  "--threads-batch",
  "18",
  "--numa",
  "isolate",
  "--prio",
  "2",
  "--poll",
  "100",
  "--poll-batch",
  "1",
  "--temp",
  "0.6",
  "--top-p",
  "0.95",
  "--top-k",
  "20",
  "--min-p",
  "0",
  "--repeat-penalty",
  "1",
  "--presence-penalty",
  "0",
  "--frequency-penalty",
  "0",
  "--metrics",
  "-lv",
  "4"
]


gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 3)

Звучит интересно, но из моего опыта добиться реально комфортной работы с локальными моделями можно только если железа накупить на миллионы рублей.

Поэтому просто пользуюсь подпиской за 20$ на Codex для личных нужд и более чем хватает. На работе есть отдельная корпоративная подписка на OpenAI модели.

anonymous
()
Ответ на: комментарий от anonymous

на начало весны, чтобы добиться нормальной работы надо было ~750к рублей. сейчас это стало еще дороже.

но надо учитывать что умелые руки научились «разлочивать» nvidia 120 cmp карты до 60-80 гб NVRAM, а стояли они на начало июля около 80-100к на авито, но есть нюансы

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 1)

Что предлагают провайдеры? Например, я сейчас пользуюсь одним провайдером, цены:

Стоимость входных токенов : 55,75 ₽

Стоимость выходных токенов : 167,24 ₽

Стоимость кэша : 1,77 ₽

Это у тебя очень жадный провайдер. Вот совсем другие цены: 3.62р/9р.

Beewek ★★★★
()
Последнее исправление: Beewek (всего исправлений: 1)
Ответ на: комментарий от gagarin0

Q4_K_XL стало очень хороша в рассуждениях, но decode 25 t/s, prompt eval 320 t/s :(

Вы умолчали, какие у вас ведьмокарточки.

«CUDA0,CUDA1», Вижу, что две.

На самом деле tg вообще мало волнует, если бы он кушал контексты быстро и не перекешировал, было бы вообще шикарно. 25 - это вообще нормально. Там вроде флаг есть для того, чтобы не терял кэш по ходу генерации, но он жрет очень уж много VRAM и все перестает совсем шевелиться.

EvilSpirit
() автор топика
Ответ на: комментарий от EvilSpirit

Вы умолчали, какие у вас ведьмокарточки.

Что взять для нейронок?! (комментарий)

не только в видеокарточках дело, но и в памяти и внезапно в CPU

На самом деле tg вообще мало волнует,

вот здесь не понял.

быстро и не перекешировал

попробуйте pi.dev

gagarin0
()
Ответ на: комментарий от gagarin0

автор топика видимо не нагуглил основную профит Q4_K_XL, я не знаю как это правильно трактовать, но Q4_K_XL максимально близка по характеристикам к Q8_X_KL, привожу таблицу:

Я и сейчас не понимаю профит, сижу на максимальной. Попробовал минимально-рекомендуемую, не устроило - по скорости не намного лучше получилось, а тупит сильнее.

это во первых выкинуть вместе с виндой, и запустить llama-server отсюда

https://github.com/spiritbuun/buun-llama-cpp

спасибо, попробую.

EvilSpirit
() автор топика
Ответ на: комментарий от gagarin0

не только в видеокарточках дело, но и в памяти и внезапно в CPU

Нет, проблема в том, что

nvidia 120 cmp карты

очень дорогие. накопить теперь на них надо что ли.

Что взять для нейронок?! (комментарий)

Хех, так 2 4090, это понятно почему быстрее. Это космос по цене, на них можно взять пару вышеуказанных и проблема как бы отвалится сама собой - там и tg и pp и concurrent на vllm будет суммарно под 32 клиента…. я тогда под них агента напишу, который за пять минут софтину будет разрабатывать сначала до конца.

На самом деле tg вообще мало волнует, вот здесь не понял.

tg - token generation (decode) pp - preprocess (prefill)

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 1)
Ответ на: комментарий от EvilSpirit

Я и сейчас не понимаю профит, сижу на максимальной

я специально вам привел табличку, вы видимо «по старой памяти», думаете что между q4 и q8 квантами пропасть, посмотрите внимательно на KLD между этими квантами, она практически минимальна, это особенность именно 0740 модели от дипсика, попробуйте выкачать q4_k_xl и если у вас есть «тестовые» задания - погонять ее.

tg - token generation (decode) pp - preprocess (prefill)

спасибо я в курсе, но все равно не понимаю вашего утверждения

На самом деле tg вообще мало волнует

как вы могли заметить, дипсики очень «прожорливы» на подумать, а это как раз таки TG, а prompt’ы надо кешировать в RAM (посмотрите как я запускаю модель)

и еще используйте llama-fit-params он эффективно распределить слои модели в памяти

Самый дельный совет, купите доступ до облачной frontier хорошей модели, запустите у себя агента и настройте на нее, подключите MCP сервер с веб-поиском и скачиванием результата в .md формате и попросите облачную модель чтобы она настроила вам deepseek под ваше железо оптимальным образом, первым делом, модель снимет у вас baseline метрики (исходный, который вы сейчас получаете), и потом позапускает llama-fit-params чтобы найти оптимальные параметры, и в конце запустить около 20 разных конфигураций и опций и через бенчмарки выяснит наиболее производительную конфигурацию. (я советую дать задание сделать три профиля, prefill, balance, perfomance)

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 1)
Ответ на: комментарий от EvilSpirit

прощу прощения, я не правильно распарсил изначально ваш пост, думал что вы используйте

UD-Q8-X-KL, а вы используйте IQ3_XXS с Q8 квантованием, по этому пункту вопросов у меня нет,

как писал выше с IQ3_XXS я начал свое знакомство с дипсиком, и получил впечатляющие результаты по сравнению с Qwen36-27b, и Gemma-4-31B, но заметил что модель на моих задача (например в домашней лабе надо было найти сетевую проблему), путалась сама в рассуждениях, часть из них забывала, потом вспоминала, потом забывала что вспомнила и т.д.

Собственно эту задачу (диагностика сетевой проблемы) использовал как бенчмарк, в итоге получил следующее:

IQ3_XXS прогнал два раза, первый раз прогон занял около 4,5 часа, а второй я остановил, потому что модель «залупилась», она постоянно думала по кругу 4 «траекторий», "надо сходить на роутер, надо сходить на свитч, надо сходить на ноду1, надо сходить на ноду2, надо сходить на роутер, и.т.д. Проблему диагностировала правильно, потратила около 380k токенов

опущу мои эксперименты с Q3_X_KL, IQ4_XS, и перейду к

Q4_X_KL модель потратила 1,5 часа (при этом decode/prefill были в примерно в 2 раза меньше чем у IQ3_XXS), и около 130k токенов, нашла проблему и правильно определила причину.

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 3)

Сколько людей убил/продал почек, чтобы купить столько видюх? j/k :P

В облаке наверное точно дешевле бы вышло.

Ради интереса посчитал

при подписке OpenCode Go первый месяц стоит $5, а дальше $10/мес. Курс USD/RUB сейчас около 84,5 ₽ (курс ЦБ на 26 августа).

Вариант 1 — платите напрямую (иностранная карта/крипта, без посредника):

1-й месяц: 5 × 84,5 ≈ 425 ₽
Далее: 10 × 84,5 ≈ 845 ₽/мес

При бюджете 150 000 ₽: (150 000 − 425) / 845 ≈ 176 месяцев, итого около 177 месяцев ≈ 14,5–15 лет.

Вариант 2 — через посредника (например, Oplatym.ru с комиссией), у которого для платежей до ~1300 ₽ фиксированная комиссия ~350 ₽:

1-й месяц: 425 + 350 ≈ 775 ₽
Далее: 845 + 350 ≈ 1195 ₽/мес

(150 000 − 775) / 1195 ≈ 125 месяцев, итого около 126 месяцев ≈ 10,5 лет.

Я взял за бюджет NVidia карточку на 16 гб. Она примерно столько стоит.

Skullnet ★★★★★
()
Последнее исправление: Skullnet (всего исправлений: 3)
Ответ на: комментарий от Skullnet

Сколько людей убил/продал почек, чтобы купить столько видюх?

убил 1242 комаров, и продал 12.3кг стриженных ногтей

В облаке наверное точно дешевле бы вышло.

Тут интересный момент, дело не только в $$$ (хотя дело всегда в $$$), я покупал эту конфигурацию для

  1. для того чтобы получить себе в помощники LLM уровня начинающий senior (в программировании) для пет-проджектов и средний senior в администрировании, k8s, devops для домашней лабы

  2. переложить свои рабочие задачи (по работе) на LLM, policy мне не позволяет использовать облачные модели, но это правило не распространяется на self-hosted модели, и теперь я около 80% работы делаю промптингом.

  3. чтобы иметь опыт с установкой и настройкой LLM, в принципе эти скиллы будут востребованы в ближайшее время, а теми что я владею, будут терять актуальность все больше и больше.

Выгода в том насколько «локальная» LLM сняла с меня когнитивной нагрузки и высвободила времени - то я уже «в плюсе». а прошло всего около 3 месяцев.

Ещё не чекал https://huggingface.co/Qwen/Qwen3.8-Flash-Next ?

Нет, надо посмотреть, как говорится ждем .gguf

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 3)
Ответ на: комментарий от gagarin0

я специально вам привел табличку, вы видимо «по старой памяти», думаете что между q4 и q8 квантами пропасть, посмотрите внимательно на KLD между этими квантами, она практически минимальна

Вы видимо смотрите только на кванты, а не смотрите на размер. Там эти кванты только на определенную часть весов, которая экономит всего 7 Гб.

For lossless DeepSeek, use Q8 (UD-Q8_K_XL), which is only 7GB larger than Q4 (UD-Q4_K_XL)

Поэтому не вижу смысла использовать не loseless.

спасибо я в курсе, но все равно не понимаю вашего утверждения

Идея в том, что любой ценой надо поднимать prefill, даже если decode 10 токенов, с высоким prefill можно делать дела.

как вы могли заметить, дипсики очень «прожорливы» на подумать,

Да не же, просто не надо его в максимальный режим вводить, он там начинает уже накручивать себе. Умная модель тем и умна, что ей и рассуждений меньше надо. Кроме того у меня есть идея, что размышления вообще надо генерировать кодом (вариации) и вводить через prefill большую портянку, чтобы decode выбрал один хороший вариант… А, это уже за пределами нашей темы.

Самый дельный совет, купите доступ до облачной frontier хорошей модели

Возможно, но сам DeepSeek с этой задачей не справился. Хотя он себя расколупал, исходники расколупал, мы даже с ним стриминг moe на видюху написали (llama.cpp переписали), изучили топ экспертов, вроде как можно топ экспертов держать на видюхе… но идея так себе, потому что эксперты послойные, и там короче… беда.

бенчмарки выяснит наиболее производительную конфигурацию

Чессслово, какая там конфигурация, если из дополнительных видеокарт (Кроме RTX4000) только P100 (огонь, кстати, для своей цены, в нее Qwen 27b входит и неплохо шевелится) и cmp50hx на 20 гб (полное разочарование)

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 2)
Ответ на: комментарий от gagarin0

а второй я остановил, потому что модель «залупилась», она постоянно думала по кругу 4 «траекторий»

Температура у поциента какая? Небось DSpark и околонулевая? От лукавого это. Разные задачи требуют разной температуры, и уж точно не нуль. Поэтому считаю, что DSpark для мамкиных инференсеров, которые гонятся за fps tps.

Q4_X_KL модель потратила 1,5 часа

А какое у нее преимущество по сравнению с Q8, кроме того, что она на 7Гб меньше? Насколько на быстрее?

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 1)
Ответ на: комментарий от Skullnet

В облаке наверное точно дешевле бы вышло.

Например, если ты работаешь в компании, которая тебе не разрешает отправлять исходники секретного проекта третьим лицам, облако тебе не поможет. И при этом у тебя такая зарплата, что ты прям можешь себе позволить купить почку сердце видеокарту. 11 токенов в секунду это блин на 10 токенов быстрее, чем рядовой программист работает. Можно конечно ручками, но уже влом.

EvilSpirit
() автор топика
Ответ на: комментарий от EvilSpirit

Небось DSpark и околонулевая?

я привел свою конфигурацию полнолстью, и там нет ни MTP, ни Dspark, ни Dspark2, если нажмете развернут на моем первом комментарии, то увидите

 "--temp",
  "0.6",
  "--top-p",
  "0.95",
  "--top-k",
  "20",
  "--min-p",
  "0",

А какое у нее преимущество по сравнению с Q8, кроме того, что она на 7Гб меньше? Насколько на быстрее?

я не замерял Q8, а 7GB меньше дает разные размеры экспертов, что позволяет их «по разному» уместить в VRAM и более эффективно использовать память.

gagarin0
()
Ответ на: комментарий от gagarin0

«–temp»,

«0.6»,

Там 1.0 что ли рекомендуют для агентских задач. У DeepSeek вроде перплексити хорошая, так что 1.0 наверное не так страшно, бредить не начнет. Но это все равно кванты, я бы не связывался.

7GB меньше дает разные размеры экспертов, что позволяет их «по разному» уместить в VRAM и более эффективно использовать память.

Да там разницы нет, сколько экспертов в VRAM, пока они не все. Там главное ускорение - это контекст в VRAM. Говорят, если moe выгрузить на CPU - даже быстрее получается, но у меня не получилось. Поэтому в первом посте я пишу про 16Гб - то, что дает ускорение - помещается в 16Гб (ну примерно). А выгружаешь ты 1 слой или 6 - это копейки. По скорости даже 3 битная версия не сильно быстрее (14 vs 11). А prefill лучше на мелкой только из-за CUDA Pinned memory, которая на винде только половину разрешает (96Гб)

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 1)
Ответ на: комментарий от Skullnet

Ещё не чекал https://huggingface.co/Qwen/Qwen3.8-Flash-Next ?

Качаю уже, есть надежда, что Q4 позволит запуститься на cmp50hx (DeepSeek mxfp4 нормально не работает на 2080), а с ней у меня 44Гб VRAM, это уже что-то.

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 1)
Ответ на: комментарий от EvilSpirit

я проводил множество тестов при помощи облачной LLM, разные размеры экспертов, разные параметры -ot дают разные результаты, в итоге я на пустом месте для IQ3_XXS выиграл 8 tg/s.

Если вам нужен prefill, то увеличивайте UBATCH, через llama-fit-params определите как лучше распределить слои, UBATCH напрямую влияет на prompt eval, хотя я вижу у вас ubatch и так выкручен на 4096, дальше OOM?

Там 1.0 что ли рекомендуют для агентских задач. У DeepSeek вроде перплексити хорошая, так что 1.0 наверное не так страшно, бредить не начнет. Но это все равно кванты, я бы не связывался.

у меня 0 проблем с вызовами агентов.

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 2)
Ответ на: комментарий от gagarin0

Если вам нужен prefill, то увеличивайте UBATCH, через llama-fit-params определите как лучше распределить слои, UBATCH напрямую влияет на prompt eval

Да я уже подобрал 4096

EvilSpirit
() автор топика
Ответ на: комментарий от gagarin0

хотя я вижу у вас ubatch и так выкручен на 4096, дальше OOM?

Дальше tg 8ts вместо 11, важные для скорости веса уходят в RAM.

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 3)
Ответ на: комментарий от EvilSpirit

я бы все равно поэкспериментировал с облачной LLM, которая поднастроила deepseek под ваши нужды, я сначала пару выходных потратил на подбор параметров руками, а потом за 4.5 часа и 20$ чат гопота (codex) решила мою проблему.

gagarin0
()
Ответ на: комментарий от Skullnet

удивительно, судя по бенчам, Qwen3.8-Next-Flash опережает дипсик 0731 практически во всем. качаемс…

https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek-V4-Flash-0731Claude-Opus-4.6 (Max)
# Params125B27B397B284B
# Activated params6B27B17B13B
# N-gram embedding params51B
Coding
Agentic coding — DeepSWE 1.158.742.216.554.4
Agentic coding — SWE-bench Pro62.561.755.856.053.4
Multilingual software engineering — SWE-bench Multilingual81.073.875.877.5
Repo-level code generation — NL2Repo-Bench48.142.341.154.247.6
Agent
Long-horizon office work — CoWorkBench73.970.765.145.168.2
Professional job tasks — JobBench55.733.427.641.336.6
Frontier agentic tasks — Agents’ Last ExamPass@1 24.3, Score 51.2Pass@1 20.4, Score 42.9Pass@1 13.2, Score 33.6Pass@1 25.2, Score –
Real-world tool use — Toolathlon Verified (Pass@1)73.567.150.670.3
General
Instruction following — IFBench81.379.579.179.262.5
Scientific reasoning — GPQA Diamond91.789.290.390.891.3
Multidisciplinary reasoning — HLE35.930.834.733.840.0
Competitive coding — LiveCodeBench v691.990.389.690.688.8

Vision Language

BenchmarkQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude-Opus-4.6 (Max)
ClawEval-MM — Multimodal tool usePass@3 64.4, Avg 60.4Pass@3 57.4, Avg 56.9Pass@3 57.4, Avg 60.1Pass@3 52.5, Avg 54.7
RecreationBench — Application recreation49.947.130.2
AndroidWorld — Mobile use84.581.981.062.0
gagarin0
()
Ответ на: комментарий от gagarin0

удивительно, судя по бенчам, Qwen3.8-Next-Flash опережает дипсик 0731 практически во всем. качаемс…

Я тоже повелся, но я не доверяю этим benchmaxingам, пока сам не проверю. Нормальная модель должна все нормально уметь - и в поэзию, и в кодинг, и дурака валять…

EvilSpirit
() автор топика
Ответ на: комментарий от EvilSpirit

Например, если ты работаешь в компании, которая тебе не разрешает отправлять исходники секретного проекта третьим лицам, облако тебе не поможет. И при этом у тебя такая зарплата, что ты прям можешь себе позволить купить почку сердце видеокарту. 11 токенов в секунду это блин на 10 токенов быстрее, чем рядовой программист работает. Можно конечно ручками, но уже влом.

Да про приватность я понимаю. Я сам гоняю Qwen3.6 35B A3B и Apodex 1.1 Mini локально. У меня RTX 3060 Ti 8GB VRAM и 32 GB RAM, но по меркам топикстартера я - нишеброд. Кстати, они неплохо выполняют задачи.

Skullnet ★★★★★
()
Ответ на: комментарий от EvilSpirit

вот тут я не согласен, вместе с индустрией, индустрия наоборот сворачивает к уменьшению моделей, чтобы каждая решала свой «домен», а не универсальные, раздутые, во всяком случае гугл в этом направлении копает. например я буду очень рад модели из которой поэзия полностью «выпилена».

gagarin0
()

–ctx-size 384000

Кстати, даже в облаке контекст в 2 раза меньше этого. Когда достигается лимит, модель просто делает summary по сделанным задачам, а контекст по видимости стирает.

Skullnet ★★★★★
()
Ответ на: комментарий от Skullnet

Qwen3.6 35B A3B

Кстати, они неплохо выполняют задачи.

Это самое самое самое начало, фактически первая локальная модель, из тех, что я тестировал, которая хоть что-то может с тулзами делать стабильно. Неплохая, да, очень быстрая (у меня фигачит 140ts, префилл там на тысячи). Но она откровенно слабая для настоящей работы. Сайт может сделать простой, может игрушку какую-нибудь. Но настоящая крутая модель - она прям в разы умнее. Там еще OSS была и Gemma, но они слабее, на мой взгляд, хуже делают работу, нестабильные. Может дело было в квантах, может не разобрался.

EvilSpirit
() автор топика
Ответ на: комментарий от gagarin0

вот тут я не согласен, вместе с индустрией, индустрия наоборот сворачивает к уменьшению моделей, чтобы каждая решала свой «домен», а не универсальные, раздутые, во всяком случае гугл в этом направлении копает. например я буду очень рад модели из которой поэзия полностью «выпилена».

Понимаете, я считаю, что интеллект - это общее свойство. Если ты ничего кроме кодинга не умеешь, то значит и кодинг ты умеешь посредственно. Так же и с моделями. Если научить модель только на коде - она смысла задачи понимать не будет. (я обучал маленькую модель, я знаю, что с ними бывает, если их обучать на либрусек - они превращаются в малохольных писателей-графоманов)

EvilSpirit
() автор топика
Ответ на: комментарий от EvilSpirit

Если ты ничего кроме кодинга не умеешь, то значит и кодинг ты умеешь посредственно.

я примерно понимаю эту мысль, но не уверен что она верна. я бы с удовольствием бы использовал модель которая понимает производный «запрос» и умеет например только «администрировать» сервера с агент тулингом.

gagarin0
()
Ответ на: комментарий от gagarin0

я примерно понимаю эту мысль, но не уверен что она верна. я бы с удовольствием бы использовал модель которая понимает производный «запрос» и умеет например только «администрировать» сервера с агент тулингом.

Я понимаю, что есть желание «отрезать лишнее», оставить только администрирование. Но я не уверен, что это возможно, как уже написал, если обучать модель только на администрировании, она будет его делать очень хорошо, но не так, не то и не всегда. Возьмите чисто кодера на 4b, он так резво пишет код, так круто, но ни одну творческую задачу не решит.

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 1)
Ответ на: комментарий от EvilSpirit

да, я понимаю, там нужно тактическое/стратегическое зрение/внимание, с подтверждением теорий, или как-то так (на самом деле я в этом мало что шарю).

gagarin0
()
Ответ на: комментарий от Beewek

А Qwen3.8-Flash-Next - можно

Можно. Для неё нужно всего от 75 ГБ, а архитектура (GDN+QSA) как раз спроектирована так, что unified memory работает почти так же хорошо, как VRAM. Судя по таблице бенчмарков она ещё и обгоняет DeepSeek V4 Flash по большинству метрик (агентный кодинг, tool use), кроме отдельных пунктов вроде NL2Repo-Bench.

Skullnet ★★★★★
()
Ответ на: комментарий от Beewek

Где взять такого кодера? :)

Ну поищите, там тысячи их на 2-4b. Толку только от них?

EvilSpirit
() автор топика
Ответ на: комментарий от gagarin0

нужно ~300GB VRAM

речь наверное все же не идет о тестировании дома, наверное в облаке. но ситуация сейчас такая, что моделей много, а памяти мало) Все не перетестируешь! Остается верить бенчмаркам.

EvilSpirit
() автор топика
Ответ на: комментарий от gagarin0

запустил я qwen38-flash-next Q4_X_KL, f16

получил примерно 37 decode, 770 prompt eval, бодренько, тестирую..

У меня 14 decode 500 prefill на полном контексте. Q4_X_KL вообще-то это не то же самое, что MXFP4. Надежда на то, что модель действительно более умная, и не потеряла его от переквантования.

UPD: В процессе работы упал по OOM, так как достиг границы pinned memory, пришлось выгружать в обычную, а там prefill упал до 360, так что модель по производительности не превзошла DeepSeek v4 Flash. Ну разве что чуть чуть.

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 2)
Ответ на: комментарий от Beewek

Это у тебя очень жадный провайдер. Вот совсем другие цены: 3.62р/9р.

Возвращаюсь с обратной связью. Цена указана без учета кэша, то есть тарифицируется каждый запрос, даже если cachehit. По факту особой разницы в итоговой стоимости нет, по сравнению со мной приведенными ценами, если работаешь с проектом, который постоянно попадает в кэш. Если все время дергаешь AGENTS.md - то наверное дешевле получится. Но в обычных сценариях деньги улетают примерно с одинаковой скоростью.

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 1)

А что с влиянием разгона хотя бы процессора?

(ОЗУ как понимаю набрана 4 плашками, следовательно неразгоняема...)

Ненавидию тоже в lact`е не пожарить?

hargard ★★★
()
Ответ на: комментарий от hargard

у меня разгон процессора дал для дипсика около +70 t/s Prompt eval

LACT не надо ничего прожаривать, а лучше наоборот, сделать undervoltage, power limit и fan curve, ты потеряешь 5% производительности, но в замен продлишь жизнь своей видеокарте + экономия по электричеству.

gagarin0
()
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария