LINUX.ORG.RU

DeepSeek v4 Flash local inference

 ,


0

3

DeepSeek v4 Flash

Это модель фронтирного уровня. С выходом версии от 0731 - стала даже лучше по benchmark, но на мой взгляд, это benchmaxing По крайней мере, русский у этой модели стал хуже.

Что нужно для инференса в домашних условиях?

Видеокарта современная NVidia от 16Гб (с поддержкой mxfp4) Память - чем быстрее, тем лучше, желательно DDR5 от 128Гб Камень какой-нибудь хотя бы ядер на 8

Какого результата можно добиться?

  • Можно комфортно общаться с сетью, задавать вопросы, получать ответы (замена Google если вопрос касается общеизвестных вещей, фактов итд.)

  • Можно добиться неспешного выполнения агентских задач, например, программирование с использованием OpenCode.

Какая скорость ожидается?

Скорость будет зависеть от железа, конечно же, от применения оптимизаций, а так же от квантования модели.

  • Скорость prefill (чтение промпта) - сотни токенов в секунду (200+)
  • Скорость decode (генерация) - более 10 токенов в секунду - неспешно читаешь и успеваешь обдумывать прочитанное, но не ждешь жадно каждого токена.

Мое железо

Не так давно я приобрел desktop именно под нейросети, хотя уже 20+ лет я пользовался ноутбуками и не было желания поставить себе в комнату большую шумную коробку. Но все изменилось.

  • Процессор Ryzen 9950x3d
  • RAM DDR5-5600 192Гб
  • GPU RTX Pro 4000 Blackwell

Мои результаты

В целом за пару месяцев моих попыток завести эту модель я продвинулся от 8ts до 17ts генерации, от 40ts decode до 360. Сейчас получил такие результаты:

  • Неквантованная модель: 11ts генерация (decode) 250ts промптпроцессинг (prefill)
  • iq3xxs квантованная: 14ts генерация (decode) 360ts промптпроцессинг (prefill)

Параметры

"%LLAMA_PATH%\llama-server.exe" ^
    -m "%MODEL_PATH%" ^
    --no-mmap ^
    --no-repack ^
    --device CUDA0 ^
    --main-gpu 0 ^
    --direct-io ^
    --kv-offload ^
    --fit on ^
    --ctx-size 384000 ^
    --cache-type-k q8_0 ^
    --cache-type-v q8_0 ^
    -fa 1 ^
    --mlock ^
    --parallel 1 ^
    --jinja ^
    --chat-template-file "%TEMPLATE_PATH%" ^
    --temp 0.7 ^
    -t 8 ^
    -b 4096 ^
    -ub 4096 ^
    -lv 4 ^
    --host 0.0.0.0 ^
    --port 1234

Как видим, контекст 384000 токенов - это достаточно хороший объем, чтобы комфортно вести разработку, при этом он квантован до q8, что экономит кучу памяти, но наверное немного добавляет забывчивости. Так же подобраны оптимальные параметры -batch -ubatch 4096. Обратите внимание, -t 8 говорит нам о том, что используются всего 8 ядер процессора. Больше нет смысла - потому что все упирается в пропускную способность памяти, сколько ни ставь - прироста скорости не будет, а может быть даже наоборот. Так что экономим электроэнергию, именно она составляет основную стоимость домашнего инференса.

Экономика

Мне лень подключать компьютер через ваттметр в данный момент, хотя если будет запрос - я это сделаю. В моем компьютере стоит блок питания на 1.2КВт, при этом он взят с запасом под несколько видеокарт. Допустим, при инференсе компьютер потребляет 700Вт, на основе этого можно понять, сколько стоит инференс. Стоимость обычно указывается за 1млн токенов. Возьмем за основу данные - 9ts в среднем (к концу контекста скорость обычно падает) decode - 200ts. Электричество возьмем по 5 ₽ (хотя у меня 3.50 ₽). Расчет такой: считаем, сколько часов нужно, чтобы сгенерировать 1млн токенов и умножаем на стоимость электричества, которое потребит компьютер мощностью 0.7КВт.

  • Стоимость входных токенов : 1 000 000 / (3600 * 200) * 5 * 0.7 = 4.86 ₽
  • Стоимость выходных токенов : 1 000 000 / (3600 * 9) * 5 * 0.7 = 108.02 ₽
  • Стоимость кэша : в подарок (сложно посчитать)

Что предлагают провайдеры? Например, я сейчас пользуюсь одним провайдером, цены:

  • Стоимость входных токенов : 55,75 ₽
  • Стоимость выходных токенов : 167,24 ₽
  • Стоимость кэша : 1,77 ₽

Как видим, получилось даже дешевле!

Но есть еще дополнительная цена - это наличие железа и терпения в ожидании решения задачи. Считаем, что хороший компьютер у вас уже есть. А терпение - это плата за контроль. Здесь вас не отключат, и тем более никто не украдет ваши наработки (да кому они нужны?) Или, постойте… Сейчас идет охота за данными - нейросетевые гиганты скупают книги тоннами и сканируют их, только чтобы накормить свои ненасытные нейросети данными, которых уже сейчас катастрофически не хватает для обучения нейросетей (скормили все, что плохо лежало). Поэтому я не удивлюсь, если провайдеры действительно собирают ваши сессии, а затем продают их в качестве датасетов для обучения нейросетей. Так что куски кода вашего секретного суперпроекта рискуют уже завтра появится в агентской сессии ваших конкурентов.

Как добиться лучших результатов по скорости?

  1. Конечно же, купить несколько видеокарт последнего (Blackwell), пред-последнего (Ada), пред-пред-последнего поколений (Ampere), чтобы поднять VRAM до 128-192 Гб.

  2. Собрать комп на многоканальной памяти - 4, 8, 12… Пусть даже на DDR4. Например, если взять EPYC с памятью на 8 каналов, получаем пропускную способность 200Гб/с - а это уже сравнимо с Ryzen AI, где пропускная способность в районе 250Гб/с!

Предлагаю делиться своими результатами. Быть может вместе мы сможем придумать, как лучше задействовать потенциал нашего железа.



Последнее исправление: EvilSpirit (всего исправлений: 6)
Ответ на: комментарий от Beewek

Там же по ссылке третья цена 0,84 ₽ за чтение кеша как раз.

Вы правы, не заметил.

EvilSpirit
() автор топика
Ответ на: комментарий от gagarin0

у меня разгон процессора дал для дипсика около +70 t/s Prompt eval

Как такое может быть? Слабый процессор? Я убрал половину ядер, результат по скорости такой же. Пишут, что у моего проца только 8 ядер хорошо с памятью общаются, смысла нет больше накидывать. Бутыгорл в пропуспособне. Ну bandwidth bottleneck. С ума сойдешь с этими нейросетями.

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 2)
Ответ на: комментарий от sabacs

А что такое домашние условия?

Это когда у тебя дома нет кластера на H200, а стоит компьютер, запчасти для которого можно купить в местном компьютерном супермаркете.

Кстати, наткнулся на такой вот интересный проектец

https://github.com/shyringo/deepseek-v4-flash-0731-in-c

Небольшой движок инференса со стримингом модели. Вполне запустится CPU при любом объеме оперативной памяти, и будет работать в зависимости от того, насколько у вас быстрый SSD. Я пока не пробовал, но очень хочется.

Автор получил меньше токена в секунду, так что практического интереса данная вещь не представляет, зато поможет скоротать вечер)

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 2)
Ответ на: комментарий от EvilSpirit

Это когда у тебя дома нет кластера на H200, а стоит компьютер, запчасти для которого можно купить в местном компьютерном супермаркете.

А если есть? :) Ведь всё это лишь вопрос денег.

sabacs
()
Ответ на: комментарий от sabacs

А если есть? :) Ведь всё это лишь вопрос денег.

Тогда я вас поздравляю, но в этой теме нам нечем вам помочь, и вам нечем помочь нам) Разве что пришлете 4 cmp, как их там, которые в начале года по 5тыс рублей никто не покупал, а сейчас…

EvilSpirit
() автор топика
Ответ на: комментарий от gagarin0

деньги можно потратить по разному, вы как планируете?

Говорят надо брать RTX 6000 штуки 2 ил RTX 5000 72Gb штуки 4. Типа продал квартиру - купил сервер. Или эти, которые еще в начале года по 5 тыщ продать не могли на авито.

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 2)
Ответ на: комментарий от EvilSpirit

вот тут не совсем понятно, я поясню на примере

один мой знакомый весной очень хотел закупиться железом чтобы запускать локально модели уровня GLM-5.2, для этого требовалось >300GB RAM, а у него на тот момент было ~140GB VRAM.

в августе, выходят Qwen3.8-flash-next, который можно развернуть на 128GB VRAM, которая по бенчмаркам либо лучше, либо на уровне GLM 5.2.

есть над чем подумать, у меня складывается впечатление, что 128GB VRAM + 196GB DDR[45] это идеальная домашняя LLM станция, что будет дальше - покажет только время. я бы точно брал одну RTX 6000 и крутился бы на ней

gagarin0
()
Последнее исправление: gagarin0 (всего исправлений: 4)
Ответ на: комментарий от sabacs

просто так размышлять можно сколько угодно, вопрос всегда в $$$ и в целях, если одного из этих элементов нет, то как говорится, нет ножек - нет мультиков.

gagarin0
()
Ответ на: комментарий от Bad_ptr

А это чем-то отличается от llama-cpp -ngl 0 ?

Если только llama сможет обеспечить работу модели 160Гб при наличии всего 8Гб RAM. Указанный движок такое может. Я попробовал, - работает, но скорость у него и правда отвратительная (меньше токена в секунду). Но для тех, кто тут спорит про домашние условия - вот вам пример, когда можно запустить. «Вот таким нехитрым образом, из буханки хлеба мы сделали троллейбус. Остался один нераскрытый вопрос: Нафига?»

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 1)
Ответ на: комментарий от EvilSpirit

обеспечить работу модели 160Гб при наличии всего 8Гб RAM

А, да, действительно. Хотя вот инетересно, если лламе дать 200гб свопа будет оно быстрее/медленнее. А так, интересно было бы это скрестить с @gagarin0’ским https://github.com/spiritbuun/buun-llama-cpp#deepseek-v4-flash--moe-cache-and-dspark, чтобы оно всё же видяху использовало. У кого есть свободные токены для Fable 5, можете попробуете ему задачку такую дать.

Bad_ptr ★★★★★
()
Ответ на: комментарий от Bad_ptr

У кого есть свободные токены для Fable 5, можете попробуете ему задачку такую дать.

DSV4 такое в принципе делает, если упрется сильно.

Хотя вот инетересно, если лламе дать 200гб свопа будет оно быстрее/медленнее.

Главное чтобы Nvme 14гб/с было. Или Optane Memory

EvilSpirit
() автор топика
Ответ на: комментарий от Beewek

router.ai

Вопрос немного не в тему: а какова юридическая основа этого? Вот там, например, есть передовые модели типа GPT-5.6. Откуда у router.ai к ней доступ? Есть ли гарантия, что доступ не пропадёт?

Я просто как-то не вникал во все эти тонкости, пользовался просто чатом из веб-интерфейса, а сейчас что-то захотелось большего.

И, кстати, второй вопрос: насколько цены сравнимы с ценами «из первых рук»? Т.е. есть ли смысл заморачиваться с оплатой непосредственно OpenAI/Anthropic/etc?

knovich ★★
()
Последнее исправление: knovich (всего исправлений: 2)
Ответ на: комментарий от knovich

Есть ли гарантия, что доступ не пропадёт?

Сам как думаешь? Есть ли гарантия что что-то неприятное для тебя не случится в инфраструктуре, которая тебе не принадлежит?
Гарантия тут зиждется только на том что владельцы этого сервиса хотят денег заработать и что-то придумают даже если их будут блокировать.

Bad_ptr ★★★★★
()
Ответ на: комментарий от Bad_ptr

Тут вопрос про то, насколько законно сейчас то, что они делают. Я понимаю, что могут появиться новые правила, законы и санкции.

в инфраструктуре, которая тебе не принадлежит

Ну я пока не готов покупать видеокарты за миллионы рублей. Я всё-таки довольно эпизодически нейросетями пользуюсь, а на моей 5070 Ti результаты мне не очень понравились.

knovich ★★
()
Ответ на: комментарий от knovich

Какие законы, ты о чём? Многие сервисы блокируют тебя с той стороны без всяких законов. С этой стороны такая же история.

Bad_ptr ★★★★★
()
Ответ на: комментарий от knovich

Ну я пока не готов покупать видеокарты за миллионы рублей. Я всё-таки довольно эпизодически нейросетями пользуюсь, а на моей 5070 Ti результаты мне не очень понравились.

Ну некоторые готовы. Я, например, мониторю цену на cmp170hx. С момента, как узнал о разблокировке. Говорят, цена на нее была в начале года 5тысяч за штуку. Как узнали про разблокировку - стала расти как на дрожжах.. Я начал следить, когда они были примерно по 50к. Сейчас гонка ускорилась, и за последние две недели они подорожали в 4-5 раз, теперь даже за 250к есть предложения. Сегодня я зашел в последний раз понаблюдать за ними, так как стало ясно, что они уже overprice на хайпе. Они того не стоят, за эти деньги уже можно набрать себе 3090, 5060, еще чего-нибудь недорогого. На фоне такой цены можно уже брать всякие DGX Spark или AMD, где много универсальной памяти.

Вообще, конечно китайцы молодцы. Протыкают пузырь искусственного интеллекта своими китайскими иголочками как могут, - и это нам говорит о том, что мы все-таки без ИИ не останемся, и серверы будут работать у нас на нашей инфраструктуре. Так что себе домой можно не запасаться втридорога. К тому же я верю, что можно штамповать чипы прям для конкретной модели - типа DeepSeek v4 Flash 0731 - чип, где гвоздями прибита архитектура, нет памяти - модель туда зашита на постоянку, там нет шины, частот, процессора на миллионы транзисторов - просто блоки MULADD по входным данным прям в слоях, никаких последовательных операций - только параллельное вычисление. И такие чипы будут стоить копейки, их будут детские в игрушки вставлять. И работать они будут быстрее, чем текущие монстры при несравнимо меньшем энергопотреблении.

EvilSpirit
() автор топика
Последнее исправление: EvilSpirit (всего исправлений: 1)
Ответ на: комментарий от knovich

Юридически вряд ли они что-то делают незаконное, поскольку блокировка обычно с той стороны. Насчёт надёжности - посмотри, у них там для каждой модели по нескольку запасных каналов (с другой ценой). Обещают, что если один канал станет недоступен, тебя перебросит на другой. Так что с этой стороны тоже вроде неплохо. По цене - говорят, на четверть дороже, чем если напрямую оплачивать. Но я сам не сравнивал, это просто я повторяю то, что здесь прочитал.

Я там сначала попробовал Клода (очень умный, но деньги съедает махом). А потом переключился на дписика, он чуть послебее, но зато стоит совсем недорого, и всё равно значительно умнее, чем локальные квены3.6-35B/геммы4(9/26).

Beewek ★★★★
()
Ответ на: комментарий от Beewek

поскольку блокировка обычно с той стороны

Я про это как раз спрашивал, да. Про китайские модели всё понятно, что их заблокируют в последнюю очередь. А вот про западные я понял, что есть, например, openrouter, значит, «перепродавать» в принципе не запрещено. Но я не знаю, есть ли какие-то ограничения для российских пользователей в данный момент. Если, например, OpenAI и Anthropic прямо заявляют, что с РФ не работают, то и любые обходы могут прикрыть. А если такого не заявляется, то можно надеяться, что прямо завтра ещё будет доступно.

С другой стороны, конечно, деньги-то на счёте не сгорят, и можно будет перескочить на всякие Kimi, которые сейчас бешено рекламируют.

knovich ★★
()
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария