DeepSeek v4 Flash
Это модель фронтирного уровня. С выходом версии от 0731 - стала даже лучше по benchmark, но на мой взгляд, это benchmaxing По крайней мере, русский у этой модели стал хуже.
Что нужно для инференса в домашних условиях?
Видеокарта современная NVidia от 16Гб (с поддержкой mxfp4) Память - чем быстрее, тем лучше, желательно DDR5 от 128Гб Камень какой-нибудь хотя бы ядер на 8
Какого результата можно добиться?
-
Можно комфортно общаться с сетью, задавать вопросы, получать ответы (замена Google если вопрос касается общеизвестных вещей, фактов итд.)
-
Можно добиться неспешного выполнения агентских задач, например, программирование с использованием OpenCode.
Какая скорость ожидается?
Скорость будет зависеть от железа, конечно же, от применения оптимизаций, а так же от квантования модели.
- Скорость prefill (чтение промпта) - сотни токенов в секунду (200+)
- Скорость decode (генерация) - более 10 токенов в секунду - неспешно читаешь и успеваешь обдумывать прочитанное, но не ждешь жадно каждого токена.
Мое железо
Не так давно я приобрел desktop именно под нейросети, хотя уже 20+ лет я пользовался ноутбуками и не было желания поставить себе в комнату большую шумную коробку. Но все изменилось.
- Процессор Ryzen 9950x3d
- RAM DDR5-5600 192Гб
- GPU RTX Pro 4000 Blackwell
Мои результаты
В целом за пару месяцев моих попыток завести эту модель я продвинулся от 8ts до 17ts генерации, от 40ts decode до 360. Сейчас получил такие результаты:
- Неквантованная модель: 11ts генерация (decode) 250ts промптпроцессинг (prefill)
- iq3xxs квантованная: 14ts генерация (decode) 360ts промптпроцессинг (prefill)
Параметры
"%LLAMA_PATH%\llama-server.exe" ^
-m "%MODEL_PATH%" ^
--no-mmap ^
--no-repack ^
--device CUDA0 ^
--main-gpu 0 ^
--direct-io ^
--kv-offload ^
--fit on ^
--ctx-size 384000 ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
-fa 1 ^
--mlock ^
--parallel 1 ^
--jinja ^
--chat-template-file "%TEMPLATE_PATH%" ^
--temp 0.7 ^
-t 8 ^
-b 4096 ^
-ub 4096 ^
-lv 4 ^
--host 0.0.0.0 ^
--port 1234
Как видим, контекст 384000 токенов - это достаточно хороший объем, чтобы комфортно вести разработку, при этом он квантован до q8, что экономит кучу памяти, но наверное немного добавляет забывчивости. Так же подобраны оптимальные параметры -batch -ubatch 4096. Обратите внимание, -t 8 говорит нам о том, что используются всего 8 ядер процессора. Больше нет смысла - потому что все упирается в пропускную способность памяти, сколько ни ставь - прироста скорости не будет, а может быть даже наоборот. Так что экономим электроэнергию, именно она составляет основную стоимость домашнего инференса.
Экономика
Мне лень подключать компьютер через ваттметр в данный момент, хотя если будет запрос - я это сделаю. В моем компьютере стоит блок питания на 1.2КВт, при этом он взят с запасом под несколько видеокарт. Допустим, при инференсе компьютер потребляет 700Вт, на основе этого можно понять, сколько стоит инференс. Стоимость обычно указывается за 1млн токенов. Возьмем за основу данные - 9ts в среднем (к концу контекста скорость обычно падает) decode - 200ts. Электричество возьмем по 5 ₽ (хотя у меня 3.50 ₽). Расчет такой: считаем, сколько часов нужно, чтобы сгенерировать 1млн токенов и умножаем на стоимость электричества, которое потребит компьютер мощностью 0.7КВт.
- Стоимость входных токенов : 1 000 000 / (3600 * 200) * 5 * 0.7 = 4.86 ₽
- Стоимость выходных токенов : 1 000 000 / (3600 * 9) * 5 * 0.7 = 108.02 ₽
- Стоимость кэша : в подарок (сложно посчитать)
Что предлагают провайдеры? Например, я сейчас пользуюсь одним провайдером, цены:
- Стоимость входных токенов : 55,75 ₽
- Стоимость выходных токенов : 167,24 ₽
- Стоимость кэша : 1,77 ₽
Как видим, получилось даже дешевле!
Но есть еще дополнительная цена - это наличие железа и терпения в ожидании решения задачи. Считаем, что хороший компьютер у вас уже есть. А терпение - это плата за контроль. Здесь вас не отключат, и тем более никто не украдет ваши наработки (да кому они нужны?) Или, постойте… Сейчас идет охота за данными - нейросетевые гиганты скупают книги тоннами и сканируют их, только чтобы накормить свои ненасытные нейросети данными, которых уже сейчас катастрофически не хватает для обучения нейросетей (скормили все, что плохо лежало). Поэтому я не удивлюсь, если провайдеры действительно собирают ваши сессии, а затем продают их в качестве датасетов для обучения нейросетей. Так что куски кода вашего секретного суперпроекта рискуют уже завтра появится в агентской сессии ваших конкурентов.
Как добиться лучших результатов по скорости?
-
Конечно же, купить несколько видеокарт последнего (Blackwell), пред-последнего (Ada), пред-пред-последнего поколений (Ampere), чтобы поднять VRAM до 128-192 Гб.
-
Собрать комп на многоканальной памяти - 4, 8, 12… Пусть даже на DDR4. Например, если взять EPYC с памятью на 8 каналов, получаем пропускную способность 200Гб/с - а это уже сравнимо с Ryzen AI, где пропускная способность в районе 250Гб/с!
Предлагаю делиться своими результатами. Быть может вместе мы сможем придумать, как лучше задействовать потенциал нашего железа.




