LINUX.ORG.RU

Вышла модель Deepseek v4 Vision Exp, ваш домашний opus 4.8 (почти)

 , ,


1

1

Тихо и незаметно вышла модель Deepseek V4 Vision Exp!

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

По архитектуре это тот же Deepseek V4 0731, но с добавлением computer vision.

Она чуть лучше показывает себя на бенчмарках чем предыдущий 0731, и чуть чуть хуже чем облачный поприетарный opus 4.8

BenchmarkDeepSeek-V4-Flash-Vision-ExpDeepSeek-V4-Flash-0731Opus-4.8
Text Agent Capabilities
Terminal Bench 2.183.982.785.0
NL2Repo57.754.269.7
Cybergym75.376.778.3
DeepSWE59.354.458.0
Toolathlon-Verified75.970.376.2
DSBench-Hard63.659.671.7
AutomationBench (Public)25.725.127.2
Multimodal Agent Capabilities
ApexBench (Pass@1)36.526.2*39.4
Agents’ Last Exam27.325.2*25.7
Chartography64.365.0
ZeroBench (Pass@5)35.034.0

* DeepSeek-V4-Flash-0731 в ApexBench и Agents’ Last Exam игнорировал мультимодальные элементы входа.

Для text-agent тестов DeepSeek использовал DeepSeek Harness в minimal mode, reasoning effort = max, temperature = 1.0, top_p = 0.95.



Последнее исправление: gagarin0 (всего исправлений: 1)

ваш домашний opus 4.8 (почти)

На словах ты Лев Толстой, а на деле Deepseek V4 Flash простой.

Проблема всех этих сравнений в том, что они отталкиваются от ограниченного набора тестов, на которые модель оптимизирована.

При реальной же работе важны не абстрактные попугаи, а способность модели понимать и удерживать информацию в широкой области, на длинных цепочках текста, не путаясь и не отвлекаясь на привычные, но неверные в частном случае траектории. И при этом видеть детали, не терять их.

Очень сложно объективно измерить эту «всестороннеразвитость» модели.

Простая аналогия из мира визуальных моделей как раз:

Одна модель на картинке видит кота и может очень обще описать изображение.

Другая видит особенности его позы, шерсти, мелкие детали окружения, как падает свет, постановку кадра.

Третья видит всё, что видит вторая - плюс задумку кадра, его смысл, сюжет.

А теперь мысленно перенесите эту аналогию о глубине детализации на кодинг.

Что касается моделей, новая GPT-5.6 Luna формально являясь компактной моделью для лёгких задач и быстрых ответов, часто (не всегда) уделывает и Deepseek V4 Pro, который не Flash, и Qwen3.8-Max. Думайте.

При всём уважении к реальному прогрессу китайских моделей, но.

wandrien ★★★★
()
Последнее исправление: wandrien (всего исправлений: 1)

чуть чуть хуже чем облачный поприетарный opus 4.8

Так это охренеть какое достижение для flash, да и вообще deepseek.

no-such-file ★★★★★
()
Ответ на: комментарий от wandrien

И что ты этим хотел сказать? В некоторых вопросах китайские модели выносят эти ваши GPT левой пяткой. Так что тут все субъективщина.

anonymous
()
Ответ на: комментарий от anonymous

И что ты этим хотел сказать?

Что красивые тесты это одно, а реальность это другое. Deepseek V4 Flash это быстрая и эффективная рабочая лошадка с дешевым инференсом. Но у меня язык не повернётся сравнить её с Opus, это модели принципиально разного уровня.

Ладно еще GLM сопоставлять с топовыми западными решениями в кодинге, там разрыв не такой серьёзный. Но GLM медленная и довольно дорогая. А запуск её локально для частного лица – вообще из области фантастики.

wandrien ★★★★
()
Последнее исправление: wandrien (всего исправлений: 1)
Ответ на: комментарий от gagarin0

Нет, я обычно Deepseek облачный гоняю, для более сложных задач GLM. Ревью сложных коммитов делаю в GLM или в GPT.

К Opus сейчас нет доступа, когда был халявный - напрягал его.

wandrien ★★★★
()
Последнее исправление: wandrien (всего исправлений: 1)
Ответ на: комментарий от wandrien

Думайте

Ты не знаешь какая машинерия скрывается за вебмордой.
А «открытая» модель – это чисто веса нейронки и всё.

Bad_ptr ★★★★★
()
Последнее исправление: Bad_ptr (всего исправлений: 1)
Ответ на: комментарий от Bad_ptr

А открытая модель – это чисто веса нейронки и всё.

Это если локально запускать. А если в облаке, то однохренственно.

Аргумент валидный, но дело-то не в этом. Мой агр – на абсурдный заголовок сравнения V4 Flash и одной из топовых моделей.

Deepseek видит слишком мало отдельных деталей в коде, у него довольно низкая разрешающая способность. Opus и GPT в моей практике находили хитро запрятанные баги в коде, которые я сам пропустил, при чем бывало, что работали они над другой задачей, и вместе с этим находили баг.

За Deepseek очевидные баги находил уже я.

Такая вот разница в реальности, а не в бенчмарках.

Deepseek хорошая рабочая лошадка для создания простого кода по ясно задаче, где сложно запутаться. Благодаря скорости, он обеспечивает быстрые итерации в работе. Но потом этот код надо внимательно читать, желательно не только самому, но и более мощной моделью.

wandrien ★★★★
()
Ответ на: комментарий от gagarin0

Да. Ветку держим на плаву.

А по теме, именно визуальные возможности модели я немного потыкал, когда она еще в приложении вышла в превью. Не был ни расстроен, ни впечатлен – качество примерно такое, какое интуитивно и ожидалось: без явных провалов, но звёзд с неба не хватает.

Сейчас вот GLM-5.3-Flash релизнулась с мультимодальностью, её не смотрел еще.

wandrien ★★★★
()
Ответ на: комментарий от wandrien

glm-5.3-flash жду пока сделаю официальную поддержку в buun-llama-cpp (да и вообще в llama-cpp), буду тыкать на IQ3_XXS кванте, ожидая 35 t/s в лучшем случае.

gagarin0
() автор топика

Кстати, еще дополню к сказанному ранее.

Как следует из таблицы выше, в NL2Repo результат новой Deepseek 57.7 против 69.7 у Opus.
12 пунктов.

Это хорошо иллюстрирует то, о чем я писал выше, потому что:

«NL2Repo is a benchmark designed to evaluate the performance of Large Language Models (LLMs) and coding agents on long-horizon tasks that require generating a complete, runnable code repository from scratch (0-to-1)

Учитывая, что энтузисты, запускающие модели локально, используют обычно сверхжесткое квантование, а тесты проводятся на полноразмерной версии, реальный разрыв будет выше. Потому что квантование бьет как раз по «разрешающей способности» и точности воспроизведения и удержания фактов, взаимосвязей, оттенков смысла.

В практическом применении это как раз будет разница между «способен написать изолированный модуль» и «способен провести ревью логики, затрагивающей три сложных подсистемы проекта».

Вот еще наглядная аналогия, теперь не про фото кота, а про проценты:

Точность в 99% на шаг на дистанции 50 шагов будет составлять 60%. А точность 95% на шаг превратится соответственно в 7.7%. Вот такая разница.
Схожим образом мультипликативно качество модели влияет на результат и ожидания от верхней границы её возможностей по мере роста объема и детализации входных данных.

Однако насколько я понимаю, у меня и у gagarin0 принципиально разные шкалы оценки.

Для меня «почти Opus» - это про то, насколько сложную систему модель способна спроектировать или проанализировать, не упустив существенных деталей.
Для него это про принципиальную возможность локального запуска моделей, которые в синтетике почти угнались за околотоповыми решениями, что недавно выглядело фантастикой.

Если смотреть на ситуацию шире, то новая Qwen3.8-Flash-Next (которая по сути технодемка будущей Qwen4) обещает всего лишь 6B активаций параметров на токен при общем размере модели порядка сотен B параметров. Что звучит как обещание чудес, но это теперь такая реальность. (Ура.)

При этом в новостях также сообщают (ссылку искать лень), что в жестких вариантах квантования она даёт разумные ответы о фактах реального мира, на которые квантованные варианты предыдущих релизов отвечали чушью.

Но тут есть важная особенность, что у модели фактически разделены основное вычислительное ядро и база знаний в виде расширенных эмбеддингов, и как раз база знаний - ниже некоторого порога во всех тестах не квантуется, потому что иначе там полезной информации не останется вовсе. То есть по общим затратам на память магии не будет, и квантованная модель всё равно получается большая. Зато теперь всю эту базу знаний можно держать в ОЗУ, не засовывая в VRAM, что конечно большой плюс.
(Точные числа и ссылки искать лень, желающие сами могут нагуглить.)

wandrien ★★★★
()
Ответ на: комментарий от wandrien

я так понимаю, вы любитель «погонять чаи» на форуме?

Потому что квантование бьет как раз по «разрешающей способности» и точности воспроизведения и удержания фактов, взаимосвязей, оттенков смысла.

реальный разрыв будет выше.

это называется KLD. это Kullback–Leibler Divergence, по-русски обычно дивергенция Кульбака–Лейблера.

конкретно у дипсика v4 flash, обратите внимание на KLD между квантами Q4 и Q8 минимальный.

QuantSizeMean KLDKLD 99%KLD 99.9%PPLTop-1 agreement
UD-IQ1_S82.5 GB0.661556.513411.36678.093272.30%
UD-IQ2_M90.9 GB0.483885.34619.72457.089476.56%
UD-Q2_K_XL96.8 GB0.407664.78399.05576.678278.57%
UD-IQ3_XXS104.2 GB0.307893.81477.77326.197281.93%
UD-Q3_K_M128.1 GB0.157342.18074.95715.702887.06%
UD-Q4_K_XL155.1 GB0.013240.16750.55125.338096.04%
UD-Q8_K_XL161.9 GB~0.000000.00000.00015.3322100.00%

Если смотреть на ситуацию шире, то новая Qwen3.8-Flash-Next

по бенчмаркам она уже обгоняет deepseek

https://artificialanalysis.ai/models/comparisons/qwen3-8-flash-next-vs-deepseek-v4-flash

Для меня «почти Opus» - это про то, насколько сложную систему модель способна спроектировать или проанализировать, не упустив существенных деталей.

есть два вида тестов, первое это бенчмарки, второе это тесты на пользовательских задачах, я всегда новую модель прогоняю над одной и тоже же проблеме в первую очередь и смотрю за какое время она это решила и сколько токенов потратила, если открыть список моих комментарив то можно увидеть подробности, ctrl + f IQ3_XXS

При этом в новостях также сообщают (ссылку искать лень), что в жестких вариантах квантования она даёт разумные ответы о фактах реального мира, на которые квантованные варианты предыдущих релизов отвечали чушью.

это называется у модели knowledge base, она никак не сможет вам сказать о фактах реального мира после 2024 или 2025 или на каком она там датасете была обучена. Более того, конкретно мне в моих конкретных задачах факты реального мира сильно сильно не нужны.

Зато теперь всю эту базу знаний можно держать в ОЗУ, не засовывая в VRAM, что конечно большой плюс.

это уже доступно (но в несколько иной форме) в форке llama-cpp buun-llama-cpp, называется MoE cache, когда Mixture of Experts выгружаются в RAM.

честно говоря осилять эти простыни текста я не готов, пишите кратко и по делу,

gagarin0
() автор топика
Ответ на: комментарий от gagarin0

я так понимаю, вы любитель «погонять чаи» на форуме?

Как-то всё без огонька получается, зато с интересом к моей личности:

  1. я так понимаю вы теоретик?
  2. вы реально ежедневно используете LLM ?
  3. а локальные модели вы используете, если да, то какие?
  4. я так понимаю, вы любитель «погонять чаи» на форуме?

Из всего этого только третий вопрос имеет смысл в рамках темы, потому что позволяет развести хардкорных задорных энтузиастов локального запуска и скучных практиков с облачными инструментами, и я определённо из вторых.

есть два вида тестов, первое это бенчмарки, второе это тесты на пользовательских задачах, я всегда новую модель прогоняю над одной и тоже же проблеме в первую очередь и смотрю за какое время она это решила и сколько токенов потратила, если открыть список моих комментарив то можно увидеть подробности, ctrl + f IQ3_XXS

Ага. Только вот в чем дело, у каждого СВОИ пользовательские задачи. Я прекрасно вижу в реальной работе, где в МОИХ пользовательских задачах Deepseek V4 упирается в потолок, и ни на какой Opus она близко не тянет. Ни на Opus, ни на GPT-5.5, а летом уже GPT-5.6 вышла.

это называется у модели knowledge base, она никак не сможет вам сказать о фактах реального мира после 2024 или 2025 или на каком она там датасете была обучена. Более того, конкретно мне в моих конкретных задачах факты реального мира сильно сильно не нужны.

Да, вопрос о изобретении транзистора это очень 2025 вопрос. Если вы решили продемонстрировать, что качество генерации чуши у естественного идиота ничем не отличается от искусственного, то прекрасно получилось.

wandrien ★★★★
()
Ответ на: комментарий от gagarin0

это уже доступно (но в несколько иной форме) в форке llama-cpp buun-llama-cpp, называется MoE cache, когда Mixture of Experts выгружаются в RAM.

Там не MoE выгружается. А отдельный слой расширенной информации, концептуально отдаленно похожий на PLE у Gemma 4.

wandrien ★★★★
()
Последнее исправление: wandrien (всего исправлений: 2)
Ответ на: комментарий от gagarin0

Да это заметно, что вас что-то то «смешит», то еще каким-то образом будоражит, потому что вместо каких-то обоснованных соображений по существу - реакции и странные вопросы.

wandrien ★★★★
()
Ответ на: комментарий от psv1967

ну конкретно эта версия, по сравнению с предшественником, реально прозрела

gagarin0
() автор топика
Ответ на: комментарий от einhander

У Qwen хорошая прогрессия между версиями. Там сначала был эффект низкого старта (Qwen 3 была фуфлом, поэтому 3.5 была и выглядела прорывом), а с весны они разогнались и постоянно что-то улучшают.

wandrien ★★★★
()
Ответ на: комментарий от gagarin0

Не этот сайт точно, но что-то похожее было.

кстати как он?

Могу сравнить 3.6-35b-A3b, 3.6-27b и 3.8-27b. Квен 35b сильно тупее чем 3.6-27b, прям приходилось следить за тем что он там творит, непрошенной дичи делал много. Пример, о у тебя мсп гитлаба, дайка я таску сделаю там и тому подобного, 3.6-27b такого практически не было, но он мог замирать или уходить в размышления по кругу. Квен 3.8 27b по сравнению с 3.6 еще более интеллектуальный, в размышления ушел один раз только, может продолжать решать залачу по плану, у 3.6 прям проблема была. В общем 3.8 действительно очень хорош для локальной нейронки.

Я не понимаю почему все любят дипсик, в размышлениях он туп, постоянно повторяет то что уже опровергалось мной.

Я бы сравнивал квен 3.8 и глм5.2, они приблизительно похожи по мне, по крайней мере в кодинге.

einhander ★★★★★
()
Ответ на: комментарий от einhander

Я бы сравнивал квен 3.8 и глм5.2, они приблизительно похожи по мне, по крайней мере в кодинге.

Похожие впечатления, да.

В моих задачах GLM показывал более стабильные результаты, но это было весной, еще до Qwen3.8.

Пока по косвенным признакам предполагаю, что преимущество GLM сохраняется, но много с 3.8 я не работал.

GLM тяжеловесный и сильно ориентированный на то, что «вот мы сделаем для ИИ аналог системы 2, чтобы модель могла стабильно и подробно размышлять по шагам». Осенью прошлого года это выглядело как «вау». Сейчас выглядит уже как некоторое отставание, хотя и при формальном сохранении лидерства.

У Qwen и Deepseek не соблюдается такая же строгая структура CoT, и получается, что модели с более лаконичным CoT показывают сравнимые результаты, то есть делают те же вычисления с большим уровнем опоры на выученные скрытые закономерности, а не явные цепочки размышлений.

Плюс к этому быстрая архитектура Qwen и Deepseek.

А GLM архитектурно за год практически не менялся, никаких революций сравнимых с Gated Delta Network там не было.

wandrien ★★★★
()
Ответ на: комментарий от einhander

у меня немного другой опыт, qwen3.6-35-a3b «залупливался довольно редко», я его использовал для чат-ботов в mattermost, идеальный decode + prefill, и очень умело пользовался 6 mcp серверами (2 gitlab, jira, confluence, zabbix).

Проблема с обоими qwen3.6-* была в другом, они часто выходили за «scope» задачи, и начинали например делать то что их совсем не просили, и это не лечится промптом, в какой-то момент модель могла забыть запреты и пойти по теоретической ветке где начинала чинить какой-нибудь docker образ, что вообще не входило в задачу.

Я бы сравнивал квен 3.8 и глм5.2, они приблизительно похожи по мне, по крайней мере в кодинге.

опыта с GLM-5.2 у меня не было, а вот недавно в llama-cpp (и в buun-llama-cpp) вмержили поддержку qwen3.8-flash-next, буду его пробовать на IQ3_XXS кванте, посмотрим что выйдет, сам qwen3.8-27b толком не гонял, мне он показался менее прозорлив в решение задач чем дипсик.

Я не понимаю почему все любят дипсик, в размышлениях он туп

хм, а в чем это проявлялось? у меня сложилось впечатление что он extra thinking, и чем меньше квантирование (пробовал IQ3_XXS, Q3_X_KL, IQ4_XSS) тем больше он проверял ложных теорйи, и сам себя проверял, забывая о предыдущих выводах, когда перешел на Q4_X_KL (потеряв в скорости), то практически получил оригинальное качесвто, оно стало работать медленнее в плане decode/prefill token, но как ни парадоксально, сложные задачи решало быстрее (wall clock метрика), и тратить меньше токенов.

gagarin0
() автор топика
Ответ на: комментарий от wandrien

глм5.2,

Есть такое что оно может читать без конца контекст, который уже был прочитан? Как это решаете?

anonymous
()
Ответ на: комментарий от gagarin0

хм, а в чем это проявлялось?

Сейчас уже не найду этот чат, было приблизительно следующее: дипсик предлагает решения 1, 2, 3, я отвечаю 1 и 2 не работает, 3 дает не тот результат. Тогда он говорит, что надо делать решение 1, раз 2 и 3 не работают. И так под разными соусами по кругу. Облачный квен 3.8 предложил что-то другое, гпт тоже.

einhander ★★★★★
()
Ответ на: комментарий от knovich

А это стандартно для него. В отличие от квена, я частенько использую скил caveman, максимальное сжатие там на диалекте китайского, китайца хватает на 2-3 захода, потом уже на английский переключается.

einhander ★★★★★
()
  • Markdown
Пустая строка (два раза Enter) начинает новый абзац. Знак '>' в начале абзаца выделяет абзац курсивом цитирования.
Внимание: прочитайте описание разметки Markdown.
Используйте Ctrl-Enter для размещения комментария