Тихо и незаметно вышла модель Deepseek V4 Vision Exp!
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
По архитектуре это тот же Deepseek V4 0731, но с добавлением computer vision.
Она чуть лучше показывает себя на бенчмарках чем предыдущий 0731, и чуть чуть хуже чем облачный поприетарный opus 4.8
| Benchmark | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Text Agent Capabilities | |||
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| Multimodal Agent Capabilities | |||
| ApexBench (Pass@1) | 36.5 | 26.2* | 39.4 |
| Agents’ Last Exam | 27.3 | 25.2* | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
* DeepSeek-V4-Flash-0731 в ApexBench и Agents’ Last Exam игнорировал мультимодальные элементы входа.
Для text-agent тестов DeepSeek использовал DeepSeek Harness в minimal mode, reasoning effort = max, temperature = 1.0, top_p = 0.95.







