DeepSeek V4 Flash: 284B / 13B — самый эффективный open-source
В апреле 2026 DeepSeek выпустила预览 версию V4 — две MoE-модели: Pro (1,6 трлн / 49B активных) и Flash (284B / 13B активных). Flash — это младшая, но не менее интересная модель. Разбираемся, что она умеет.
Что внутри
Архитектура: гибридное внимание — Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA). Это даёт радикальную экономию: в сценарии с 1 млн токенов Flash тратит всего 10% FLOPs и 7% KV cache от DeepSeek V3.2.
Контекст: 1 млн токенов «из коробки». Точность: FP4 (эксперты) + FP8 (остальное) — ~146 ГБ на диске против 284 ГБ у FP8-версии.
Три режима
| Режим | Когда использовать | Примеры |
|---|---|---|
| Non-think | Простые задачи, быстрые ответы | Ответы на вопросы, суммаризация |
| Think High | Сложное планирование, логика | Написание кода, анализ данных |
| Think Max | Максимальное качество | Олимпиадные задачи, научные расчёты |
В режиме Max Flash догоняет Pro на большинстве бенчмарков: LiveCodeBench — 91,6 vs 93,5, HMMT 2026 — 94,8 vs 95,2. Разрыв заметен только на задачах знаний: SimpleQA — 34,1 vs 57,9.
Кому подойдёт
Flash — идеальный выбор, если: нужна open-source модель с 1M контекста, важна скорость инференса (1 200+ токен/с на B200), бюджет ограничен (апи DeepSeek в разы дешевле GPT/Claude), 90% задач — кодинг и логика, а не энциклопедические знания.
Pro — если: нужны максимальные знания, работа с агентами высокой сложности, готовы платить за 49B активных параметров.
DeepSeek V4 Flash — лучшая open-source модель для ежедневной работы. Она не бьёт рекорды на каждом бенчмарке, но даёт 90% качества топ-моделей за 10% цены.