Статьи

DeepSeek V4 Flash: 284B / 13B — самый эффективный open-source

22 июля 2026, 09:00  |  5 мин чтения

В апреле 2026 DeepSeek выпустила预览 версию V4 — две MoE-модели: Pro (1,6 трлн / 49B активных) и Flash (284B / 13B активных). Flash — это младшая, но не менее интересная модель. Разбираемся, что она умеет.

Что внутри

Архитектура: гибридное внимание — Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA). Это даёт радикальную экономию: в сценарии с 1 млн токенов Flash тратит всего 10% FLOPs и 7% KV cache от DeepSeek V3.2.

Контекст: 1 млн токенов «из коробки». Точность: FP4 (эксперты) + FP8 (остальное) — ~146 ГБ на диске против 284 ГБ у FP8-версии.

Три режима

РежимКогда использоватьПримеры
Non-thinkПростые задачи, быстрые ответыОтветы на вопросы, суммаризация
Think HighСложное планирование, логикаНаписание кода, анализ данных
Think MaxМаксимальное качествоОлимпиадные задачи, научные расчёты

В режиме Max Flash догоняет Pro на большинстве бенчмарков: LiveCodeBench — 91,6 vs 93,5, HMMT 2026 — 94,8 vs 95,2. Разрыв заметен только на задачах знаний: SimpleQA — 34,1 vs 57,9.

Кому подойдёт

Flash — идеальный выбор, если: нужна open-source модель с 1M контекста, важна скорость инференса (1 200+ токен/с на B200), бюджет ограничен (апи DeepSeek в разы дешевле GPT/Claude), 90% задач — кодинг и логика, а не энциклопедические знания.

Pro — если: нужны максимальные знания, работа с агентами высокой сложности, готовы платить за 49B активных параметров.

DeepSeek V4 Flash — лучшая open-source модель для ежедневной работы. Она не бьёт рекорды на каждом бенчмарке, но даёт 90% качества топ-моделей за 10% цены.