Неделя супер-распродажиClaude Skills — скидка 20%
News

DeepSeek V4.1-Flash: что нового, цены и альтернативы (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash: что нового, цены и альтернативы (2026)

10 сентября 2026 года компания DeepSeek выпустила V4.1-Flash. Это модель архитектуры Mixture-of-Experts с 552B параметров, которая нативно распознает изображения и текст, поддерживает контекст объемом до одного миллиона токенов и распространяется под лицензией MIT. Главное изменение касается стоимости: модель активирует 8B параметров на входе и 16B на выходе.

Последнее предложение кратко описывает всю суть. В этом руководстве мы подробно разберем его и приведем опубликованные цены на API. Мы также объясним, что этот релиз меняет, а что оставляет прежним, если результатом вашей работы является отчет, презентация или таблица.

Все приведенные ниже факты взяты из официального примечания к релизу DeepSeek, карточки модели на Hugging Face и опубликованной страницы с тарифами, проверенными 14 сентября 2026 года.

Что нового в DeepSeek V4.1-Flash

Примечание к релизу DeepSeek начинается с четырех утверждений. Модель стала «умнее, быстрее и эффективнее». Это «самая маленькая модель в нашем новом семействе архитектур с нативным пониманием визуального контента». Она разработана для «больших возможностей, более быстрого вывода и более высокой пропускной способности». Кроме того, в будущем она масштабируется до более крупных моделей.

Карточка модели содержит больше конкретики. DeepSeek-V4.1-Flash описывается как «мультимодальная модель Mixture-of-Experts (MoE) с 552B базовых параметров и поддержкой контекста до одного миллиона токенов». Она «нативно обрабатывает изображения и текст, а также авторегрессионно генерирует текст».

Для повседневной работы, в отличие от бенчмаркинга, важны три изменения.

Зрение встроено изначально, а не добавлено поверх. Визуальный кодировщик и двухслойный проектор преобразуют изображения в эмбеддинги. Они «обрабатываются совместно с текстовыми эмбеддингами с самого начала предварительного обучения языковой модели». В карточке модели указано, что кодировщик DeepSeek-ViT был обучен с нуля.

Контекст достигает одного миллиона токенов. Для предварительного обучения использовалось 45T токенов, при этом разреженное внимание (sparse attention) обучалось на 64K, а контекст был расширен до 1M на более позднем этапе процесса.

Уровень рассуждений регулируется. Модель «поддерживает плавно настраиваемый параметр усилий для рассуждений (целое число от 1 до 100), который позволяет находить баланс между стоимостью вывода и точностью». Вы тратите больше ресурсов только на те вопросы, которые действительно этого требуют.

DeepSeek также вывела из эксплуатации предыдущее поколение. В примечании к релизу указано, что «V4-Flash & V4-Flash-Vision-Exp устарели», а старые названия моделей временно перенаправляют запросы на V4.1-Flash для обеспечения совместимости.

Изменение архитектуры, стоящее за снижением стоимости

Самая интересная часть релиза DeepSeek V4.1-Flash — это не таблица бенчмарков. Это арифметика памяти.

DeepSeek-V4.1-Flash использует архитектуру, которую в карточке модели называют Causal Encoder-Decoder (CED). Это 40-слойный Transformer, разделенный на 20-слойный каузальный кодировщик и 20-слойный декодер. Глобальный KV-кэш декодера проецируется из финальных скрытых состояний кодировщика, а не строится для каждого слоя отдельно.

Практическим результатом является цифра, которую цитируют повсюду: 8B активных параметров на токен во время prefill и 16B во время decode. В карточке модели это описывается как «существенное повышение экономической эффективности для агентских задач с большим объемом входных данных».

«С большим объемом входных данных» — ключевая фраза. Длинные документы требуют много входных данных. То же самое относится к чату, куда вы прикрепляете сорок страниц, а затем задаете по ним шесть вопросов.

Еще две технологии уменьшают сам кэш. Compressed Sparse Attention 2 назначает каждому слою внимания один из трех режимов и распределяет индексы между слоями. Кэширование основного KV-кэша в формате FP4 сохраняет кэш в четырехбитном формате. В совокупности, согласно карточке модели, глобальный KV-кэш составляет всего 890 байт на токен, что примерно в четыре раза меньше, чем у предыдущего поколения.

В примечании к релизу это переведено в метрику, которую покупатель ощущает на практике. По сравнению с предыдущим поколением кэшу требуется «1/4 объема HBM» и «1/8 объема SSD-накопителя». Также добавляется, что «расходы на попадание в кэш (cache-hit) часто составляют значительную часть затрат на агентов».

Цены на DeepSeek V4.1-Flash

DeepSeek публикует цены за миллион токенов, разделяя их на пиковые и непиковые часы. Приведенные ниже значения взяты с официальной страницы Models & Pricing по состоянию на 14 сентября 2026 года в долларах США.

Тариф Непиковое время Пиковое время
1M входных токенов (попадание в кэш) $0.003 $0.006
1M входных токенов (промах мимо кэша) $0.15 $0.3
1M выходных токенов $0.6 $1.2

На странице указано, что «тарифы в непиковые часы составляют половину от пиковых», а пиковыми часами определены периоды с 01:00 до 04:00 и с 06:00 до 10:00 UTC с понедельника по пятницу. Все остальное время считается непиковым.

Рядом с таблицей приведены две важные рабочие детали. Имя модели для использования — deepseek-flash. Длина контекста составляет 1M с максимальным объемом вывода 384K, а указанный лимит одновременных запросов равен 2 500.

На той же странице отмечается, что V4-Pro остается доступной. DeepSeek пишет, что компания «решила продолжить предоставление услуг API для DeepSeek V4 Pro после 14 сентября 2026 года». Заявлено, что метод тарификации остается без изменений.

Что охватывают бенчмарки, а что нет

Таблицы инструктивных моделей в карточке в основном ориентированы на код и работу агентов. Terminal-Bench, DeepSWE, NL2Repo-Bench и Codeforces могут занимать большую часть строк. Это отражает целевую аудиторию DeepSeek.

Четыре строки более актуальны, если результатом вашей работы является документ.

Бенчмарк DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA оценивает ответы на вопросы по изображениям документов. Это наиболее близкий опубликованный аналог для чтения отсканированного счета-фактуры, договора аренды или PDF-отчета. Базовая модель набирает здесь 95.6 балла.

Что касается инструктивных моделей, Chartography с инструментами показывает результат 78.9, а BabyVision с инструментами — 89.6. Оба показателя представляют собой бенчмарки визуальных агентов, запущенные через внешнюю среду тестирования.

Относитесь к этим данным как к ориентировочным. В карточке модели указано, что все агентские оценки используют параметры temperature=1.0, top_p=0.95, а бенчмарки визуальных агентов используют окно контекста в 512k токенов. Ваши настройки будут отличаться.

Что это меняет для процессов превращения документов в готовые результаты

Более дешевый входной токен меняет само представление о том, какие рабочие процессы вообще стоит автоматизировать.

Представьте себе счета-фактуры поставщиков в формате PDF за целый месяц. При старом подходе вы бы извлекли данные один раз, сохранили сводку и работали уже с ней. Извлечение данных было дорогостоящим этапом, поэтому вы делали это как можно реже.

Входные данные стоят $0.15 за миллион токенов при промахе мимо кэша. Попадание в кэш стоит доли цента. При таких тарифах повторное чтение источника перестает быть основным фактором затрат. Вы можете задать второй вопрос к исходным страницам, а не к собственным заметкам.

Это важно для точности, а не только для бюджета. В сводке теряется номер страницы. В оригинале — нет.

Контекст в 1M токенов дает аналогичный эффект. Наряды-допуски за квартал, полный файл договора аренды или журнал смен за год могут поместиться в одном окне. Вам больше не нужно выбирать, какие именно десять документов включить.

Нативное зрение устраняет последний пробел. Диаграмма, вставленная в слайд, сфотографированные показания счетчика и отсканированная накладная — все это становится читаемыми входными данными, а не тем, что нужно перенабирать вручную.

Где более дешевая модель перестает помогать

DeepSeek V4.1-Flash — это лишь один уровень. Готовый результат — совсем другой.

Страницы DeepSeek описывают API и чат-продукт. На них указаны цены, лимиты контекста, бенчмарки и имя модели. Но там не описывается рабочее пространство, которое сохраняет ваши файлы, предыдущий анализ и форматы вывода между сессиями.

Это обычное разделение труда, а не недостаток. API задуман как компонент.

Практическое следствие заключается в том, что «последняя миля» остается за вами. Кто-то все еще должен перенести ответ в отформатированную таблицу, слайд или документ, который сможет открыть коллега. Кто-то все еще должен иметь возможность указать на цифру и сказать, с какой страницы она взята.

Powerdrill Bloom работает именно на этом уровне. На его главной странице он описывается как «AI-аналитик данных, который показывает свою работу». Там также добавляется, что «каждое число сопровождается указанием страницы, строки и исходной цифры». Вы загружаете файлы, задаете вопрос на естественном языке и получаете готовый артефакт.

Эти два уровня дополняют друг друга, а не конкурируют. Более дешевая модель с длинным контекстом и поддержкой зрения удешевляет этап чтения. А рабочее пространство решает, что делать с прочитанным.

Альтернативы, о которых стоит знать

Если вы оцениваете V4.1-Flash в сравнении с другими вариантами, чаще всего возникают три сопоставления.

В сравнении с DeepSeek V4-Pro. В примечании к релизу говорится, что «тесты различных сторон показывают превосходство V4.1-Flash над V4-Pro по производительности, стоимости, скорости & общему времени работы». Также добавляется, что DeepSeek «постепенно отказывается от V4-Pro». На странице тарифов V4-Pro по-прежнему указана по цене $0.66 за миллион входных токенов при промахе мимо кэша в непиковое время, по сравнению с $0.15 для Flash. Поддержка зрения для V4-Pro на этой странице не указана.

В сравнении с закрытыми передовыми моделями. Сравнительная таблица в карточке модели включает Opus-5.0 и GPT-5.6 Sol. Flash лидирует в нескольких агентских тестах, включая Terminal-Bench 2.1 с результатом 90.6 и AutomationBench с 54.8. Она отстает в Terminal-Bench 3.0 и 4.0. Относитесь к таблицам от разработчиков с соответствующей долей скепсиса.

В сравнении с рабочим пространством, а не с моделью. Если вам на самом деле нужен готовый отчет на основе имеющихся файлов, сравнение моделей теряет смысл. В нашем обзоре альтернатив DeepSeek рассматривается именно такой подход, а в руководстве по AI-агентам данных дается определение этой категории.

Как получить доступ к DeepSeek V4.1-Flash

На официальных страницах DeepSeek описаны три пути доступа.

Первый путь — это API. Направьте свой клиент на адрес https://api.deepseek.com для формата, совместимого с OpenAI, или на https://api.deepseek.com/anthropic для формата Anthropic, и укажите модель deepseek-flash. На странице тарифов указана поддержка вывода в формате JSON, вызовов инструментов (tool calls), Responses API и зрения.

Второй путь — это чат-продукт на сайте chat.deepseek.com, ссылка на который приведена непосредственно в карточке модели.

Третий путь — это веса модели. Модель опубликована на Hugging Face под лицензией MIT вместе с техническим отчетом. Этот вариант подходит, если вам нужно развернуть ее внутри собственной сети.

Одно примечание для третьего пути. В карточке модели указано, что «этот релиз не включает шаблон чата в формате Jinja», поэтому при самостоятельном хостинге нужно уделить внимание кодированию промптов.

FAQs

Что такое DeepSeek V4.1-Flash? Это мультимодальная модель архитектуры Mixture-of-Experts, выпущенная компанией DeepSeek 10 сентября 2026 года. В карточке модели указаны 552B базовых параметров, нативная обработка изображений и текста, а также поддержка контекста объемом до одного миллиона токенов. Она распространяется под лицензией MIT.

Сколько стоит DeepSeek V4.1-Flash? На официальной странице тарифов указана стоимость $0.15 за миллион входных токенов при промахе мимо кэша в непиковые часы и $0.3 в пиковые. Выходные токены стоят $0.6 в непиковое время и $1.2 в пиковое. Входные токены при попадании в кэш стоят $0.003 в непиковое время.

Поддерживает ли DeepSeek V4.1-Flash изображения? Да. В карточке модели описывается визуальный кодировщик, обученный с нуля, при этом визуальные эмбеддинги обрабатываются совместно с текстом с самого начала предварительного обучения. На странице тарифов указано, что зрение поддерживается для модели deepseek-flash.

Что случилось с DeepSeek V4-Flash? В примечании к релизу указано, что модели V4-Flash и V4-Flash-Vision-Exp выведены из эксплуатации. Устаревшие имена моделей по-прежнему принимаются и перенаправляют запросы на V4.1-Flash с тарификацией по стоимости Flash.

Подходит ли DeepSeek V4.1-Flash для создания отчетов и презентаций? Модель отлично справляется с этапом чтения, а показатель DocVQA на уровне 95.6 указывает на высокое качество понимания документов. Превращение этих данных в отформатированный готовый результат — это отдельный уровень, который как раз и обеспечивает рабочее пространство с искусственным интеллектом.

Заключение

DeepSeek V4.1-Flash — это релиз, направленный на повышение эффективности, но замаскированный под релиз новых возможностей. Основная архитектурная работа была проведена над KV-кэшем, и главный выигрыш достигается на длинных входных данных.

Для всех, чьи данные поступают в виде документов, это крайне полезное направление. Повторное чтение сотни страниц теперь превращается в погрешность округления, а не в сложный выбор.

Модель по-прежнему выдает вам просто текст. Если ваша рабочая неделя заканчивается таблицей, которую кто-то должен утвердить, то именно этап после работы модели отнимает у вас время. Попробуйте Powerdrill Bloom бесплатно и загрузите документы, которые вы собирались конспектировать вручную.


Источники (по состоянию на 14.09.2026): примечание к релизу DeepSeek-V4.1-Flash · карточка модели DeepSeek-V4.1-Flash · модели & цены DeepSeek. Цены и доступность могут меняться; сверяйтесь с официальными страницами перед планированием бюджета.