DeepSeek V4: актуальные версии и различия

DeepSeek выпускает языковые модели. Чат предоставляет интерфейс для диалога, API позволяет обращаться к модели из программы.

На сентябрь 2026 года имя deepseek-flash вызывает V4.1-Flash с обработкой текста и изображений. Имя deepseek-v4-pro вызывает текстовую V4-Pro-0813. Старые deepseek-v4-flash и deepseek-v4-flash-vision-exp временно перенаправляются на V4.1-Flash. Для нового подключения используйте deepseek-flash.

DeepSeek V4: актуальные версии и различия
ЛинейкаОсновное отличиеКогда рассматривать
V3Универсальная текстовая модель предыдущего поколенияИзучение архитектуры и существующие локальные установки
R1Модель с акцентом на рассуждения; есть уменьшенные вариантыЛогические задачи и эксперименты с открытыми весами
V4-ProТекстовая модель с переключаемым размышлениемСравнение результатов в действующей интеграции
V4.1-FlashАктуальная модель с пониманием изображенийПервый тест нового API-проекта и разбор иллюстраций

Стоимость API: за что вы платите

Официальный API оплачивается по токенам входа и выхода. Токен может быть словом, частью слова или знаком. Повторно использованные данные из кеша учитываются отдельно. Ниже тарифы на сентябрь 2026 года в долларах за миллион токенов.

В каждой ячейке сначала указана цена вне пика, затем в часы пик. Это стоимость обращения к модели, без разработки приложения.

Пиковые интервалы: с 01:00 до 04:00 и с 06:00 до 10:00 UTC по будням, кроме государственных праздников Китая. Остальное время, включая выходные, оплачивается по сниженной ставке.

Пример расчёта вне пика: миллион входных токенов без кеша и столько же выходных у Flash стоят $0,75. Это сумма $0,15 и $0,60. Реальный бюджет считайте по журналу расходов: длина документов и ответов меняется от задания к заданию.

Считайте стоимость принятого ответа вместе с повторными запросами и ручной проверкой. Для короткой классификации ограничьте длину результата.

Стоимость API: за что вы платите
Модель APIВход из кешаОбычный входВыход
deepseek-flash$0,003 / $0,006$0,15 / $0,30$0,60 / $1,20
deepseek-v4-pro$0,022 / $0,044$0,66 / $1,32$1,98 / $3,96

DeepSeek R1: что это и чем отличается от V3

DeepSeek R1 создан на основе DeepSeek-V3-Base с дополнительным обучением рассуждению. При обучении использовались подготовленные примеры и обучение с подкреплением. Поэтому сводить различие к кнопке в чате неверно: изменился способ подготовки модели.

DeepSeek V3 предназначен для широкого круга текстовых задач и тоже способен решать логические задания. R1 делает больший акцент на цепочках рассуждений. Сравнивайте правильность ответа, а не длину объяснения.

Попросите найти противоречие в условии или объяснить ошибку программы. Проверьте каждый шаг решения: подробный ответ сам по себе не доказывает правильность вывода.

Как менялись поколения моделей

В старой инструкции имя API может сохраниться после смены модели. Проверяйте дату документации.

Как менялись поколения моделей
ДатаОбновлениеЧто учитывать
26 декабря 2024V3Выход универсальной модели
20 января 2025R1Выход модели для рассуждений
21 августа 2025V3.1Одна модель поддерживает ответы с размышлением и без него
1 декабря 2025V3.2Обновление моделей за прежними именами API
24 апреля 2026V4 PreviewНовое поколение с длинным контекстом
10 сентября 2026V4.1-FlashОбновление с пониманием изображений

Что нейросеть умеет делать на практике

Искусственный интеллект стоит проверять на знакомых задачах. Для пробного запуска выберите материал, который можете обработать самостоятельно.

Модель может генерировать убедительный текст с ошибочными деталями. Не поручайте ей придумывать свойства товара, условия договора или сведения о покупателе. Для сайта заранее подготовьте утверждённые характеристики и список запрещённых обещаний.

  • Текст: попросите сократить письмо, сохранить условия предложения и убрать повторы. Сравните результат с исходником перед отправкой.
  • Документы: предложите анализировать условия поставки и выписать расхождения. Для каждого вывода запросите подтверждающий фрагмент.
  • Программирование: передайте небольшой пример на Python и описание ошибки. Попросите объяснение, исправление и способ проверить результат.
  • Обращения: задайте список категорий и предложите распределить сообщения. Отдельно предусмотрите категорию для неясных запросов.
  • Изображения: у модели с поддержкой зрения проверьте чтение схем и графиков. Сверьте подписи и числа вручную.
  • Генерация идей: попросите варианты структуры статьи или вопросов для интервью. Фактическую основу предоставьте сами.

Как начать пользоваться чатом

Официальный веб-чат находится на chat.deepseek.com. Он подходит для знакомства с ответами без разработки собственной программы. Проверяйте адрес сайта, прежде чем вводить данные учётной записи.

Сформулируйте задачу по-русски. Укажите исходный материал, формат ответа, адресата и факты, которые нужно сохранить.

  1. Начните новый диалог для отдельной темы, чтобы предыдущая переписка не мешала оценке.
  2. Добавьте короткий исходный текст и объясните, какой результат вам нужен.
  3. Попросите сначала отметить недостающие сведения, если без них нельзя ответить точно.
  4. Проверьте ответ и уточните конкретный недостаток: пропущенное условие, неверный вывод или лишний объём.

Подключение API: пример на Python

API нужен, когда запрос отправляет ваше приложение. Официальный сервис принимает Chat Completions на /chat/completions, а также поддерживает Responses API и формат Anthropic. Совместимость форматов не означает одинаковые параметры: сверяйте документацию нужного интерфейса.

Пример ниже использует Python и пакет openai. Заранее установите пакет и задайте переменную окружения DEEPSEEK_API_KEY на сервере. Скрипт отправляет платный запрос в официальный API и печатает только ответ модели.

Параметр model выбирает модель, messages передаёт сообщения, content содержит текст. Значение high параметра reasoning_effort включает размышление. Для простого задания можно выбрать none; для сложного сравните low, high и max. Длинная цепочка рассуждений не гарантирует верного результата.

  • Храните ключ доступа на сервере. Не вставляйте его в открытый код страницы и переписку.
  • Определите формат результата: обычный текст, список или структурированные данные для дальнейшей обработки.
  • Проверяйте обязательные поля ответа до записи в систему. Не передавайте результат дальше только потому, что запрос завершился.
  • Предусмотрите повторную попытку при временной ошибке и понятное сообщение пользователю.
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Объясните, что такое API."}],
    reasoning_effort="high",
)
print(response.choices[0].message.content)

Архитектура V4 и длинный контекст

V4 использует MoE, смесь экспертов: при обработке токена работает только часть блоков модели. Это сокращает вычисления, но не отменяет память для остальных весов. Гибридное внимание объединяет ближайшие токены и сжатые сведения о дальних частях документа.

Для апрельской предварительной Pro заявлены 1,6 триллиона параметров, из них 49 миллиардов активных. Для предварительной Flash указаны 284 миллиарда и 13 миллиардов соответственно. Эти характеристики относятся к тому выпуску, их нельзя автоматически переносить на сентябрьское обновление.

По текущей таблице обе модели API поддерживают контекст 1M. Максимальный выход равен 384K, то есть 393 216 токенов. Это верхний предел параметра max_tokens, не длина ответа по умолчанию. Вход и ответ вместе должны помещаться в контекст.

В реализации Transformers механизм CSA отбирает полезные блоки сжатого контекста, HCA сильнее сжимает дальний контекст. Связи mHC управляют передачей информации между слоями. Это устройство V4; сентябрьская V4.1-Flash использует новую асимметричную архитектуру обработки входа и выхода.

Для разработчика: DeepseekV4Config описывает настройки, DeepseekV4Model возвращает внутренние представления, DeepseekV4ForCausalLM предназначен для генерации текста. Примеры загрузки и параметры кеша приведены в документации Transformers из списка источников. Для API-подключения эти классы не нужны.

DeepSeek R1 8B и локальный запуск

Запрос DeepSeek R1 8B обычно относится к уменьшенной модели DeepSeek-R1-Distill-Llama-8B. Официальный репозиторий указывает основу Llama-3.1-8B. Это отдельная модель, обученная с использованием данных рассуждений старшей версии.

Обозначение 8B говорит примерно о восьми миллиардах параметров. Полная R1 содержит 671 миллиард параметров, из которых 37 миллиардов активны при обработке токена. Поэтому результаты полной модели нельзя приписывать уменьшенной сборке.

Открытые веса позволяют запускать модель самостоятельно. В карточке V4-Flash указана лицензия MIT; у уменьшенной R1 на основе Llama проверяйте также условия базовой модели. Размер файла, рабочая память и скорость зависят от сборки и настроек.

Полная V4-Flash и R1 8B требуют разного оборудования. Нельзя оценивать память только по активным параметрам: размещать нужно веса и кеш контекста. Проверьте поддержку видеокарт выбранной программой, затем измерьте память и скорость на своих документах.

Карточка V4-Flash содержит варианты запуска через vLLM и SGLang и ссылку на инструкции разработчика. Сначала выберите точный выпуск весов и совместимую версию программы. Готовая команда загрузки не гарантирует, что модель поместится в вашу видеопамять.

Прямой API, посредник или свои серверы

Для ответов по базе знаний сначала найдите подходящие фрагменты, затем передайте их модели с вопросом. Такой подход называют RAG. Требуйте ссылки на документы и проверяйте их: большое контекстное окно не заменяет поиск нужных сведений.

  • Прямой API: используйте имена и тарифы DeepSeek. Обновление модели за прежним именем может изменить результаты ваших запросов.
  • Посредник: уточняйте точный выпуск, адрес API, валюту оплаты и исполнителя запроса. Название Flash в каталоге не гарантирует сентябрьскую V4.1. Тариф посредника нельзя считать ценой разработчика.
  • Свои серверы: вы выбираете веса и место обработки, но оплачиваете оборудование, настройку и поддержку. Проверьте также журналы, резервные копии и внешние инструменты.

Сравнение моделей и чтение результатов тестов

Бенчмарк проверяет модель на определённом наборе заданий. Его результат зависит от версии теста, режима и доступных инструментов. Сопоставляйте одинаковые условия, прежде чем делать вывод о сильной стороне нейросети.

В августовском журнале обновлений для Pro указаны результаты HLE: 42,7 без инструментов и 60,0 с инструментами. Это разные режимы оценки, а не результат «42,7 из 60». Проверяйте версию модели и условия измерения.

При сравнении с ChatGPT или Gemini используйте одинаковые исходные данные и требования к ответу. Рейтинг не покажет, насколько хорошо обработан именно ваш документ. Для выбора составьте собственный набор обычных и сложных заданий.

  • Фактическая точность: сохранены ли имена, условия и числа из исходного материала.
  • Полнота: учтены ли исключения и ограничения задачи.
  • Формат: можно ли использовать ответ без ручной переработки структуры.
  • Практичность: сколько исправлений осталось человеку.
  • Расходы: каковы задержка и стоимость принятого результата.

Ограничения и частые ошибки при выборе

Перед запуском определите, какую ошибку можно исправить вручную, а какая должна останавливать процесс.

  • Считать понимание изображений генерацией картинок. Проверяйте нужный тип входа и результата в описании функции.
  • Загружать всё без отбора. Лишние материалы затрудняют проверку ответа и расходуют бюджет.
  • Сравнивать только цену входа. Учитывайте выход, повторные запросы и работу редактора.

Как выбрать модель для бизнеса

Для обработки обращений подготовьте категории, для документов перечень искомых условий. Для помощи программисту нужен пример ошибки и тест исправления.

Сохраните результаты сравнения и повторяйте проверку при смене версии. Обновление модели может изменить ответы даже при прежнем запросе.

Если требуется подключить ИИ к сайту, начните с описания сценария и требований к данным. Услуга seosite1 «Внедрение ИИ в бизнес»: /uslugi/vnedrenie-ii/. Цена и сроки после брифа. Решения и цифры, подготовленные ИИ-агентами, у нас проверяет человек.

Источники

  1. DeepSeek: актуальные модели и тарифы API
  2. DeepSeek: журнал выпусков и сохранение Pro
  3. DeepSeek: анонс V4.1-Flash
  4. DeepSeek: параметры Chat Completions API
  5. DeepSeek-R1: обучение, уменьшенные модели и лицензии
  6. Hugging Face Transformers: архитектура и классы V4
  7. DeepSeek: веса V4-Flash, лицензия и запуск
  8. DeepSeek: пример Python-клиента