pimenov.ai

База знаний

DeepSeek — линейка открытых моделей и API

Линейка DeepSeek в 2026: V4 Pro и V4 Flash с контекстом 1M токенов, открытые веса, разреженное внимание, цены API и запуск через Ollama и vLLM.

Опубликовано Обновлено

DeepSeek предоставляет модели семейства V4 через API в форматах, совместимых с OpenAI и Anthropic. Этот справочник помогает выбрать актуальный идентификатор модели, подключить текстовый API, настроить режим рассуждений и передать изображения в экспериментальную Vision-модель.

🗓️
Актуальность: проверено 9 сентября 2026 года. Официальные снимки документации получены 9 сентября и содержат изменения по 21 августа 2026 года. V4-Pro находится в полноценном релизе, V4-Flash — в публичной бете, а deepseek-v4-flash-vision-exp имеет экспериментальный статус.
📌
Коротко. Для текстовых запросов используйте deepseek-v4-pro или deepseek-v4-flash. Для изображений доступна экспериментальная модель deepseek-v4-flash-vision-exp. Режим рассуждений включён по умолчанию с уровнем high; доступны уровни low, high и max. Лицензию и доступность весов конкретного релиза проверяйте отдельно: предоставленные официальные снимки этого не подтверждают.

Содержание

  1. Актуальная линейка — модели V4 и их статусы.
  2. Режим рассуждений — переключение, уровни усилия и reasoning_content.
  3. Подключение по API — базовые URL и минимальный пример.
  4. Работа с изображениями — способы передачи, тарификация токенов и ограничения.
  5. Тарифы и лимиты — что нужно перепроверить перед расчётом бюджета.
  6. Полезные сценарии — выбор модели под практические задачи.
  7. Подводные камни — совместимость, расходы и проверка результата.

Актуальная линейка и возможности DeepSeek V4

Состав API менялся в течение 2026 года. Официальный журнал изменений фиксирует следующую последовательность:

МодельСтатус по официальному журналуИдентификатор API
DeepSeek-V4-ProПолноценный релиз с 13 августа 2026 годаdeepseek-v4-pro
DeepSeek-V4-FlashПубличная бета с 31 июля 2026 годаdeepseek-v4-flash
DeepSeek-V4-Flash-Vision-ExpЭкспериментальная мультимодальная модель с 21 августа 2026 годаdeepseek-v4-flash-vision-exp

V4-Pro и V4-Flash появились в API 24 апреля 2026 года. Для них доступны OpenAI Chat Completions и Anthropic-совместимый интерфейс. Журнал изменений также подтверждает встроенную поддержку Responses API.

Стабильные имена deepseek-v4-pro и deepseek-v4-flash автоматически указывают на актуальные версии соответствующих моделей. На момент последнего снимка документация связывала их с DeepSeek-V4-Pro-0813 и DeepSeek-V4-Flash-0731.

⚠️
В журнале изменений 24 июля 2026 года указан как срок прекращения поддержки старых идентификаторов deepseek-chat и deepseek-reasoner. Фактическое состояние старых имён после этой даты предоставленные снимки отдельно не подтверждают. В новом коде используйте deepseek-v4-flash или deepseek-v4-pro.

Что известно об архитектуре и весах

Предоставленные официальные снимки не указывают число параметров, количество активных параметров, структуру экспертов, лицензию или доступность весов V4. Не переносите характеристики и условия лицензирования прежних релизов на V4 без отдельного первичного источника.


Режим рассуждений и уровни усилия

У V4-Pro и V4-Flash есть режимы с рассуждениями и без них. Режим рассуждений включён по умолчанию, а уровень усилия по умолчанию равен high.

ЗадачаOpenAI Chat CompletionsResponses API
Включить или отключить рассуждения{"thinking":{"type":"enabled/disabled"}}{"reasoning":{"effort":"none/low/high/max"}}; значение none отключает режим
Выбрать уровень усилияreasoning_effort="low/high/max"{"reasoning":{"effort":"low/high/max"}}

При использовании OpenAI SDK параметр thinking передаётся внутри extra_body. Документация описывает основные уровни low, high и max. В таблице сопоставления запрошенные medium и xhigh отображаются на high. В руководстве для совместимых форматов также приведена форма {"output_config":{"effort":"low/high/max"}}; не переносите имена параметров между форматами.

В режиме рассуждений промежуточное содержимое возвращается в поле reasoning_content, а итоговый ответ — в content. Параметры temperature, top_p, presence_penalty и frequency_penalty в этом режиме не влияют на результат, хотя ради совместимости их передача не вызывает ошибку.

⚠️
Если запрос содержит tools (вызовы инструментов), полностью возвращайте reasoning_content предыдущих сообщений во всех последующих запросах этой цепочки. Иначе API может ответить ошибкой 400. Без tools передавать прошлое reasoning_content необязательно: оно не включается в следующий контекст.

Подключение по API

Официальная документация указывает два базовых URL:

  • OpenAI-совместимый формат: https://api.deepseek.com;
  • Anthropic-совместимый формат: https://api.deepseek.com/anthropic.

Минимальный запрос через OpenAI SDK:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "user", "content": "Кратко объясни принцип контекстного кэширования."}
    ],
    stream=False,
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

print(response.choices[0].message.content)

Ключ хранится в переменной окружения DEEPSEEK_API_KEY, а не в исходном коде. Для простого извлечения или классификации сравните режимы disabled и enabled: режим рассуждений может создавать больше выходного текста.

Проверка результата

После тестового запроса проверьте:

  • отсутствие HTTP-ошибки;
  • наличие итогового текста в response.choices[0].message.content;
  • наличие reasoning_content, если режим рассуждений включён;
  • корректную передачу reasoning_content между вызовами инструментов;
  • фактическое потребление токенов в ответе API.

Пример выше основан на официальной документации, но в рамках редакторской проверки не запускался. Перед продакшеном выполните небольшой запрос с тестовым ключом и версией SDK, используемой в вашем проекте.


Работа с изображениями в Vision API

deepseek-v4-flash-vision-exp принимает текст и изображения. Модель может описывать изображения, читать текст со скриншотов и анализировать графики. Поддерживаются JPEG, PNG, GIF и WebP; формат определяется по содержимому файла, а не по его имени или заявленному MIME-типу.

Изображение можно передать тремя способами:

  1. встроить в запрос как Base64 data: URL;
  2. указать публичный HTTP(S)-адрес;
  3. предварительно загрузить через Files API и передать file_id.

Для повторного использования или крупных файлов удобнее Files API. В OpenAI-совместимом Chat Completions изображения передаются в массиве блоков content; в Responses API используются блоки input_image.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Опиши данные на графике."},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/chart.png",
                        "detail": "low",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

Уровень детализации

Для image_url можно выбрать detail:

  • low уменьшает изображение до 512×512 и подходит, когда мелкие детали несущественны;
  • high и original сохраняют исходное изображение;
  • auto в текущей документации эквивалентен original.

При передаче через file_id поле detail игнорируется; image_url и file_id взаимно исключают друг друга.

Токены и ограничения изображений

Изображения преобразуются в токены по размеру и оплачиваются вместе с текстовыми входными токенами. Перед обработкой каждое изображение автоматически масштабируется. Для больших изображений итоговое количество токенов ограничено сверху примерно 384 токенами на изображение. Каждое изображение в запросе считается отдельно.

Основные ограничения из официального Vision-руководства:

ОграничениеЗначение
Тело запроса48 MiB
Одно изображение через Base64 или внешний URLдо 32 MiB
Одно изображение через Files APIдо 64 MiB
Совокупный размер изображений в запроседо 64 MiB без изображений с file_id; до 200 MiB при наличии изображений с file_id
Количество изображенийдо 600 за запрос
Длина внешнего URLдо 8192 символов
Время загрузки по внешнему URLдо 60 секунд
Размер стороны изображениядо 8192 px; при 15 и более изображениях — до 4096 px

В Chat Completions изображения разрешены только в сообщениях пользователя. В Responses API снимок допускает input_image в сообщениях user и developer, а также в выводе function_call_output и custom_tool_call_output. Изображения в сообщениях system и assistant отклоняются с ошибкой 400. Текстовые V4-Pro и V4-Flash изображения не принимают. Нарушение этих правил приводит к ошибке 400.


Тарифы и изменяемые лимиты

С 16:00 UTC 16 августа 2026 года DeepSeek применяет пиковую и внепиковую тарификацию, причём журнал изменений описывает внепиковые цены как половину пиковых.

Предоставленный снимок URL страницы тарифов фактически содержит страницу первого API-вызова без числовой таблицы. Поэтому актуальные ставки, размер контекста, максимальный вывод и ограничения параллелизма нельзя надёжно подтвердить этим набором источников.

Перед расчётом бюджета откройте официальную страницу моделей и тарифов и отдельно зафиксируйте:

  • цену входных токенов при попадании в кэш и без него;
  • цену выходных токенов;
  • расписание пиковых интервалов;
  • лимит контекста и максимальный вывод выбранной модели;
  • текущие ограничения скорости и параллелизма.

Полезные сценарии

Массовая классификация и суммаризация

Если нужно обработать множество документов, передайте небольшой репрезентативный набор в deepseek-v4-flash и сравните режимы с рассуждениями и без них. Наблюдаемый результат — доля корректных ответов на контрольной выборке, задержка и стоимость одного документа. Ограничение: качество и стоимость зависят от объёма вывода, кэширования и актуального расписания тарифов.

Сложные задачи с инструментами

Если агент должен выполнять последовательность вызовов инструментов, начните с deepseek-v4-pro и уровня high. После каждого ответа сохраняйте reasoning_content, передавайте результат инструмента и повторяйте запрос по схеме из руководства. Наблюдаемый результат — цепочка завершается итоговым content без ошибки 400 из-за пропущенного reasoning_content. Ограничение: бюджет токенов и надёжность сценария измеряйте на ограниченном наборе задач.

Анализ интерфейсов и графиков

Отправьте тестовый скриншот или график в deepseek-v4-flash-vision-exp. Сверьте распознанные подписи, числовые значения и выводы с заранее составленным эталоном. Наблюдаемый результат — совпадение с эталоном на вашей выборке. Ограничение: модель экспериментальная, поэтому стабильность и точность нужно измерять самостоятельно.

Код и большие проекты

Передавайте только релевантные файлы и просите модель перечислить затронутые компоненты, предлагаемые изменения и способы проверки. Наблюдаемый результат — список изменяемых компонентов и проверяемый план тестирования. Ограничение: фактический лимит контекста сначала уточните на текущей странице модели; размер окна сам по себе не гарантирует корректность патча.

Локальный запуск и дообучение

Если нужен локальный запуск или дообучение, сначала проверьте наличие весов, лицензию конкретного релиза и поддержку выбранного runtime. Наблюдаемый результат — подтверждённая документацией совместимость и успешный тестовый запуск на небольшой задаче. Ограничение: предоставленные официальные снимки API не подтверждают совместимость V4 с Ollama, vLLM, SGLang или конкретным способом дообучения, поэтому универсальную команду установки привести нельзя.


Особенности и подводные камни

  • Русский язык. В предоставленных источниках нет отдельной оценки качества русского языка. Для публичных текстов подготовьте собственный тестовый набор и предусмотрите редактуру.
  • Модерация. Использованные снимки не описывают политику модерации. Публичному сервису нужен собственный слой проверок и сценарий обработки отказов.
  • Расход рассуждений. В режиме thinking API возвращает промежуточное содержимое в поле reasoning_content; фактический объём ответа и расход токенов измеряйте на реальной нагрузке.
  • Параметры генерации. В thinking mode параметры temperature, top_p, presence_penalty и frequency_penalty игнорируются.
  • Экспериментальная Vision-модель. Перед производственным внедрением проверьте стабильность, точность и совместимость формата запросов.
  • Правовой контекст. Лицензионные и юрисдикционные требования зависят от модели, данных и способа размещения; API-документация их не заменяет.

Чеклист перед внедрением

Выбран актуальный идентификатор deepseek-v4-*.
Определено, нужен ли режим рассуждений.
Выбран уровень low, high или max.
Ключ хранится в переменной окружения.
Для tool calls сохраняется и возвращается reasoning_content.
Числовые тарифы и лимиты повторно проверены на официальной странице.
Для Vision соблюдены ограничения формата, размера и роли сообщения.
Экспериментальный статус Vision учтён в оценке рисков.
Качество, задержка и расход токенов измерены на собственной выборке.
Лицензия конкретной модели проверена отдельно, если нужны веса, дообучение или локальный запуск.

Официальные ссылки


Следующий шаг

Для отдельной настройки клиента, авторизации и форматов запросов откройте руководство DeepSeek API и SDK.

Связанные материалы

Обсуждение конфигурации DeepSeek полезно привязать к конкретному сценарию, нагрузке и требованиям к данным.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov