База знаний
DeepSeek — линейка открытых моделей и API
Линейка DeepSeek в 2026: V4 Pro и V4 Flash с контекстом 1M токенов, открытые веса, разреженное внимание, цены API и запуск через Ollama и vLLM.
СейчасАктуальная линейка и возможности DeepSeek V4
- Актуальная линейка и возможности DeepSeek V4
- Что известно об архитектуре и весах
- Режим рассуждений и уровни усилия
- Подключение по API
- Проверка результата
- Работа с изображениями в Vision API
- Уровень детализации
- Токены и ограничения изображений
- Тарифы и изменяемые лимиты
- Полезные сценарии
- Массовая классификация и суммаризация
- Сложные задачи с инструментами
- Анализ интерфейсов и графиков
- Код и большие проекты
- Локальный запуск и дообучение
- Особенности и подводные камни
- Чеклист перед внедрением
- Официальные ссылки
- Следующий шаг
- Связанные материалы
DeepSeek предоставляет модели семейства V4 через API в форматах, совместимых с OpenAI и Anthropic. Этот справочник помогает выбрать актуальный идентификатор модели, подключить текстовый API, настроить режим рассуждений и передать изображения в экспериментальную Vision-модель.
deepseek-v4-flash-vision-exp имеет экспериментальный статус.deepseek-v4-pro или deepseek-v4-flash. Для изображений доступна экспериментальная модель deepseek-v4-flash-vision-exp. Режим рассуждений включён по умолчанию с уровнем high; доступны уровни low, high и max. Лицензию и доступность весов конкретного релиза проверяйте отдельно: предоставленные официальные снимки этого не подтверждают.Содержание
- Актуальная линейка — модели V4 и их статусы.
- Режим рассуждений — переключение, уровни усилия и
reasoning_content. - Подключение по API — базовые URL и минимальный пример.
- Работа с изображениями — способы передачи, тарификация токенов и ограничения.
- Тарифы и лимиты — что нужно перепроверить перед расчётом бюджета.
- Полезные сценарии — выбор модели под практические задачи.
- Подводные камни — совместимость, расходы и проверка результата.
Актуальная линейка и возможности DeepSeek V4
Состав API менялся в течение 2026 года. Официальный журнал изменений фиксирует следующую последовательность:
| Модель | Статус по официальному журналу | Идентификатор API |
| DeepSeek-V4-Pro | Полноценный релиз с 13 августа 2026 года | deepseek-v4-pro |
| DeepSeek-V4-Flash | Публичная бета с 31 июля 2026 года | deepseek-v4-flash |
| DeepSeek-V4-Flash-Vision-Exp | Экспериментальная мультимодальная модель с 21 августа 2026 года | deepseek-v4-flash-vision-exp |
V4-Pro и V4-Flash появились в API 24 апреля 2026 года. Для них доступны OpenAI Chat Completions и Anthropic-совместимый интерфейс. Журнал изменений также подтверждает встроенную поддержку Responses API.
Стабильные имена deepseek-v4-pro и deepseek-v4-flash автоматически указывают на актуальные версии соответствующих моделей. На момент последнего снимка документация связывала их с DeepSeek-V4-Pro-0813 и DeepSeek-V4-Flash-0731.
deepseek-chat и deepseek-reasoner. Фактическое состояние старых имён после этой даты предоставленные снимки отдельно не подтверждают. В новом коде используйте deepseek-v4-flash или deepseek-v4-pro.Что известно об архитектуре и весах
Предоставленные официальные снимки не указывают число параметров, количество активных параметров, структуру экспертов, лицензию или доступность весов V4. Не переносите характеристики и условия лицензирования прежних релизов на V4 без отдельного первичного источника.
Режим рассуждений и уровни усилия
У V4-Pro и V4-Flash есть режимы с рассуждениями и без них. Режим рассуждений включён по умолчанию, а уровень усилия по умолчанию равен high.
| Задача | OpenAI Chat Completions | Responses API |
| Включить или отключить рассуждения | {"thinking":{"type":"enabled/disabled"}} | {"reasoning":{"effort":"none/low/high/max"}}; значение none отключает режим |
| Выбрать уровень усилия | reasoning_effort="low/high/max" | {"reasoning":{"effort":"low/high/max"}} |
При использовании OpenAI SDK параметр thinking передаётся внутри extra_body. Документация описывает основные уровни low, high и max. В таблице сопоставления запрошенные medium и xhigh отображаются на high. В руководстве для совместимых форматов также приведена форма {"output_config":{"effort":"low/high/max"}}; не переносите имена параметров между форматами.
В режиме рассуждений промежуточное содержимое возвращается в поле reasoning_content, а итоговый ответ — в content. Параметры temperature, top_p, presence_penalty и frequency_penalty в этом режиме не влияют на результат, хотя ради совместимости их передача не вызывает ошибку.
tools (вызовы инструментов), полностью возвращайте reasoning_content предыдущих сообщений во всех последующих запросах этой цепочки. Иначе API может ответить ошибкой 400. Без tools передавать прошлое reasoning_content необязательно: оно не включается в следующий контекст.Подключение по API
Официальная документация указывает два базовых URL:
- OpenAI-совместимый формат:
https://api.deepseek.com; - Anthropic-совместимый формат:
https://api.deepseek.com/anthropic.
Минимальный запрос через OpenAI SDK:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "user", "content": "Кратко объясни принцип контекстного кэширования."}
],
stream=False,
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
print(response.choices[0].message.content)Ключ хранится в переменной окружения DEEPSEEK_API_KEY, а не в исходном коде. Для простого извлечения или классификации сравните режимы disabled и enabled: режим рассуждений может создавать больше выходного текста.
Проверка результата
После тестового запроса проверьте:
- отсутствие HTTP-ошибки;
- наличие итогового текста в
response.choices[0].message.content; - наличие
reasoning_content, если режим рассуждений включён; - корректную передачу
reasoning_contentмежду вызовами инструментов; - фактическое потребление токенов в ответе API.
Пример выше основан на официальной документации, но в рамках редакторской проверки не запускался. Перед продакшеном выполните небольшой запрос с тестовым ключом и версией SDK, используемой в вашем проекте.
Работа с изображениями в Vision API
deepseek-v4-flash-vision-exp принимает текст и изображения. Модель может описывать изображения, читать текст со скриншотов и анализировать графики. Поддерживаются JPEG, PNG, GIF и WebP; формат определяется по содержимому файла, а не по его имени или заявленному MIME-типу.
Изображение можно передать тремя способами:
- встроить в запрос как Base64
data:URL; - указать публичный HTTP(S)-адрес;
- предварительно загрузить через Files API и передать
file_id.
Для повторного использования или крупных файлов удобнее Files API. В OpenAI-совместимом Chat Completions изображения передаются в массиве блоков content; в Responses API используются блоки input_image.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Опиши данные на графике."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/chart.png",
"detail": "low",
},
},
],
}
],
)
print(response.choices[0].message.content)Уровень детализации
Для image_url можно выбрать detail:
lowуменьшает изображение до 512×512 и подходит, когда мелкие детали несущественны;highиoriginalсохраняют исходное изображение;autoв текущей документации эквивалентенoriginal.
При передаче через file_id поле detail игнорируется; image_url и file_id взаимно исключают друг друга.
Токены и ограничения изображений
Изображения преобразуются в токены по размеру и оплачиваются вместе с текстовыми входными токенами. Перед обработкой каждое изображение автоматически масштабируется. Для больших изображений итоговое количество токенов ограничено сверху примерно 384 токенами на изображение. Каждое изображение в запросе считается отдельно.
Основные ограничения из официального Vision-руководства:
| Ограничение | Значение |
| Тело запроса | 48 MiB |
| Одно изображение через Base64 или внешний URL | до 32 MiB |
| Одно изображение через Files API | до 64 MiB |
| Совокупный размер изображений в запросе | до 64 MiB без изображений с file_id; до 200 MiB при наличии изображений с file_id |
| Количество изображений | до 600 за запрос |
| Длина внешнего URL | до 8192 символов |
| Время загрузки по внешнему URL | до 60 секунд |
| Размер стороны изображения | до 8192 px; при 15 и более изображениях — до 4096 px |
В Chat Completions изображения разрешены только в сообщениях пользователя. В Responses API снимок допускает input_image в сообщениях user и developer, а также в выводе function_call_output и custom_tool_call_output. Изображения в сообщениях system и assistant отклоняются с ошибкой 400. Текстовые V4-Pro и V4-Flash изображения не принимают. Нарушение этих правил приводит к ошибке 400.
Тарифы и изменяемые лимиты
С 16:00 UTC 16 августа 2026 года DeepSeek применяет пиковую и внепиковую тарификацию, причём журнал изменений описывает внепиковые цены как половину пиковых.
Предоставленный снимок URL страницы тарифов фактически содержит страницу первого API-вызова без числовой таблицы. Поэтому актуальные ставки, размер контекста, максимальный вывод и ограничения параллелизма нельзя надёжно подтвердить этим набором источников.
Перед расчётом бюджета откройте официальную страницу моделей и тарифов и отдельно зафиксируйте:
- цену входных токенов при попадании в кэш и без него;
- цену выходных токенов;
- расписание пиковых интервалов;
- лимит контекста и максимальный вывод выбранной модели;
- текущие ограничения скорости и параллелизма.
Полезные сценарии
Массовая классификация и суммаризация
Если нужно обработать множество документов, передайте небольшой репрезентативный набор в deepseek-v4-flash и сравните режимы с рассуждениями и без них. Наблюдаемый результат — доля корректных ответов на контрольной выборке, задержка и стоимость одного документа. Ограничение: качество и стоимость зависят от объёма вывода, кэширования и актуального расписания тарифов.
Сложные задачи с инструментами
Если агент должен выполнять последовательность вызовов инструментов, начните с deepseek-v4-pro и уровня high. После каждого ответа сохраняйте reasoning_content, передавайте результат инструмента и повторяйте запрос по схеме из руководства. Наблюдаемый результат — цепочка завершается итоговым content без ошибки 400 из-за пропущенного reasoning_content. Ограничение: бюджет токенов и надёжность сценария измеряйте на ограниченном наборе задач.
Анализ интерфейсов и графиков
Отправьте тестовый скриншот или график в deepseek-v4-flash-vision-exp. Сверьте распознанные подписи, числовые значения и выводы с заранее составленным эталоном. Наблюдаемый результат — совпадение с эталоном на вашей выборке. Ограничение: модель экспериментальная, поэтому стабильность и точность нужно измерять самостоятельно.
Код и большие проекты
Передавайте только релевантные файлы и просите модель перечислить затронутые компоненты, предлагаемые изменения и способы проверки. Наблюдаемый результат — список изменяемых компонентов и проверяемый план тестирования. Ограничение: фактический лимит контекста сначала уточните на текущей странице модели; размер окна сам по себе не гарантирует корректность патча.
Локальный запуск и дообучение
Если нужен локальный запуск или дообучение, сначала проверьте наличие весов, лицензию конкретного релиза и поддержку выбранного runtime. Наблюдаемый результат — подтверждённая документацией совместимость и успешный тестовый запуск на небольшой задаче. Ограничение: предоставленные официальные снимки API не подтверждают совместимость V4 с Ollama, vLLM, SGLang или конкретным способом дообучения, поэтому универсальную команду установки привести нельзя.
Особенности и подводные камни
- Русский язык. В предоставленных источниках нет отдельной оценки качества русского языка. Для публичных текстов подготовьте собственный тестовый набор и предусмотрите редактуру.
- Модерация. Использованные снимки не описывают политику модерации. Публичному сервису нужен собственный слой проверок и сценарий обработки отказов.
- Расход рассуждений. В режиме thinking API возвращает промежуточное содержимое в поле
reasoning_content; фактический объём ответа и расход токенов измеряйте на реальной нагрузке. - Параметры генерации. В thinking mode параметры
temperature,top_p,presence_penaltyиfrequency_penaltyигнорируются. - Экспериментальная Vision-модель. Перед производственным внедрением проверьте стабильность, точность и совместимость формата запросов.
- Правовой контекст. Лицензионные и юрисдикционные требования зависят от модели, данных и способа размещения; API-документация их не заменяет.
Чеклист перед внедрением
deepseek-v4-*.low, high или max.reasoning_content.Официальные ссылки
- DeepSeek: deepseek.com
- Чат: chat.deepseek.com
- Платформа и API-ключи: platform.deepseek.com
- API-документация и первый запрос: api-docs.deepseek.com
- Модели и тарифы: официальная страница тарифов
- Режим рассуждений: Thinking Mode
- Работа с изображениями: Vision
- Журнал изменений: Change Log
- DeepSeek на Hugging Face: huggingface.co/deepseek-ai
- DeepSeek на GitHub: github.com/deepseek-ai
Следующий шаг
Для отдельной настройки клиента, авторизации и форматов запросов откройте руководство DeepSeek API и SDK.
Связанные материалы
- Статья: Карпати перестал кодить и начал «компилировать знания» — разбираю его систему LLM Knowledge Bases
- Блог: Материал о DeepSeek V4
- База знаний: Контекст-инжиниринг — как собирать рабочий контекст для моделей нового поколения
Обсуждение конфигурации DeepSeek полезно привязать к конкретному сценарию, нагрузке и требованиям к данным.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Как мы с Codex развернули OmniVoice на Mac mini, клонировали мой голос, проверили 549 аудиофайлов и заменили платный API Яндекса.