Главная/Блог/Разбор/DeepSeek V4 Vision: Как работать с…
Разбор4 мин чтения · 19 сентября 2026 г.

DeepSeek V4 Vision: Как работать с изображениями в семействе V4

Разбираем архитектуру DeepSeek V4: какие модели поддерживают vision, цены, примеры кода на Python и стратегии обхода ограничений для Pro-версий.

DeepSeek V4 Vision: Как работать с изображениями в семействе V4

DeepSeek V4 — это не одна модель, а целое семейство архитектур с разными возможностями. Для практиков, работающих с компьютерным зрением и мультимодальными задачами, критически важно понимать, какие именно слуги (slug) принимают изображения, а какие — нет. Ошибка в выборе модели приводит к падению запроса, так как текстовые версии V4 физически не имеют энкодера для визуальных данных.

01Семейство DeepSeek V4: кто принимает картинки?

На момент сентября 2026 года в каталоге OpenRouter представлено несколько версий V4. Только две из них нативно поддерживают ввод изображений. Остальные работают исключительно с текстом (text-in, text-out). Если отправить image_url в текстовую модель, запрос будет отклонен.

Модель Slug Входные модальности Цена (вход / выход) за 1M токенов Контекст
V4.1 Flash deepseek/deepseek-v4.1-flash text, image $0.15 / $0.60 1,048,576
V4 Flash Vision Exp deepseek/deepseek-v4-flash-vision-exp text, image $0.22 / $0.66 1,048,576
V4 Pro 0813 deepseek/deepseek-v4-pro-0813 text $0.579 / $1.738 1,048,576
V4 Flash 0731 deepseek/deepseek-v4-flash-0731 text $0.065 / $0.18 1,310,720
V4 Pro 0423 deepseek/deepseek-v4-pro text $0.860 / $1.720 1,048,576
V4 Flash 0423 deepseek/deepseek-v4-flash text $0.085 / $0.171 1,048,576
💡
Важно про алиасы. Алиас ~deepseek/deepseek-v4-flash-latest в данный момент указывает на текстовую версию Flash 0731. Не используйте его для задач с изображениями — фиксируйте конкретный slug deepseek/deepseek-v4.1-flash.

02DeepSeek V4.1 Flash: нативная поддержка

DeepSeek V4.1 Flash — первая модель на базе архитектуры Causal Encoder-Decoder. Она активирует 8B параметров на входе и 16B на выходе из общего бэкбона в 552B параметров. Визуальные и текстовые эмбеддинги обучались совместно с самого начала.

Работа с ней ничем не отличается от стандартного chat-запроса, за исключением добавления блока image_url в контент сообщения. Поддерживаются публичные URL и base64-строки.

terminalpython
import os
from openai import OpenAI

# Инициализация клиента через OpenRouter
client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1"
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Какое состояние ошибки показано на скриншоте?"},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png"
                    }
                }
            ]
        }
    ],
    stream=False
)

print(response.choices[0].message.content)

03Альтернатива: V4 Flash Vision Exp

Модель deepseek/deepseek-v4-flash-vision-exp — это экспериментальная версия, добавляющая vision к базовой модели V4 Flash 0731. Она идентична по структуре запроса, но помечена как экспериментальная. Рекомендуется использовать её только для тестирования, так как V4.1 Flash является основным решением для новых проектов.

04Обходное решение: Vision-модель + Текстовый V4

Если вам нужен мощный reasoning от V4 Pro (которая не принимает картинки), можно использовать паттерн "Vision-модель впереди". Сначала другая модель (например, Qwen3.8 27B или Kimi K3) анализирует изображение и возвращает текстовое описание, которое затем подается в V4 Pro.

⚠️
Предупреждение по стоимости. Этот метод требует двух вызовов API. Qwen3.8 27B стоит $0.42/$3.00 за 1M токенов, а Kimi K3 — $2.10/$10.53. Это дороже прямого вызова V4.1 Flash, но необходимо, если требуется специфический reasoning от Pro-версии или обработка видео.
terminalpython
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1"
)

image_url = "https://example.com/screenshot.png"

# Шаг 1: Визуальная модель описывает изображение
vision_response = client.chat.completions.create(
    model="qwen/qwen3.8-27b",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Опиши этот скриншот для модели рассуждений. Сообщай только то, что видно."},
                {"type": "image_url", "image_url": {"url": image_url}}
            ]
        }
    ],
    stream=False
)

description = vision_response.choices[0].message.content

# Шаг 2: Текстовая V4 Pro анализирует описание
reasoning_response = client.chat.completions.create(
    model="deepseek/deepseek-v4-pro-0813",
    messages=[
        {
            "role": "user",
            "content": f"Заметки об изображении:\n{description}\n\nЗадача: Объясни ошибку и предложи исправление."
        }
    ],
    stream=False
)

print(reasoning_response.choices[0].message.content)

05Как проверить модальности модели самостоятельно

Не полагайтесь только на документацию. Актуальные данные можно получить через API. Следующая команда выведет ID моделей DeepSeek V4 и их поддерживаемые входные модальности:

terminalbash
curl -s https://openrouter.ai/api/v1/models \
  | jq -r '.data[] | select(.id | startswith("deepseek/deepseek-v4")) | "\(.id)\t\(.architecture.input_modalities | join(","))"'

06Кому подойдёт / что запустится

  • Для большинства задач с изображениями: Используйте deepseek/deepseek-v4.1-flash. Это самый дешевый и стабильный вариант с нативной поддержкой картинок и контекстом 1M токенов.
  • Для тестирования: deepseek/deepseek-v4-flash-vision-exp подходит, если нужно сравнить результаты с основной версией.
  • Для сложного анализа (Pro-tier): Если требуется логика от V4 Pro, используйте связку Qwen3.8 27B (или Kimi K3) + V4 Pro. Будьте готовы к удвоенной стоимости запроса.
  • Для видео: Ни одна модель V4 не принимает видео напрямую. Используйте описанный выше паттерн с внешними vision-моделями, поддерживающими видео.

Источник: OpenRouter ↗