DeepSeek V4 — это не одна модель, а целое семейство архитектур с разными возможностями. Для практиков, работающих с компьютерным зрением и мультимодальными задачами, критически важно понимать, какие именно слуги (slug) принимают изображения, а какие — нет. Ошибка в выборе модели приводит к падению запроса, так как текстовые версии V4 физически не имеют энкодера для визуальных данных.
01Семейство DeepSeek V4: кто принимает картинки?
На момент сентября 2026 года в каталоге OpenRouter представлено несколько версий V4. Только две из них нативно поддерживают ввод изображений. Остальные работают исключительно с текстом (text-in, text-out). Если отправить image_url в текстовую модель, запрос будет отклонен.
| Модель | Slug | Входные модальности | Цена (вход / выход) за 1M токенов | Контекст |
|---|---|---|---|---|
| V4.1 Flash | deepseek/deepseek-v4.1-flash |
text, image | $0.15 / $0.60 | 1,048,576 |
| V4 Flash Vision Exp | deepseek/deepseek-v4-flash-vision-exp |
text, image | $0.22 / $0.66 | 1,048,576 |
| V4 Pro 0813 | deepseek/deepseek-v4-pro-0813 |
text | $0.579 / $1.738 | 1,048,576 |
| V4 Flash 0731 | deepseek/deepseek-v4-flash-0731 |
text | $0.065 / $0.18 | 1,310,720 |
| V4 Pro 0423 | deepseek/deepseek-v4-pro |
text | $0.860 / $1.720 | 1,048,576 |
| V4 Flash 0423 | deepseek/deepseek-v4-flash |
text | $0.085 / $0.171 | 1,048,576 |
~deepseek/deepseek-v4-flash-latest в данный момент указывает на текстовую версию Flash 0731. Не используйте его для задач с изображениями — фиксируйте конкретный slug deepseek/deepseek-v4.1-flash.02DeepSeek V4.1 Flash: нативная поддержка
DeepSeek V4.1 Flash — первая модель на базе архитектуры Causal Encoder-Decoder. Она активирует 8B параметров на входе и 16B на выходе из общего бэкбона в 552B параметров. Визуальные и текстовые эмбеддинги обучались совместно с самого начала.
Работа с ней ничем не отличается от стандартного chat-запроса, за исключением добавления блока image_url в контент сообщения. Поддерживаются публичные URL и base64-строки.
import os
from openai import OpenAI
# Инициализация клиента через OpenRouter
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1"
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4.1-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Какое состояние ошибки показано на скриншоте?"},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/screenshot.png"
}
}
]
}
],
stream=False
)
print(response.choices[0].message.content)03Альтернатива: V4 Flash Vision Exp
Модель deepseek/deepseek-v4-flash-vision-exp — это экспериментальная версия, добавляющая vision к базовой модели V4 Flash 0731. Она идентична по структуре запроса, но помечена как экспериментальная. Рекомендуется использовать её только для тестирования, так как V4.1 Flash является основным решением для новых проектов.
04Обходное решение: Vision-модель + Текстовый V4
Если вам нужен мощный reasoning от V4 Pro (которая не принимает картинки), можно использовать паттерн "Vision-модель впереди". Сначала другая модель (например, Qwen3.8 27B или Kimi K3) анализирует изображение и возвращает текстовое описание, которое затем подается в V4 Pro.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["OPENROUTER_API_KEY"],
base_url="https://openrouter.ai/api/v1"
)
image_url = "https://example.com/screenshot.png"
# Шаг 1: Визуальная модель описывает изображение
vision_response = client.chat.completions.create(
model="qwen/qwen3.8-27b",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Опиши этот скриншот для модели рассуждений. Сообщай только то, что видно."},
{"type": "image_url", "image_url": {"url": image_url}}
]
}
],
stream=False
)
description = vision_response.choices[0].message.content
# Шаг 2: Текстовая V4 Pro анализирует описание
reasoning_response = client.chat.completions.create(
model="deepseek/deepseek-v4-pro-0813",
messages=[
{
"role": "user",
"content": f"Заметки об изображении:\n{description}\n\nЗадача: Объясни ошибку и предложи исправление."
}
],
stream=False
)
print(reasoning_response.choices[0].message.content)05Как проверить модальности модели самостоятельно
Не полагайтесь только на документацию. Актуальные данные можно получить через API. Следующая команда выведет ID моделей DeepSeek V4 и их поддерживаемые входные модальности:
curl -s https://openrouter.ai/api/v1/models \
| jq -r '.data[] | select(.id | startswith("deepseek/deepseek-v4")) | "\(.id)\t\(.architecture.input_modalities | join(","))"'06Кому подойдёт / что запустится
- Для большинства задач с изображениями: Используйте
deepseek/deepseek-v4.1-flash. Это самый дешевый и стабильный вариант с нативной поддержкой картинок и контекстом 1M токенов. - Для тестирования:
deepseek/deepseek-v4-flash-vision-expподходит, если нужно сравнить результаты с основной версией. - Для сложного анализа (Pro-tier): Если требуется логика от V4 Pro, используйте связку Qwen3.8 27B (или Kimi K3) + V4 Pro. Будьте готовы к удвоенной стоимости запроса.
- Для видео: Ни одна модель V4 не принимает видео напрямую. Используйте описанный выше паттерн с внешними vision-моделями, поддерживающими видео.
Источник: OpenRouter ↗
