DeepSeek представила мультимодальную модель, которая приблизилась к Claude Opus 4.8
Компания DeepSeek представила экспериментальную модель DeepSeek-V4-Flash-Vision-Exp. Она сотворена на базе V4 Flash, но в отличие от текстовой версии получила поддержку изображений: модель распознает содержимое фото и снимков экрана, анализирует графики и употребляет визуальную информацию при выполнении задач.
По оценке самой DeepSeek, текстовые способности новейшей модели – рассуждение, познания и работа в агентных сценариях – находятся на уровне V4 Flash. В тестах, где ИИ-агенту требуется сразу осознавать визуальную информацию и делать деяния, V4-Flash-Vision-Exp приблизилась к Claude Opus 4.8 от Anthropic. Независящего доказательства этих результатов пока нет.
Claude Opus 4.8 вышла в конце мая 2026 года. Anthropic позиционирует ее как свою более производительную общедоступную модель; она рассчитана в том числе на программирование, работу ИИ-агентов, рассуждения и сложные проф задачки.
DeepSeek-V4-Flash-Vision-Exp уже доступна через API компании. Ее контекстное окно составляет 1 млн токенов, наибольший размер ответа – 384 тыс. токенов. Изображения переводятся в токены и оплачиваются по этим же тарифам, что и запросы к V4 Flash; на одно изображение приходится не наиболее 384 токенов. Модель поддерживает смешанные запросы из текста и изображений, а рисунки загружаются впрямую, по ссылке либо через Files API.
Для DeepSeek это не 1-ый опыт с мультимодальными системами: ранее компания развивала семейство визуально-языковых моделей DeepSeek-VL. Новенькая версия в первый раз переносит работу с изображениями конкретно в животрепещущую линейку V4 Flash и расширяет ее способности для агентных сценариев.
DeepSeek представила официальную версию языковой модели DeepSeek V4 Pro. Она стала доступна в веб-версии, приложении и API компании.