DeepSeek представила мультимодальную модель, которая приблизилась к Claude Opus 4.8

Компания DeepSeek представила экспериментальную модель DeepSeek-V4-Flash-Vision-Exp. Она сотворена на базе V4 Flash, но в отличие от текстовой версии получила поддержку изображений: модель распознает содержимое фото и снимков экрана, анализирует графики и употребляет визуальную информацию при выполнении задач.

По оценке самой DeepSeek, текстовые способности новейшей модели – рассуждение, познания и работа в агентных сценариях – находятся на уровне V4 Flash. В тестах, где ИИ-агенту требуется сразу осознавать визуальную информацию и делать деяния, V4-Flash-Vision-Exp приблизилась к Claude Opus 4.8 от Anthropic. Независящего доказательства этих результатов пока нет.

Claude Opus 4.8 вышла в конце мая 2026 года. Anthropic позиционирует ее как свою более производительную общедоступную модель; она рассчитана в том числе на программирование, работу ИИ-агентов, рассуждения и сложные проф задачки.

DeepSeek-V4-Flash-Vision-Exp уже доступна через API компании. Ее контекстное окно составляет 1 млн токенов, наибольший размер ответа – 384 тыс. токенов. Изображения переводятся в токены и оплачиваются по этим же тарифам, что и запросы к V4 Flash; на одно изображение приходится не наиболее 384 токенов. Модель поддерживает смешанные запросы из текста и изображений, а рисунки загружаются впрямую, по ссылке либо через Files API.

Для DeepSeek это не 1-ый опыт с мультимодальными системами: ранее компания развивала семейство визуально-языковых моделей DeepSeek-VL. Новенькая версия в первый раз переносит работу с изображениями конкретно в животрепещущую линейку V4 Flash и расширяет ее способности для агентных сценариев.

DeepSeek представила официальную версию языковой модели DeepSeek V4 Pro. Она стала доступна в веб-версии, приложении и API компании.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *