Deepseek выпустила модели V4 с 1 млн токенов

Китайская лаборатория Deepseek выпустила preview-версии V4-Pro и V4-Flash — двух новых моделей с числом параметров до 1,6 трлн и контекстным окном в 1 млн токенов. Модели опубликованы с открытыми весами по лицензии MIT и доступны на Hugging Face.

V4-Pro включает 1,6 трлн параметров, из которых активны 49 млрд. У V4-Flash — 284 млрд параметров и 13 млрд активных. Обе модели построены по схеме mixture-of-experts и поддерживают контекст до 1 млн токенов.

По данным Deepseek, V4-Pro стала крупнейшей моделью с открытыми весами на рынке. Она заметно превосходит Kimi K2.6 с 1,1 трлн параметров и GLM-5.1 с 754 млрд. Это также первая новая архитектура компании после V3: промежуточные релизы V3.1, V3.2, R1 и R1 0528 по-прежнему использовали исходный дизайн V3 на 685 млрд параметров.

Ключевое изменение — новая гибридная архитектура attention, которая сочетает сжатие токенов и sparse attention от Deepseek. Согласно техническому отчёту, при работе с контекстом в 1 млн токенов V4-Pro требует 27% FLOPs и 10% KV-кэша по сравнению с V3.2. Для V4-Flash показатели ещё ниже: 10% FLOPs и 7% KV-кэша.

На бенчмарке Artificial Analysis GDPval-AA модель V4-Pro набрала 1554 Elo и заняла первое место среди моделей с открытыми весами. Для сравнения, у GLM-5.1 — 1535 Elo, у Kimi K2.6 — 1484. Это примерно на 355 Elo больше, чем у V3.2.

При этом в техническом отчёте Deepseek признаёт, что V4-Pro “falls slightly behind GPT-5.4 and Gemini-3.1-Pro”. По оценке компании, отставание от передовых закрытых моделей составляет около трёх-шести месяцев. Полное тестирование со стороны Artificial Analysis ещё продолжается, а OpenAI и Anthropic уже выпустили новые модели GPT-5.5 и Opus 4.7.

Рост эффективности объясняет и цены. По данным страницы с тарифами Deepseek, V4-Flash стоит $0,14 за 1 млн входных токенов и $0,28 за 1 млн выходных. Это дешевле, чем GPT-5.4 Nano от OpenAI.

Для V4-Pro тариф составляет $1,74 за 1 млн входных токенов и $3,48 за 1 млн выходных. По этому показателю модель заметно дешевле Gemini 3.1 Pro, GPT-5.5 и Claude Sonnet 4.6.

Компания раскрыла и часть данных о предобучении. V4-Flash обучали на 32 трлн токенов, а V4-Pro — на 33 трлн. Упор сделали на более широкий многоязычный корпус, отобранные научные статьи и технические отчёты, а также данные для агентных сценариев на промежуточном этапе обучения. Веб-данные фильтровали от пакетно сгенерированного и шаблонного контента.

В отчёте не указаны конкретные датасеты и источники лицензий. Документ также не подтверждает распространённые предположения о прямой дистилляции из GPT или Claude.

При этом дистилляция занимает важное место на этапе постобучения. По данным Deepseek, компания полностью отказалась от прежней смешанной фазы reinforcement learning и перешла на on-policy distillation. Сначала лаборатория обучает более десяти внутренних специализированных моделей для математики, кода, агентных задач и следования инструкциям с помощью supervised fine-tuning и GRPO. Затем единая student-модель учится у всех этих teacher-моделей.

Deepseek заявляет, что V4 создавали специально для agentic workflow. Модели интегрированы с Claude Code, OpenClaw и OpenCode и уже применяются внутри компании для агентного программирования. API поддерживает интерфейсы, совместимые с OpenAI и Anthropic.

Технический отчёт также раскрывает детали по вычислительной части. Схема expert parallelism, как утверждает Deepseek, проверена на Nvidia GPU и Huawei Ascend NPU. Открытый mega-kernel MegaMoE построен на CUDA, а вместо библиотеки cuBLAS от Nvidia компания использует собственную DeepGEMM.

Отдельно Huawei сообщила, что Ascend Supernode на чипах Ascend 950 полностью поддерживает модели серии V4.

Источник: The Decoder, технический отчёт Deepseek, страница с тарифами Deepseek.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai