Qwen 3.8-Max: обзор флагмана Alibaba для кода и агентов

Qwen 3.8-Max: обзор флагмана Alibaba для кода и агентов
Alibaba выкатила Qwen 3.8-Max — новый флагман семейства Qwen. В анонсе упор на длинные задачи, код, агентов и мультимодальность. Веса обещают открыть «скоро».
Ниже — сжатый разбор цифр и бенчей (включая скрины), плюс что это значит, если вы пишете код или гоняете агентов из России и платите в рублях через Сразу.
Сразу — независимая AI-платформа (srazu.tech). Мы не Alibaba Cloud и не официальный канал Qwen.
Коротко: что заявили
| Параметр | По заявлениям / открытым сводкам |
|---|---|
| Архитектура | MoE (Mixture of Experts) |
| Всего параметров | 2,4 трлн |
| Активных на токен | ~95 млрд |
| Контекст | до 1 млн токенов |
| Фокус | код, агенты, длинные задачи, мультимодальность |
| API id | qwen3.8-max (у вендора) |
| Open weight | обещают Hugging Face / ModelScope |
| Ориентир цены API (вендор) | порядка $2 / $6 за 1M in/out токенов |
Огромный «2,4 трлн» не значит, что все параметры крутятся на каждом токене. Как у других MoE: в работе — срез экспертов. Именно активные параметры сильнее бьют по скорости и цене инференса.
Arena: 4-е место по фронтенд-коду
Независимый срез — Arena AI, лидерборд Frontend Code. На скрине Qwen3.8-Max стоит #4 (Arena Score 1668), рядом с Claude Opus 5 и Kimi K3.

Для продукта это важнее пресс-релиза: люди голосуют «какой код удобнее править», а не «кто написал больше параметров в слайд».
Если вам нужен именно UI/фронт в браузере без локального зоопарка — в Сразу есть Дизайн-студия и обычный чат с выбором модели под задачу.
Акцент на программирование и агентов
Презентация почти целиком про код: большие репозитории, несколько итераций, самоисправление, IDE и агентные CLI.
Отдельный кейс в СМИ — длинный автономный прогон CLI-агента (порядка 16 дней работы над одним проектом, сотни коммитов). Это демонстрация «длинного горизонта», а не гарантия, что у вас в проде агент неделю сам всё допилит без ревью.
Сводная таблица бенчей (данные вендора / публичные сводки — сверяйте даты):

И сетка по отдельным метрикам (код, агенты, зрение, видео):

На что смотреть здраво:
- Terminal Bench / SWE-подобные — агентный кодинг в терминале и правки репо.
- PaperBench / WideSearch — исследование и длинный поиск (вендорские цифры часто выглядят красиво).
- Визуальные (BabyVision, LVBench и т.п.) — если модель действительно мультимодальная у вас в проде, а не только в слайде.
Независимые прогоны (например, сводки вроде Terminal-Bench рядом с Kimi K3 и Opus) уже показывают: Qwen держится в топе, но не всегда №1. Это нормально. «Уступает только Claude Fable 5 во всём» — маркетинг; смотрите конкретный бенч под ваш стек.
Мультимодальность
Текст + картинки + документы + видео — так позиционируют Max. На практике проверяйте свой пайплайн: OCR скана договора и разбор 40-минутного скринкаста — разные задачи.
В Сразу картинки и видео — отдельные поверхности (/image, /video), а длинный текст и код удобнее гонять в чате.
API и совместимость
У вендора заявлены OpenAI-compatible Chat Completions / Responses и протокол в духе Anthropic — чтобы подтянуть модель в Claude Code, Codex и похожие CLI с минимальными правками.
Если вам нужен свой endpoint из РФ без зарубежной карты:
- Ключ
srazu_…и Base URLhttps://srazu.tech/api/v1— документация API. - Список живых
modelId—GET /api/v1/modelsили каталог в UI. - Оплата — рубли на /tarify.
Подробнее по соседним сценариям: OpenAI API в России, Claude API, DeepSeek API.
Важно: появление Qwen 3.8-Max у Alibaba ≠ автоматическое появление того же id в каталоге Сразу в тот же день. Смотрите актуальный список моделей в продукте. Статья — про анонс и критерии выбора, не прайс-лист на конкретный snapshot.
Open weight — «совсем скоро»
Alibaba обещает open-weight для линейки 3.8 (включая Max-класс) на Hugging Face / ModelScope. Лицензию и требования к железу на момент написания не зафиксировали в одном каноническом PDF.
Когда веса выйдут, локальный или свой VPS-инференс станет опцией для тех, у кого есть карта и время. Для команды без MLOps чаще быстрее остаться на managed API / чате с оплатой в ₽.
Что с бенчмарками — коротко
| Источник | Настроение |
|---|---|
| Вендорские таблицы | Сильно, особенно PaperBench / часть agent suites |
| Arena Frontend | Топ-5, близко к Opus / Kimi |
| Независимые сводки (Habr и др.) | Топ, но не монополия; на части SWE отстаёт от Kimi/Opus |
Вывод для выбора модели: берите задачу, а не слайд. Рефактор монорепы, генерация React-экрана и «посидишь 16 дней сам» — три разных SLA.
Как это стыкуется со Сразу
| Нужно | Куда |
|---|---|
| Поговорить / набросать код в браузере | /chat — режим «Авто» или явная модель из каталога |
| Встроить в бота, Cline, скрипт | /api-docs |
| Слайды / прототип UI | /design |
| Карточка товара / картинка | /image |
| Обзор моделей «что выбрать» | /ai |
Не путайте поверхности: чат текстом не «нарисует» ролик и не заменит студию — для медиа есть отдельные инструменты (мы как раз учим маршрутизацию в продукте).
Частые вопросы
Qwen 3.8-Max уже лучше Claude и GPT во всём?
Нет. На части бенчей близко или впереди, на части — нет. Смотрите метрику под ваш сценарий.
Когда open weight?
Вендор говорит «скоро» / «на следующей неделе» в новостной волне. Дата и лицензия — по официальному релизу на HF/ModelScope, не по репостам.
Можно ли оплатить Qwen из России картой РФ?
Прямой биллинг Alibaba Cloud часто упирается в гео и карты. Альтернатива — платформы с рублёвым балансом и своим каталогом моделей, например Сразу.
Чем Max отличается от «просто большой модели»?
Заявленный упор на длинный агентный цикл и MoE с большим числом параметров при ~95B активных. Насколько это ощутимо у вас — только A/B на ваших репо.
Итог
Qwen 3.8-Max — серьёзный анонс: MoE на 2,4 трлн, длинный контекст, ставка на код/агентов, обещание open weight, сильные (но не безгрешные) бенчи и 4-е место на Arena Frontend.
Если вы из РФ и вам нужен рабочий контур «модель → результат» без танцев с зарубежной картой — начните с чата Сразу или API, сверьте актуальный каталог и гоняйте ту модель, которая уже доступна под вашу задачу сегодня.