Alibaba выпустила Qwen3.8-Omni-Flash: 1 млн токенов и цены минус 98%
PrimeCoder · 2026 · формат: news
Что произошло, почему это важно и что взять в работу.
Резкое падение стоимости обработки аудио и видео через API делает мультимодальные пайплайны (расшифровка, перевод, нарезка клипов) экономически доступными даже для небольших команд.
Связанные услуги: каталог, AI Boost Team, стать клиентом.
Что случилось
Alibaba выкатила Qwen3.8-Omni-Flash. Дата — 19 сентября 2026. Модель живёт на корпоративной платформе Qianwen AI, то есть заходить в неё нужно не через розничную подписку, а через корпоративный контур.
Суть в одном абзаце: одна архитектура принимает текст, картинки, аудио и видео. Контекст — 1 млн токенов. Это не «ещё одна языковая модель с картинками». Это попытка закрыть весь медиаконвейер одним вызовом API.
В рамках единой архитектуры она обрабатывает текст, изображения, аудио и видео, а также поддерживает контекстное окно размером 1 млн токенов.
Но главная цифра здесь не про качество. Главная цифра — про деньги.
Цены: где именно ломается экономика
Относительно предыдущего поколения Qwen3.5-Omni-Plus доступ по API подешевел так:
- обработка аудио — минус более 98%;
- обработка аудио плюс видео — минус более 93%.
Держите в голове, что это сравнение с предшественницей Alibaba, а не с рынком целиком. Но порядок величин всё равно меняет разговор. Когда час аудио стоил условные сто рублей, расшифровка архива звонков была проектом на квартал с защитой бюджета у финдира. Когда тот же час стоит два рубля, это уже строчка в операционке, которую можно проверить на гипотезе за вечер.
Именно поэтому падение цены важнее прироста баллов. Баллы покупают вам место в сравнительной таблице. Цена покупает вам право вообще запустить пайплайн.
Качество: где модель сильна, а где нет
Средний результат в 29 бенчмарках вырос более чем на 25% к предыдущему поколению. Разберём по тестам, потому что средний балл — плохой советчик.
- WildClawBench-MM — 71,0 балла, плюс 36,5 к предшественнице. Это агентные задачи с аудио и видео.
- UniClawBench — 69,6.
- LongAudioSpan (понимание длинных записей) — 82,7. Сильная сторона.
- OmniVideoBench (анализ аудио и видео) — 63,4, с агентным механизмом 67,8.
- OmniCap-IF (следование инструкциям при описании видео) — 28,2. Вот это слабое место, и его не спрятать за средним.
- AliMeeting (расшифровка совещаний на китайском, несколько говорящих) — 89,7.
Читается так: модель хорошо слушает, прилично смотрит и плохо выполняет точные инструкции по видео. Если ваш сценарий — «опиши, что происходит в ролике, в свободной форме», вы в зоне комфорта. Если «вырежи все кадры, где в кадре красная машина, и верни таймкоды в JSON» — проверяйте руками, 28,2 балла об этом прямо предупреждают.
По совокупной работе со звуком и видео модель подошла к Google Gemini 3.8 Flash, а по чистому аудио обошла его.
По качеству совместной обработки звука и видео Qwen3.8-Omni-Flash приблизилась к Google Gemini 3.8 Flash, а при работе только со звуком даже превзошла американского конкурента.
Языковой охват: распознавание речи — 74 языка и диалекта, включая кантонский, уйгурский и маори. Генерация речи — 29 языков. Оба контура уверенно держат китайский, английский, корейский, французский, немецкий, испанский и японский.
Агентный механизм: почему это важнее, чем звучит
Классическая мультимодальная модель жуёт запись линейно: час видео — это час видео, пропущенный через энкодер. Дорого и медленно.
Alibaba встроила другое поведение. Модель сначала смотрит на запрос, потом сама решает, куда смотреть и что слушать, и сужает область поиска за несколько шагов. Не «прочитай всё», а «найди то, что нужно».
Эффект измеримый: OmniVideoBench поднялся с 63,4 до 67,8, а расход токенов на запрос упал с 145 736 до 79 117. Это минус 45,7%.
Вот здесь и складывается экономика. Вы получаете не только дешёвый тариф, но и меньше токенов на ту же задачу. Два множителя в одну сторону. Для пайплайна, который гоняет сотни часов записи в месяц, это разница между «пилот» и «продакшн».
Alibaba отдельно проговорила, почему вообще взялась за это: существующие решения плохо работают с длинными аудио- и видеозаписями, у ИИ-агентов нет нормальной встроенной поддержки этих форматов, а механизмы находятся в зачаточном состоянии. Это честная постановка проблемы, а не маркетинг.
Модель, которая улучшает модель
Самый интересный эксперимент в релизе — не про клипы и не про перевод.
Qwen3.8-Omni-Flash дали задачу: за 12 часов улучшить распознавание сычуаньского диалекта у компактной Qwen2.5-Omni-3B. Старшая модель сама отобрала тестовую выборку, замерила исходные показатели и собрала обучающий набор. За четыре серии экспериментов — 3413 обучающих примеров. Ошибка распознавания отдельных символов упала с 25,79% до 15,30%, то есть на 40,7%.
Что это значит на практике. Дообучение под узкий домен — акценты, отраслевой жаргон, плохие записи с производства — перестаёт быть проектом с дата-сайентистом в штате. Модель делает разметку и сборку выборки сама. Вам остаётся поставить задачу и проверить результат.
Оговорка: 12 часов — это время эксперимента, а не гарантия, что у вас выйдет так же на вашем материале. Диалект китайского и русская речь в шумном цеху — разные задачи.
Обвязка: плагины и открытая среда
Модель без инструментов — половина продукта. Alibaba обновила Qwen-MM-Plugins: контекстный поиск по медиаданным, подключение внешних инструментов, последовательная обработка длинных файлов. Плагины работают с OpenAI Codex, Anthropic Claude Code, Alibaba Qwen Code и Google Gemini CLI. То есть встраиваются в чужие агентные среды, а не только в свою.
Плюс выложили Qwen-Live Harness с открытым исходным кодом — среду для интерактивных приложений на API Qwen3.8-Omni-Flash-Realtime. Поддержка WebSocket и WebRTC, низкая задержка.
И отдельная деталь, которой пока нет у конкурентов: звуковая локализация. Модель объединяет пространственное аудио с картинкой и определяет направление и расстояние до источника звука. Alibaba называет это первым таким решением среди мультимодальных моделей.
Что это меняет для российского SMB
Разберём по сценариям, которые реально стоят денег.
Расшифровка и протоколы. AliMeeting на китайском даёт 89,7. Русский в списке поддерживаемых языков распознавания есть, но отдельного балла по нему нет. Значит — тестировать на своих записях, а не верить охвату в 74 языка.
Нарезка клипов. Модель собирает клипы под музыку, готовит переводы коротких сериалов, комментарии к полнометражным фильмам, PDF-конспекты обучающего видео. При переводе сохраняет индивидуальные особенности оригинального голоса. Для контент-студий и отделов обучения это прямой кандидат в пайплайн.
Обучение по видеодемонстрациям. Модель осваивает новые навыки по видео. Сценарий для внутренней базы знаний: записал экран — получил инструкцию.
Диалоги в реальном времени. Через Qwen-Live Harness с WebSocket и WebRTC. Для голосовых ботов и поддержки.
Риски, которые не в пресс-релизе
- Доступ через Qianwen AI — корпоративная платформа Alibaba. Вопросы хранения данных и трансграничной передачи для российского бизнеса никто не отменял. Это первый фильтр, ещё до технических тестов.
- Цифры «минус 98%» — относительно Qwen3.5-Omni-Plus. Абсолютный прайс и условия по объёму в релизе не раскрыты. Считайте на своём профиле нагрузки.
- OmniCap-IF 28,2 — точные инструкции по видео даются плохо. Не стройте на этом автоматизацию без ручной приёмки.
- Русский язык в охвате есть, отдельных бенчмарков по нему нет. Диалекты и акценты — проверяйте на своих данных.
- Агентный механизм экономит токены, но добавляет этапов. Латентность на длинных записях может вырасти. Для realtime это критично, для батча — нет.
Вердикт за 30 секунд
- Цена — главный аргумент. Минус 98% на аудио и минус 93% на аудио плюс видео превращают мультимодальные пайплайны из проекта в эксперимент.
- Качество неровное: сильное аудио, приличное видео, слабое следование точным инструкциям по видео. Тестируйте на своём сценарии, а не на среднем балле.
- Для российского SMB первый вопрос — не технический, а юридический: доступ через Qianwen AI и работа с данными. Решается раньше, чем бюджет на API.
Что сделать на этой неделе
Возьмите один узкий сценарий, который сейчас делается руками. Расшифровка десяти созвонов. Нарезка клипов из вебинара. Конспект обучающего видео. Прогоните через API и посчитайте две цифры: стоимость обработки часа и долю правок после модели. Если правок меньше половины — считайте экономику на объёме. Если больше — у вас не проблема цены, у вас проблема качества, и падение тарифа её не лечит.