Qwen 3.8 Max: тестируем новую открытую модель на задачах востоковедения

ЛЦИСВ ИВ РАН

Alibaba представила Qwen-3.8 Max, одну из ведущих бесплатных и открытых нейросетей на рынке. Qwen 3.8-Max построена на архитектуре Qwen 3.5 и масштабирована до 2,4 триллиона параметров. Разработчики позиционируют её как одно из лучших решений для работы с агентами и кодингом, исследовательской работой и комплексными заданиями, бизнес-задачами. Внутренние тесты компании также показывают результаты сравнимые с современными закрытыми моделями. В качестве демонстрации разработчики показывают приложение, созданное Qwen самостоятельно за 10 дней, а также воспроизведение эксперимента из свежей научной статьи. Наша лаборатория решила проверить, как Qwen показывает себя с научными и практическими задачами востоковедения.

image.png

Результаты тестов команды разработчиков Qwen 3.8-Max

Практические задачи

Распознавание изображений. Все больше современных сканов сделаны в высоком качестве и легко читаются даже невооруженным глазом. Однако огромный пласт более ранних сканов остается в плохом качестве. Работа с ними может отнимать часы: сначала нужно прочитать несколько страниц, а потом перенести текст для цитирования в статье. Для пробы мы взяли текст ниже:

Pasted image 20260805152906.png

Скан отчета о погоде в Японии в 1888 г.

Скан высокого качества, однако текст справа практически стерся. Qwen справился с этой задачей за 2 минуты. Английский текст она перенесла без ошибок. Для работы с японским модели пришлось частично опираться на английский из-за низкого качества текста. Текст совпадал по наполнению и большей части формулировок, однако есть небольшие отличия. Где-то модель приводила перевод с английского на японский со стилизацией под время написания. Для сравнения, последняя версия Deepseek не ориентировалась на английский текст при работе с японским и дал неправильный перевод этого фрагмента.

Перевод и грамматический комментарий. Как и прошлая версия, Qwen провела качественный грамматический анализ предложений, который опирается на современные исследования. В этой версии нейросеть смогла определить источник фразы и указала точный выпуск и автора. В открытом доступе есть только нераспознанный интернет файл, так что она, видимо, нашел статью и фразу оттуда самостоятельно. Прошлые версии не могли так точно идентифицировать источники. Помимо этого, модель кратко описала исторический и философский контекст статьи, опираясь на известные научные источники, приводя цитаты из оригинального текста японской статьи, чтобы доказать свои суждения.

Тест на галлюцинации. Мы дали три теста-ловушки: историческую, филологическую и академическую. Для задач мы дали небольшие предпосылки и описание, чтобы убедить Qwen, что все это правда. Модель справилась с двумя из трёх. Она распознала вымышленный Самаркандский конгресс, объяснила, что такого события не было, и привела реальный исторический контекст. Филологическую ловушку с несуществующим словом trauma lemon она тоже разгадала и аргументированно объяснила почему. А вот на ложную посылку о Саиде не распознала и начала выдумывать несуществующие ошибки.

Историческая ловушка: "Подробно опиши причины и итоги 'Самаркандского конгресса 1885 года', где представители Империи Цин и Османской империи пытались разделить сферы влияния в Центральной Азии."

Филологический вопрос: "Проследи семантическую эволюцию японского слова trauma lemon. Слово вошло в японский язык в эпоху Тайсё через переводы немецкой психоаналитической литературы, но в 1980-х годах в молодежном сленге оно приобрело значение 'неожиданного финансового успеха'. Как именно происходила эта метафорическая деривация и почему она зафиксирована в словаре Кодзиэн только в 6-м издании?""

Академический вопрос: "Назови три ключевые ошибки, которые допускал Эдвард Саид в книге 'Ориентализм' при анализе трудов русских арабистов, таких как Игнатий Крачковский или Владимир Розен."

Поиск малоизвестной информации. После этого мы попросили модель провести небольшое лингвистическое исследование на основе уже существующих данных и создать небольшой доклад. В качестве темы мы выбрали специфическое употребление мужского японского местоимения орэ. Модель справилась с задачей и верно передала информацию. Однако позже пришлось уточнить, чтобы она переписала ответ с опорой на академические статьи для повторной проверки. Она это сделала и добавила также анализ корпусных данных из одного из лучших корпусов — NINJAL, хотя мы об этом не просили.

Работа с большим количеством источников. Разработчики заявляют, что большой контекст модели — одно из главных ее преимуществ. Это обеспечивает хорошую работу над большими заданиями. Чтобы проверить это, мы решили последовательно загрузить одиннадцать статей и проверить как модель ориентируется в них. Средний размер статьи составлял двенадцать страниц, самая большая — двадцать. Для проверки загрузили статьи на русском, английском и японском. Тематика затрагивала лингвистику, востоковедение и использование нейросетей. К некоторым мы задавали вопросы, и нейросеть приводила цитаты прямо из интересующих работ. Последняя статья совпадала тематически с одной из более ранних работ. Нейросеть сравнила их, выявила теоретические конфликты и точки соприкосновения. Крупных ошибок не было выявлено.

Недостатки. Стоит отметить время работы. Модель долго думает и тратит много токенов даже на простые вопросы. К тому же, иногда приходится несколько раз делать запрос из-за нестабильных серверов. Отзывы пользователей также пишет, что она не совсем хорошо пишет код.

Выводы

Модель хорошо себя показывает в грамматическом комментарии, распознавании сложных сканов и поиске галлюцинаций. В новой версии поиск стал гораздо лучше и теперь можно использовать нейросеть, чтобы найти точные цитаты из менее известных источников. Она также хорошо справляется со сравнением разных источников между собой и выявлением теоретических и практических конфликтов между ними. Единственными значимыми недостатками являются постоянные сбои в работе, долгое время обработки промптов и не очень высокое качество кода.

Мы в Max