GLM-5.3-Flash: Что нового, как получить доступ и бесплатные альтернативы (2026)

Z.ai опубликовала открытые веса для GLM-5.3-Flash 25 августа 2026 года, а документация для разработчиков была обновлена 26 августа.
Вся информация ниже взята из двух официальных источников. Первый — это карточка модели в репозитории zai-org/GLM-5.3-Flash. Второй — документация для разработчиков Z.ai. Оба источника были изучены 27 августа 2026 года.
Что представляет собой GLM-5.3-Flash
Карточка модели открывается заявлением, которое стоит процитировать дословно. Z.ai пишет: «Мы представляем GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5».
Ее архитектуру определяют два числа. В карточке указано «320 млрд параметров в общей сложности и всего 18 млрд активных параметров», что указывает на разреженную архитектуру смеси экспертов, а не на плотную.
В карточке приводится одно сравнительное утверждение. В ней говорится, что модель «превосходит GLM-5.2 в бенчмарках и реальных рабочих нагрузках при стоимости в десять раз ниже». Также модель описывается как «приближающаяся к Claude Opus 4.8 в тестах на программирование и работу агентов».
Лицензия — это самая важная часть для тех, кто хочет запустить модель. В метаданных репозитория указана MIT, которая является одной из самых свободных и широко используемых лицензий.
Изменения в архитектуре, со слов разработчика
Z.ai описывает три конкретных изменения, а не просто общее обновление.
Новая базовая модель. В карточке указано, что GLM-5.3-Flash «создана на основе заново обученной базовой модели, архитектура и метод обучения которой были переработаны с упором на возможности и эффективность».
Гибридное внимание. Впервые в этой серии Z.ai объединяет «разреженное и линейное внимание, резко снижая затраты на обслуживание длинного контекста при сохранении точной работы с ним».
mHC. Модель использует технологию, которую в карточке называют «гиперсвязями с ограничением на многообразии (mHC) для дальнейшего повышения эффективности масштабирования».
Обучающий корпус также упомянут. Z.ai объясняет прирост эффективности использованием «нашего новейшего мультимодального корпуса предварительного обучения объемом 30 трлн токенов».
Где начинаются и заканчиваются заявления о мультимодальности
В документации четко описано, как передаются изображения. В руководстве Z.ai указано, что нужно «добавить блок контента с type: image_url в messages[].content[]», передав либо URL-адрес изображения, либо URL-адрес данных в формате Base64.
Поддерживается отправка более одного изображения за один запрос. На той же странице отмечается, что можно добавить несколько изображений, включив несколько таких блоков.
Другим важным моментом является контекст. В документации заявлена поддержка «окна контекста в 1 млн токенов», и сноски к оценкам подтверждают это, сообщая об одном запуске бенчмарка «в контексте до 1 млн токенов».
Что не измеряется в карточке модели
Этот раздел добавлен потому, что пробелы в тестировании порой важнее основных достижений.
В карточке модели приводятся результаты бенчмарка изображений под названием BabyVision. Также там описана предобработка: размер изображений изменяется «так, чтобы их меньшая сторона составляла не менее 1,5 тыс. пикселей», так что возможности компьютерного зрения действительно измеряются.
Бенчмарки для таблиц не упоминаются. Поиск по карточке модели слов table, spreadsheet, document и chart дает нулевой результат. Вместо этого упомянутые тесты охватывают программирование, агентов, терминалы и автоматизацию.
Это отсутствие не является признаком слабости. Это просто означает, что никто не должен гарантировать вам надежное распознавание скриншотов таблиц этой моделью, поскольку разработчик не опубликовал соответствующих показателей.
Стоит отметить еще одно упущение. Единственная цифра в разделе цен в документации сопровождается оговоркой. Из-за этого ее нельзя приводить в качестве фиксированного тарифа, поэтому здесь она не упоминается.
Как получить доступ
Существует два пути, и они подходят для разных задач.
| Путь | Что вам потребуется | Где это описано |
|---|---|---|
| Облачный API | Аккаунт на Z.ai API Platform | Руководство по GLM-5.3-Flash в документации для разработчиков Z.ai |
| Открытые веса | Собственные графические процессоры (GPU) и один из четырех фреймворков для развертывания | Карточка модели в репозитории Hugging Face |
Что касается облачного варианта, в документации указано, что GLM-5.3-Flash «теперь полностью доступна в тарифном плане GLM Coding Plan». В той же строке упоминаются нативные мультимодальные возможности и троекратное увеличение квоты.
Перед планированием рабочей нагрузки стоит ознакомиться со сносками к оценкам. В них упоминаются бенчмарки для программирования, терминала, агентов и автоматизации, и для каждого из них указана собственная длина контекста и модель-судья. Это дает представление о том, под что разработчик оптимизировал модель.
Для локального развертывания в карточке указаны четыре фреймворка со ссылками на инструкции для каждого: SGLang, vLLM, TokenSpeed и KTransformers. Технический отчет по этой серии моделей опубликован на arXiv.
Бесплатные альтернативы с открытыми весами
Саму GLM-5.3-Flash можно скачать бесплатно по лицензии MIT. Если вам нужен второй вариант, то ключевыми критериями для сравнения должны быть лицензия и модальность, а не позиции в бенчмарках.
Ближайшим опубликованным аналогом является Qwen3.8. В ее карточке модели на Hugging Face указана лицензия Apache-2.0, а сама модель принимает текст, изображения и видео. Заявленный нативный контекст составляет 262 144 токена с возможностью расширения до одного миллиона.
Наш обзор Qwen3.8 подробно описывает этот релиз. Сравнение двух карточек моделей — самый быстрый способ понять, какая из них лучше подходит для вашего оборудования.
Практическая разница заключается в том, что вы уже используете. Обе модели работают через одни и те же открытые фреймворки, поэтому переход обычно требует лишь изменения конфигурации, а не переписывания кода.
Модель — это еще не готовый результат
Веса и API дают вам лишь техническую возможность. Они не предоставят вам отчет, презентацию или очищенную таблицу, которых от вас ждут.
Этот «последний шаг» — вопрос рабочего процесса, а не самой модели. Powerdrill Bloom берет ваш файл и выдает готовый результат.
На ее странице коннекторов указана поддержка работы с Excel, TSV и CSV наряду с преобразованием текста в SQL. На странице распознавания изображений описана загрузка файлов JPG, JPEG, PNG, WEBP и GIF. После этого вы можете задавать вопросы по ним на естественном языке.
Обратите внимание на честное ограничение, указанное на этой второй странице. Там описывается лишь извлечение ключевых моментов из изображения и перевод сгенерированного текста. Там не говорится об извлечении структурированной таблицы из фотографии, поэтому не стоит на это рассчитывать.
Тарифные планы приведены на странице с ценами, а бесплатного уровня вполне достаточно, чтобы оценить рабочий процесс. Если вы хотите протестировать этот финальный этап на реальном экспорте данных, начните с Powerdrill Bloom.
Часто задаваемые вопросы
Является ли GLM-5.3-Flash бесплатной для использования?
Веса распространяются по лицензии MIT, поэтому за их скачивание и самостоятельный запуск плата за лицензию не взимается. Расходы на хостинг ложатся на вас, а облачный API представляет собой отдельный коммерческий вариант.
Может ли GLM-5.3-Flash распознавать изображения?
Да. В документации для разработчиков описан блок контента image_url, который принимает URL-адрес или URL-адрес данных в формате Base64, а также поддерживает отправку нескольких изображений в одном запросе.
Каков размер окна контекста?
В документации зафиксировано окно контекста в 1 млн токенов. Одна из опубликованных оценок проводилась при полной загрузке этого контекста.
Понимает ли GLM-5.3-Flash таблицы и документы?
В карточке модели не опубликованы результаты тестов для таблиц или документов, поэтому ссылаться на официальные показатели разработчика нельзя. Относитесь к чтению электронных таблиц как к непроверенной функции, а не как к заявленной возможности.
На чем ее можно запустить?
В карточке модели упоминаются SGLang, vLLM, TokenSpeed и KTransformers, а также приведены ссылки на руководства или инструкции для каждого из них. Требования к оборудованию следует искать в документации к этим фреймворкам, а не в самой карточке.