Главная/Блог/Открытые веса
Локальные модели

Две открытые модели в один день. Одна поедет на вашем маке, вторая — только на стойке серверов

Сравнение требований к железу: GLM-5.3-Flash против Qwen3.8-Flash-Next
Обе модели вышли 26 августа с открытыми весами. Разница в требованиях к железу — почти пятикратная

26 августа вышли сразу две открытые модели: GLM-5.3-Flash от китайской Z.ai и Qwen3.8-Flash-Next от Alibaba. У обеих веса выложены в открытый доступ, обе разлетелись по новостям как «бесплатные». Только для одной нужен серверный узел из четырёх видеокарт H200, а вторая заводится на маке, который может стоять у вас на столе.

Слово «открытая» говорит про лицензию. Оно ничего не говорит про то, влезет ли модель в вашу память. Разбираю, откуда взялась разница и что из этих двух реально ставить себе.

Что именно вышло 26 августа

GLM-5.3-Flash это модель на 320 миллиардов параметров, из которых на каждый токен работают 18 миллиардов. Такая архитектура называется MoE, «смесь экспертов»: модель большая, но на каждый запрос включается только её часть. Нативно мультимодальная, то есть картинки понимает не приделанным сбоку модулем, а сама. Контекст в API — миллион токенов. Веса лежат на Hugging Face под лицензией MIT.

Забавная деталь: до официального выхода модель катали анонимно под именем ox-alpha на OpenCode и OpenRouter. Люди тестировали её вслепую, не зная чью, и только потом Z.ai призналась.

У Qwen3.8-Flash-Next 125 миллиардов основных параметров и 6 миллиардов активных на токен. Плюс отдельно n-gram таблица на 51 миллиард и MTP-голова на 4 миллиарда, к ним вернёмся, в них вся соль. Тоже нативно мультимодальная, родной контекст 262 144 токена, растягивается до миллиона. Alibaba прямо называет её предварительным показом архитектуры будущей Qwen4.

Теперь про железо, и вот тут расходятся дороги

GLM-5.3-Flash в родном формате FP8 весит около 306 гигабайт. Для запуска нужно минимум четыре видеокарты H200 или восемь H100 по 80 гигабайт. Это не «мощный компьютер», это серверный узел, который в аренду берут по часам.

Qwen3.8-Flash-Next в самом маленьком варианте заводится на 75 гигабайтах обычной или объединённой памяти, комфортно на 96. А вариант на 85 гигабайт работает на маке с чипом M5 Max и 64 гигабайтами памяти. С картинками. Со скоростью около 36 токенов в секунду — это быстрее, чем вы читаете.

GLM-5.3-FlashQwen3.8-Flash-Next
Параметров всего320 млрд125 млрд + 51 млрд таблица
Работает на токен18 млрд6 млрд
Вес чекпоинта~306 ГиБ (FP8)~85 ГБ (сжатый вариант)
Минимум железа4×H200 или 8×H10064–75 ГБ памяти
Доманетда
Контекст1 млн (API)262 144, до 1 млн
ЛицензияMITQwen Community 1.0

Откуда взялась разница. Механизм

Первое, что приходит в голову: 125 меньше 320, поэтому и требований меньше. Только пропорция не сходится. В памяти разница почти пятикратная, а в параметрах двух с половиной.

Дело в том, что считать надо не параметры, а то, что реально попадает в память. У Qwen из 177 миллиардов параметров 51 миллиард приходится на n-gram таблицу. Не веса в привычном смысле, а справочник, к которому модель обращается по мере надобности. Такую вещь незачем держать в памяти целиком: она спокойно лежит на диске и читается кусками.

Отсюда фокус, который и делает всю историю: файл на 85 гигабайт запускается на машине с 64 гигабайтами памяти, потому что 39 гигабайт из него в память вообще не заходят.

Слово «открытая» относится к лицензии, а не к вашему компьютеру. Проверять надо не число параметров в заголовке, а вес чекпоинта и то, какая его часть обязана лежать в памяти.

У GLM такого запаса нет. Там 306 гигабайт, которые нужно разместить целиком, и никакой хитростью это не обойти.

Деньги и лицензии, они тут связаны

GLM-5.3-Flash в API стоит 15 центов за миллион входящих токенов и 50 центов за миллион исходящих. До 9 сентября действует скидка вдвое. Для сравнения масштаба: это в разы дешевле того, что берут западные лаборатории за свои старшие модели.

И вот теперь сложите две вещи. Z.ai отдаёт веса под MIT, самой свободной лицензией из ходовых: бери и делай что хочешь, включая коммерцию. И одновременно продаёт доступ по 15 центов. Щедрость? Посчитайте, во что вам обойдётся стойка из четырёх H200, чтобы этой щедростью воспользоваться. Открытость, которой почти никто не может воспользоваться физически, ничего не стоит тому, кто её объявил: всё равно почти все придут в API. (Это моё прочтение расклада, официальных объяснений Z.ai на этот счёт я не видела.)

У Alibaba расклад ровно обратный. Модель реально ставится на своё железо, и лицензия сторожит. Qwen Community License 1.0 разрешает коммерческое использование, но компании с аудиторией больше 100 миллионов активных пользователей в месяц или выручкой больше 20 миллионов долларов в месяц обязаны указывать имя модели, а бизнесам вида «модель как услуга» нужна отдельная лицензия.

То есть чем доступнее модель для запуска, тем внимательнее её лицензия смотрит на того, кто на ней зарабатывает. Логично, кстати.

Что из этого следует для вас

Если у вас мак с 64 гигабайтами объединённой памяти и больше, Qwen3.8-Flash-Next первое, что стоит попробовать из свежего. Мультимодальная, быстрая, лицензия для обычного бизнеса не мешает.

Если у вас 32 гигабайта, обе эти модели мимо. Но это не значит, что локальные модели вам заказаны: под такую память живёт целый слой моделей поменьше, и там всё в порядке. Сколько памяти под что нужно, я подробно разбирала в статье про Mac mini M6 и Mac Studio M5 Ultra.

Если вы смотрите на GLM-5.3-Flash, смотрите на неё как на облачную модель с дешёвым API, а не как на «свою». Открытые веса тут приятный бонус для тех, у кого есть серверная стойка, и повод не бояться, что модель завтра выключат.

Коротко

ВопросОтвет
Обе бесплатные?Веса открыты у обеих. Запустить бесплатно можно только Qwen
Что ставить на макQwen3.8-Flash-Next, от 64 ГБ памяти
Что брать через APIGLM-5.3-Flash, 15 центов за миллион токенов, до 9 сентября вдвое дешевле
На что смотреть в анонсахНе на число параметров, а на вес чекпоинта

И общее правило, которое я себе вывела из этой пары. Когда в новостях пишут «вышла открытая модель», первый вопрос не «сколько параметров», а «сколько весит файл и какая его часть обязана быть в памяти». Второй вопрос: что написано в лицензии про деньги. Ответы на эти два вопроса меняют картину сильнее, чем любые бенчмарки в анонсе.

Новости и фишки про искусственный интеллект

Разбираю их у себя в телеграме: что вышло, как работает и стоит ли вашего времени.