Bonsai 2 27B ужался до 5,9 ГБ — 98,2% качества заявила сама PrismML

PrismML выпустила Bonsai 2 27B 17 сентября 2026 года: модель на основе Qwen3.8 27B получила файл языковых весов размером 5,9 ГБ. Дату выпуска, происхождение модели и сокращение объёма примерно в девять-десять раз подтверждает публикация TechCrunch от 17 сентября.
В официальных данных о выпуске PrismML приводит совокупные оценки 83,9 у Ternary Bonsai 2 27B и 85,4 у полноточной Qwen3.8 27B по набору из 20 испытаний: их отношение составляет заявленные 98,2%. Там же указаны 27,8 млрд параметров, бесплатное распространение по лицензии Apache 2.0 и скорость до 143 токенов в секунду на NVIDIA GeForce RTX 5090 — всё это измерения и характеристики, опубликованные производителем.
Что именно занимает 5,9 ГБ
Цифра 5,9 ГБ относится к компактному файлу языковых весов, а не ко всему объёму памяти, который потребуется запущенной мультимодальной системе. Основная часть весов представлена троичными значениями −1, 0 и +1 с групповым масштабированием, что резко сокращает размер по сравнению с полноточной версией.
Разбор опубликованных файлов и таблиц показывает, что загруженный компактный файл занимает около 5,95 ГБ, альтернативная упаковка — около 7,21 ГБ, а отдельный модуль обработки изображений добавляет не менее 0,63 ГБ. Это анализ доступных материалов PrismML, но не независимое воспроизведение заявленной производительности модели.
Следовательно, 5,9 ГБ нельзя автоматически считать требованием ко всей оперативной или видеопамяти. При работе дополнительно нужны память среды исполнения, служебные буферы и кэш контекста, объём которого зависит от длины запроса. Возможность загрузить веса ещё не гарантирует приемлемую скорость на длинных диалогах или многошаговых заданиях.
Как получены заявленные 98,2%
Совокупная оценка объединяет испытания, проверяющие разные способности. В блок знаний и рассуждений входят MMLU-Redux, GPQA Diamond и AA-LCR; в математический — GSM8K, MATH-500, AIME25 и AIME26; в программный — HumanEval+, MBPP+, LiveCodeBench v6 и BigCodeBench.
Следование инструкциям оценивали через IFEval и IFBench, работу с инструментами — через τ²-Bench и BFCL v3. Визуальные задачи представлены CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA и OCRBench v2. Опубликованная таблица относится к режиму рассуждений с максимальным уровнем вычислительного усилия.
Показатель 98,2% — не доля правильных ответов. Это отношение двух агрегированных результатов, полученных после объединения испытаний с разными задачами и шкалами. Близость итоговых средних поэтому не доказывает одинаковое качество в каждом тесте и тем более не гарантирует равенства на конкретной рабочей нагрузке.
Что скрывает единый средний результат
В отдельных испытаниях разрыв меняется по направлению и величине. Компактная модель почти совпадает с полноточной в части программных тестов, а в некоторых математических заданиях и проверках следования инструкциям оказывается выше. В других категориях, включая сложные вопросы, программирование, распознавание текста и анализ документов, отставание заметнее.
Отдельные испытания длительной работы программного агента не входят в заявленную совокупность из 20 тестов. В опубликованных материалах результат компактной модели в Terminal-Bench 2.1 и SWE-bench Verified составляет примерно три четверти от показателя полноточной основы. Это особенно существенно для задач, где ранняя ошибка влияет на последующие действия агента.
Кроме того, карточка модели и более полный технический набор используют разные списки испытаний и разные абсолютные оценки, хотя оба расчёта после округления дают 98,2%. Совпадение процента при различающемся составе подчёркивает зависимость агрегата от выбора тестов.
Лицензия и скорость не снимают вопрос о внедрении
Apache 2.0 разрешает изменять и распространять модель, в том числе использовать её в коммерческих продуктах при соблюдении условий лицензии. Однако лицензия не гарантирует точность ответов, безопасность применения или пригодность модели для конкретной отрасли.
Значение 143 токена в секунду относится к конфигурации производителя с GeForce RTX 5090 и не является универсальной скоростью Bonsai 2 27B. На результат влияют вариант весов, поддержка вычислительных ядер, длина контекста, размер пакета запросов и то, измеряется ли обработка входа или генерация ответа. Сопоставимых независимых измерений на широком наборе систем пока нет.
Как воспроизвести проверку на своих задачах
До рабочего внедрения Bonsai 2 27B следует сравнивать с используемой сейчас моделью на одинаковых запросах и настройках. Проверка должна охватывать именно те типы входных данных, которые встречаются в продукте: тексты, извлечение фактов, код, вызовы инструментов и изображения, если мультимодальность действительно нужна.
- Собрать обезличенный набор реальных задач и заранее разделить его по категориям, чтобы среднее не скрыло провал в критическом сценарии.
- До запуска определить метрики: фактическую точность, прохождение тестов кода, соблюдение формата ответа, ошибки инструментов и критерии ручной оценки.
- Зафиксировать версию и упаковку весов, сборку среды исполнения, системную инструкцию, параметры генерации, оборудование и длину контекста.
- Запустить одни и те же задания на сравниваемых моделях, а ответы для ручной проверки перемешать и скрыть их происхождение.
- Отдельно измерить обработку входа, скорость генерации, пиковое потребление оперативной и видеопамяти и устойчивость повторных многошаговых запусков.
На 20 сентября подтверждены выпуск модели, открытая лицензия и наличие компактного файла языковых весов. Заявление о сохранении 98,2% совокупного результата и скорость до 143 токенов в секунду пока остаются результатами PrismML; для оценки практического преимущества нужны независимые прогоны на разных системах и прикладных наборах задач.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.