Стартап PrismML, основанный группой исследователей Caltech, представил модель Bonsai 2 27B. Это сжатая версия открытой Qwen3.8 27B от Alibaba: исходная модель занимает в памяти в 9–10 раз больше места, тогда как Bonsai 2 укладывается в 5,9 ГБ. Такой объём позволяет запускать рассуждающую языковую модель на обычном ПК, а в перспективе — и на флагманском смартфоне. Компания привлекла $22,25 млн посевных инвестиций; среди инвесторов — Khosla Ventures, Cerberus Capital и Caltech.
Метод сжатия, который использует PrismML, строится на так называемых тернарных весах. Обычно каждый параметр модели хранится в 16 битах, но PrismML сводит значение к трём вариантам: +1, −1 или 0. Чем меньше бит на параметр, тем компактнее модель. По словам генерального директора Бабака Хассиби, профессора Caltech и специалиста по технологиям сжатия, ключевое отличие PrismML от конкурентов в том, что её модели почти не теряют в качестве. Bonsai 2 воспроизводит 98% агрегированных бенчмарк-оценок Qwen — против 95% у первой Bonsai, вышедшей в марте. Первая версия уже скачана более 11 млн раз, ещё более компактные модели — 2,6 млн раз.
| Модель | Размер в памяти | Сохранение бенчмарк-оценок | Дата выхода |
|---|---|---|---|
| Bonsai (первая версия) | н/д | 95% | март |
| Bonsai 2 27B | 5,9 ГБ | 98% | текущий релиз |
Достичь 100% паритета по бенчмаркам, скорее всего, не удастся: сжатие всегда будет сказываться на результате, признаёт Хассиби. Но и сам паритет — величина довольно условная. Языковые модели и в несжатом виде ошибаются, а бенчмарки не полностью отражают реальные задачи, поэтому потеря 2% вряд ли заметно скажется на практике. К тому же на точность влияет и программная обвязка, в которой работает модель.

Следующая цель PrismML — применить свой метод к более крупным моделям. «Следующие модели, которые мы выпустим, надеюсь, в ближайшие пару месяцев, будут в диапазоне нескольких сотен миллиардов параметров, и я ожидаю, что там будет проще сохранить интеллект», — сказал Хассиби TechCrunch. По его словам, чем больше модель, тем больше в ней «места» для сжатия без потери качества, поэтому для крупных моделей выйти на 100% проще.
PrismML — не единственная компания в этой нише. Сжатием LLM занимается, например, Multiverse Computing, основанная известным профессором из испанского Donostia International Physics Center и привлёкшая значительно больше средств. Советником PrismML выступает Ион Стойка — соучредитель Databricks и директор Sky Computing Lab в Беркли, из которого вышли такие проекты, как Letta и SGLang. Стойка связывает ценность технологии с переносом вычислений на устройства пользователя: «У вас будет интеллект под рукой, и он будет бесплатным, потому что работает на уже купленном вами устройстве. Он также будет приватным, потому что вы не отправляете данные в облако».
Остаётся открытым вопрос, насколько заявленные результаты подтвердятся на реальных задачах, а не на бенчмарках, и удастся ли сохранить качество при переходе к моделям на сотни миллиардов параметров. Отдельная неопределённость — слухи о переговорах с Apple: Хассиби отказался их комментировать. Пока у PrismML нет ни крупного раунда, ни подтверждённых партнёрств — только технические результаты и растущее число скачиваний.


