PrismML — исследовательский стартап, основанный сотрудниками Калтеха во главе с профессором Бабаком Хасиби, ударил по давней проблеме: большие языковые модели требуют серьёзных вычислительных ресурсов и облачных сервисов. Компания решила пойти в противоположную сторону — сделать мощные модели рассуждения настолько маленькими, что они влезут в локальное устройство.

На этой неделе PrismML выпустила Bonsai 2 27B — компрессированную версию модели Qwen 3.8 от Alibaba. Исходная модель занимает десятки гигабайт, версия PrismML — 5.9 ГБ. Это в 9-10 раз меньше при сохранении 98% исходной производительности на стандартных бенчмарках (предыдущая версия в марте держала 95%). Первый Bonsai скачали более 11 миллионов раз, что говорит о спросе на компактные решения.

Технически компрессия работает через ternary weights — упрощение весов модели до трёх значений (+1, −1, 0) вместо стандартных 16-битных чисел. Это напоминает известные подходы к квантизации, но Хасиби настаивает, что результаты его команды уникальны по качеству сохранения производительности. 2% потери на бенчмарках — это в реальном использовании едва заметно, учитывая, что сами исходные модели далеко не совершенны.

Важнее практического эффекта — люди, стоящие за проектом. Главный советник PrismML — Ион Стоица из Databricks и Berkeley Sky Computing Lab, который имеет отношение к целому ряду успешных проектов. Стартап уже привлёк инвестиции от Khosla Ventures и Cerberus Capital. Даже слухи о переговорах с Apple говорят о том, что крупные игроки ловят эту волну. Хасиби планирует в ближайшие месяцы выпустить версии для моделей в сотни миллиардов параметров — там, по его словам, компрессия должна работать ещё эффективнее.

Это направление не очень новое — компрессия LLM уже несколько лет активно исследуется. Но PrismML выделяется масштабом результата и скоростью релизов. Главное преимущество локальных моделей — они работают на устройстве пользователя, без отправки данных в облако, без задержек сети, и без текущих расходов после установки.

Для российского рынка компрессия LLM особенно релевантна. Во-первых, из-за геополитических ограничений доступ к облачным сервисам часто затруднён, и локальные решения — это не выбор, а необходимость. Во-вторых, компактные модели можно встраивать в бизнес-приложения без зависимости от чужой инфраструктуры. Компании могут использовать такие модели для автоматизации контента, анализа документов, поддержки пользователей — всё это работает на своих серверах или даже устройствах. Для платформ с блокчейн-интеграциями это открывает возможность встроить ИИ-логику прямо в смарт-контракты без обращения к внешним сервисам.

Пока что это остаётся историей инженерного прогресса, а не прорыва для массовой аудитории — но именно такие решения обычно меняют индустрию незаметно, когда они начинают встраиваться в реальные продукты.