В LocalLLaMA набирает обороты тема использования смартфонов как дополнительных вычислительных устройств для локального запуска больших моделей. Один из участников сообщества сумел подключить iPhone в качестве второго GPU к MacBook с 24 ГБ памяти и запустил на этой «гибридной» системе Qwen 3.8 27B. По его замерам, фаза prefill (когда модель обрабатывает весь входной контекст за раз) стала выполняться на 29–44% быстрее, чем на самом MacBook.
Идея сама по себе не новая: распределённые вычисления на гетерогенной железе обсуждают давно. Но попытка «втянуть» мобильное устройство в serious ML-inference — это всё ещё редкость на практике. Обычно такие эксперименты либо останавливаются на прототипе, либо требуют значительного overhead на синхронизацию и передачу данных между устройствами, что съедает весь выигрыш. Здесь же человек обошёлся без громоздких фреймворков, используя то, что под рукой.
Сообщество реагирует неоднозначно. Техническая часть интересует — вопросы летят про пропускную способность канала между устройствами, latency отдельных операций и энергопотребление. Но скептицизм обоснован: нужны и другие замеры (не только prefill, но и decode фаза), тесты с разными размерами моделей, и главное — вопрос стоимости: стоит ли игра свеч, если для ускорения надо держать рядом второе дорогое устройство, вместо того чтобы просто купить GPU.
Для российского рынка практическое применение этого подхода пока ещё теоретическое. Основной кейс остаётся один: разработчик локально тестирует модель на гибридной железе там, где выделить отдельную видеокарту экономически нецелесообразно, или просто нет физического места. В production и даже в полупроизводственном pipeline это, скорее всего, останется редкостью. Но само направление — размещение части вычислений модели на мобильных чипах с переиспользованием их матричных ускорителей — это то, над чем точно работают крупные лаборатории. Вопрос в том, когда такая интеграция станет прозрачной для пользователя, а не требует ручной оптимизации под каждую конкретную задачу.
Что важно для читающей сообщество аудитории: если ты экспериментируешь с quantized моделями локально, этот подход стоит иметь в виду, но не как решение, а как направление исследования. Если же ты запускаешь сервис на inference — жди, когда инструменты созреют, прежде чем пытаться внедрить такую архитектуру.