Google ускоряет локальный искусственный интеллект с помощью технологии MTP для моделей Gemma 4

Google ускоряет локальный искусственный интеллект с помощью технологии MTP для моделей Gemma 4

Весной этого года компания Google представила открытые модели Gemma 4, которые обеспечивают высокую производительность при работе на локальных устройствах. Теперь возможности локального ИИ расширяются благодаря выпуску экспериментальных инструментов Multi-Token Prediction (MTP). Эти вспомогательные модели используют метод спекулятивного декодирования для прогнозирования последующих токенов, что значительно ускоряет генерацию текста по сравнению со стандартными методами.

Архитектура и работа на потребительском оборудовании

Линейка Gemma базируется на тех же технологических решениях, что и флагманская нейросеть Gemini, но оптимизирована для запуска без обращения к облачным серверам. В то время как Gemini требует мощностей специализированных тензорных процессоров Google (TPU) и высокоскоростных каналов связи, модели Gemma могут работать на обычных видеокартах. Благодаря процессу квантования (сжатия весов модели) даже самые крупные версии Gemma 4 становятся доступными для использования на домашних ПК.

В обзоре отмечается, что запуск нейросетей на собственном оборудовании позволяет пользователям экспериментировать с ИИ, не передавая личные данные сторонним сервисам. Кроме того, Google сменила лицензию Gemma 4 на Apache 2.0, что дает разработчикам гораздо больше свободы в использовании моделей по сравнению с предыдущими версиями. Тем не менее, аппаратные ограничения большинства пользовательских систем остаются препятствием, для преодоления которого и была внедрена технология MTP.

Преодоление ограничений пропускной способности памяти

Традиционные языковые модели работают авторегрессионно: они создают один токен (фрагмент текста) за другим, основываясь на предыдущем результате. Каждый такой шаг требует значительных вычислительных ресурсов. Проблема локальных систем заключается в том, что обычная видеопамять (VRAM) работает значительно медленнее, чем специализированная память HBM, используемая в серверных ускорителях. В итоге графический процессор тратит много времени на перемещение параметров из памяти в вычислительные блоки, из-за чего часть мощностей простаивает.

Смотрите также:

Смена курса: как администрация Трампа пересматривает подход к регулированию ИИ http://stroybud.com/smena-kursa-kak-administratsiya-trampa-peresmatrivaet-podhod-k-regulirovaniyu-ii/.

Интересности на тему: Архитектура по примеру крыльев бабочки: новый подход к сейсмостойкости зданий

Классные советы в статье "Тестирование 5G: как работают сети в сельской местности США" здесь.

Технология MTP эффективно задействует эти простои. Основные принципы работы системы:

  • Использование легковесных моделей-черновиков (drafters) объемом всего 74 миллиона параметров.
  • Совместное использование кэша ключей и значений (KV-cache), что избавляет систему от необходимости заново просчитывать контекст, уже обработанный основной моделью.
  • Применение разреженного декодирования (sparse decoding) для быстрого отсеивания маловероятных вариантов и выбора наиболее точных токенов.

По словам разработчиков, такой подход позволяет черновику подготавливать варианты текста, пока основная модель занята операциями с памятью, что в итоге делает работу искусственного интеллекта более отзывчивой и быстрой.