TurboQuant: новая технология для оптимизации ИИ
«TurboQuant не только уменьшает объём памяти, но и сохраняет точность работы ИИ,» — заявили представители компании, анонсировавшие новую технологию на конференции ICLR 2026.
TurboQuant решает одну из ключевых проблем современных ИИ-систем — высокие требования к памяти во время выполнения задач. Эта технология позволяет сократить объём оперативной памяти для ИИ в шесть раз без потери производительности.
Алгоритм TurboQuant основан на методах PolarQuant и QJL, что делает его уникальным в своей области. Он сжимает кэш KV до 3 бит на значение, в то время как отраслевой стандарт составляет 16 бит.
Использование 4-битного TurboQuant ускорило вычисление механизма внимания в восемь раз по сравнению с 32-битным вариантом. Это открывает новые горизонты для разработки более эффективных ИИ-систем.
«Новая технология TurboQuant обладает куда большей значимостью, ведь она способна значительно повлиять на все компьютерные технологии,» — добавили эксперты.
Согласно информации, TurboQuant сохраняет точность работы ИИ при обработке больших объёмов данных в реальном времени, что является важным аспектом для многих приложений.
Однако, несмотря на многообещающие результаты, технология TurboQuant остаётся лабораторным достижением и ещё не получила широкого применения. Сроки внедрения алгоритма в собственные сервисы Google не раскрыты.
Капитализация компаний, производящих оперативную память, снизилась на фоне анонса TurboQuant. Например, капитализация Samsung Electronics упала на 4.71%, SK Hynix — на 6.23%, Micron Technology — на 6.9%, а SanDisk — на 11%.
«TurboQuant влияет только на кэш KV в процессе инференса и не затрагивает ни веса моделей,» — отметили разработчики, подчеркивая, что это может изменить подход к разработке ИИ.
Details remain unconfirmed.