Новая разработка Together AI под названием ATLAS (AdapTive-LeArning Speculator System) обещает сделать вывод крупных языковых моделей до четырёх раз быстрее — без смены железа. Ключ к прорыву — способность системы самообучаться на реальных рабочих нагрузках.
Невидимая стена масштабирования ИИ
Компании, активно внедряющие искусственный интеллект, сталкиваются с неожиданным пределом производительности. Главный виновник — статические спекуляторы, вспомогательные ИИ-модели, ускоряющие процесс вывода (inference), но не умеющие адаптироваться к изменяющимся задачам.
Как пояснил главный научный сотрудник Together AI Три Дао (Tri Dao), эти модели хорошо работают, пока рабочая нагрузка стабильна. Но стоит компаниям перейти, например, с Python на Rust, и скорость резко падает — спекулятор просто не узнаёт новый контекст
.
Что делает ATLAS
ATLAS решает проблему “дрейфа рабочих нагрузок”, создавая живую систему, которая учится на лету. Она состоит из трёх ключевых компонентов:
1. Статический спекулятор
Тяжеловесная модель, обученная на больших объёмах данных, создаёт стабильный базовый уровень производительности. Это “скоростной пол”, обеспечивающий надёжность.
2. Адаптивный спекулятор
Лёгкая модель, которая обучается в реальном времени на реальном трафике. Она подстраивается под новые домены и сценарии использования, повышая точность и ускоряя вывод по мере накопления опыта.
3. Контроллер уверенности
Интеллектуальный оркестратор, который выбирает, какой спекулятор использовать в данный момент. Он регулирует глубину “предсказаний наперёд” в зависимости от уверенности системы.
«Пользователям не нужно ничего настраивать — мы уже подобрали оптимальные параметры, чтобы получить максимальное ускорение», — отметил Дао.
Скорость, сравнимая с кастомными чипами
В тестах Together AI система ATLAS достигла 500 токенов в секунду при работе с моделью DeepSeek-V3.1 на GPU Nvidia B200. Это результат, сравнимый с производительностью специализированных решений, таких как Groq.
Дао подчёркивает: Мы видим, что за счёт программных и алгоритмических улучшений можно догнать и даже обогнать специализированное железо
.
Как это работает: обмен памятью на вычисления
Во время вывода большая часть ресурсов GPU простаивает, ожидая доступ к памяти. Спекулятивное декодирование меняет баланс: вместо генерации по одному токену, система предлагает сразу несколько, проверяя их параллельно. Это снижает нагрузку на память и повышает использование вычислительных блоков.
По сути, ATLAS — это умное кэширование для ИИ. Вместо хранения готовых ответов, как в Redis, она учится предугадывать поведение модели и ускорять обработку похожих шаблонов.
Где это особенно полезно
- Обучение с подкреплением (RL): когда политика быстро эволюционирует, адаптивный спекулятор остаётся в синхронизации с изменениями.
- Меняющиеся сценарии использования: компании переходят от чат-ботов к генерации кода или автоматизации рабочих процессов, а ATLAS подстраивается мгновенно.
Вывод: новая эпоха адаптивного вывода
ATLAS уже доступен пользователям Together AI без дополнительной платы. Компания сообщает, что количество разработчиков на платформе превысило 800 тысяч, почти удвоившись за полгода.
Главный вывод прост: будущее вывода ИИ — за адаптивными системами. Вместо статичных моделей, обученных однажды, предприятия всё чаще будут полагаться на самообучающиеся алгоритмы, способные совершенствоваться в реальном времени. Это делает софт снова важнее “железа”.
