Together AI представила ATLAS — адаптивную систему ускорения вывода ИИ на 400%

Автор: | 15.10.2025

Новая разработка Together AI под названием ATLAS (AdapTive-LeArning Speculator System) обещает сделать вывод крупных языковых моделей до четырёх раз быстрее — без смены железа. Ключ к прорыву — способность системы самообучаться на реальных рабочих нагрузках.

Невидимая стена масштабирования ИИ

Компании, активно внедряющие искусственный интеллект, сталкиваются с неожиданным пределом производительности. Главный виновник — статические спекуляторы, вспомогательные ИИ-модели, ускоряющие процесс вывода (inference), но не умеющие адаптироваться к изменяющимся задачам.

Как пояснил главный научный сотрудник Together AI Три Дао (Tri Dao), эти модели хорошо работают, пока рабочая нагрузка стабильна. Но стоит компаниям перейти, например, с Python на Rust, и скорость резко падает — спекулятор просто не узнаёт новый контекст.

Что делает ATLAS

ATLAS решает проблему “дрейфа рабочих нагрузок”, создавая живую систему, которая учится на лету. Она состоит из трёх ключевых компонентов:

1. Статический спекулятор

Тяжеловесная модель, обученная на больших объёмах данных, создаёт стабильный базовый уровень производительности. Это “скоростной пол”, обеспечивающий надёжность.

2. Адаптивный спекулятор

Лёгкая модель, которая обучается в реальном времени на реальном трафике. Она подстраивается под новые домены и сценарии использования, повышая точность и ускоряя вывод по мере накопления опыта.

3. Контроллер уверенности

Интеллектуальный оркестратор, который выбирает, какой спекулятор использовать в данный момент. Он регулирует глубину “предсказаний наперёд” в зависимости от уверенности системы.

«Пользователям не нужно ничего настраивать — мы уже подобрали оптимальные параметры, чтобы получить максимальное ускорение», — отметил Дао.

Скорость, сравнимая с кастомными чипами

В тестах Together AI система ATLAS достигла 500 токенов в секунду при работе с моделью DeepSeek-V3.1 на GPU Nvidia B200. Это результат, сравнимый с производительностью специализированных решений, таких как Groq.

Дао подчёркивает: Мы видим, что за счёт программных и алгоритмических улучшений можно догнать и даже обогнать специализированное железо.

Как это работает: обмен памятью на вычисления

Во время вывода большая часть ресурсов GPU простаивает, ожидая доступ к памяти. Спекулятивное декодирование меняет баланс: вместо генерации по одному токену, система предлагает сразу несколько, проверяя их параллельно. Это снижает нагрузку на память и повышает использование вычислительных блоков.

По сути, ATLAS — это умное кэширование для ИИ. Вместо хранения готовых ответов, как в Redis, она учится предугадывать поведение модели и ускорять обработку похожих шаблонов.

Где это особенно полезно

  • Обучение с подкреплением (RL): когда политика быстро эволюционирует, адаптивный спекулятор остаётся в синхронизации с изменениями.
  • Меняющиеся сценарии использования: компании переходят от чат-ботов к генерации кода или автоматизации рабочих процессов, а ATLAS подстраивается мгновенно.

Вывод: новая эпоха адаптивного вывода

ATLAS уже доступен пользователям Together AI без дополнительной платы. Компания сообщает, что количество разработчиков на платформе превысило 800 тысяч, почти удвоившись за полгода.

Главный вывод прост: будущее вывода ИИ — за адаптивными системами. Вместо статичных моделей, обученных однажды, предприятия всё чаще будут полагаться на самообучающиеся алгоритмы, способные совершенствоваться в реальном времени. Это делает софт снова важнее “железа”.

Источник: VentureBeat, материалы Together AI. Переработано и адаптировано специально для 3007.ru.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

This site uses Akismet to reduce spam. Learn how your comment data is processed.