Мой блог
Recurrent Looped Transformer (RLT): передача состояния декодера через каждый токен
В большинстве современных декодерных языковых моделей (decoder-only LLM) вычисления устроены изолированно: результаты работы последнего слоя для токена t никак не передаются напрямую на первый слой токена t+1. Связь между позициями осуществляется исключительно через механизмы внимания по сохранённым значениям ключей и значений (KV-кэш). Исследователь из Принстона Ифань Чжан (Yifan Zhang) предложил концепцию Recurrent Looped Transformer (RLT), которая замыкает этот цикл и меняет привычный принцип передачи контекста.
Архитектура RLT переносит полное финальное состояние декодера и его послойный кэш скользящего окна внимания (Sliding-Window Attention, SWA) на следующий токен. Этот процесс происходит непрерывно по всей длине последовательности — как в пределах промпта пользовательского ввода, так и при генерации ответа моделью, без сброса состояний на границе запроса и ответа.
Я подробно изучил представленный отчет и хочу сразу подчеркнуть: данный материал представляет собой концептуальную архитектурную спецификацию. В ней детально описаны устройство нейросети, графики выполнения и контракты для алгоритмов обучения с подкреплением (RL), но пока не приводятся эмпирические замеры производительности, качества рассуждений или метрики масштабирования на реальном оборудовании.
Архитектура и устройство Recurrent Looped Transformer
Модель RLT объединяет в единую систему каузальный кодер (causal encoder) и рекуррентный декодер (recurrent decoder). Такая связка позволяет оптимизировать как параллельную обработку входящего текста, так и последовательный синтез новых токенов.
Процесс вычислений для каждого токена строится по следующим шагам:
- Каузальный кодер: обрабатывает токены параллельно под каузальной маской и формирует промежуточные представления et. Из них проецируется векторная память ключей и значений M≤t. Группы памяти могут быть общесистемными для всех слоев декодера (при G = 1) либо формироваться отдельно для каждого слоя (при G = LD).
- Рекуррентный декодер: отвечает за сохранение и передачу рекуррентного состояния. Полное состояние декодера описывается парой Ht = (st, CtD), где st — финальный выходной вектор декодера, а CtD — сохранённые ключи и значения SWA на каждом слое.
- Управляемое объединение (Gated Merge): перед началом обработки токена специальный гейт объединяет вектор кодера et с предыдущим выходом декодера st-1.
- Выполнение блоков декодера: каждый блок декодера последовательно выполняет каузальное скользящее внимание (SWA) по активациям декодера, перекрёстное внимание (cross-attention) к памяти кодера M≤t и расчеты внутри полносвязного слоя (FFN).
- Ограничение окна: окно внимания W включает текущий токен, поэтому на каждом слое сохраняется не более W − 1 исторических записей. Инициализация системы выполняется единоразово перед токеном BOS с помощью обучаемого начального состояния s* и пустого кэша.
В эталонной конфигурации со связанными весами (tied configuration) используются 48 слоев кодера и 48 слоев декодера с идентичными параметрами внимания и FFN. Таким образом, при обработке каждого токена последовательно исполняется 96 логических блоков. Я обратил внимание на важный нюанс: автор подчеркивает, что речь идет именно о повторном использовании параметров (parameter reuse), а не о банальном копировании активаций. При этом количество операций FLOPs на блок различается, так как блоки декодера содержат дополнительный шаг перекрёстного внимания.
Три ключевых принципа проектирования RLT
1. Скрытые рассуждения с неограниченной временной глубиной
Благодаря непрерывной передаче состояния, после обработки t токенов структурный путь от начального вектора s0 проходит через t · LD блоков декодера. В эталонной конфигурации эта глубина составляет 48t блоков. Объем вычислений на каждый токен остается фиксированным, тогда как глубина графа рассуждений растет вместе с длиной последовательности. При этом автор честно предупреждает: гейты и сжатие состояний могут затухать со временем, поэтому структурная глубина сама по себе не гарантирует автоматического роста качества логических умозаключений.
2. Совместное проектирование архитектуры и аппаратного обеспечения
Для ускорения расчетов извлечение признаков кодером и проекции памяти для известных токенов используют параллельные тензорные ядра. Внутри одной последовательности переходы декодера выполняются строго последовательно, однако независимые последовательности в батче могут объединяться и обрабатываться параллельно. В спецификации прямо указано: для нелинейного декодера не предполагается использование параллельного сканирования (parallel scan), ускорение этапа prefill не заявлено, а стандартный проход SWA-декодера не эквивалентен рекуррентной петле.
3. Согласование архитектуры с алгоритмами обучения с подкреплением (RL)
Предобучение, тонкая настройка (SFT), сэмплирование и повторные проходы в RL используют единый механизм переходов состояний. В процессе RL сэмплер фиксирует логарифмическую вероятность действий при фактических параметрах генерации (включая температуру и усечение). При обучении сэмплам модель заново перестраивает память кодера, рекуррентные выходы и кэш SWA с самого начала последовательности на актуальных весах. Старые сохранённые состояния генерации не используются повторно. Теоретическая теорема (Proposition 3.1) подтверждает: смещение границы между промптом и ответом не меняет условное распределение токенов при фиксированной истории.
Обучение, тонкая настройка и развертывание в мульти-тур сервисах
Процесс обучения RLT строится на предсказании следующего токена с полным сквозным обратным проходом по времени (Full BPTT). На этапе инструктивного файн-тюнинга (SFT) функция потерь рассчитывается исключительно на токенах ответа ассистента, однако обновление скрытых состояний никогда не маскируется. Это означает, что градиенты от токенов ассистента полноценно протекают через токены пользователя и системные инструкции.
В приложении к исследованию разъясняется опасность частичного отсечения градиентов (partial detaching). Якобиан переходов между состояниями содержит перекрестные члены через кэш декодера, поэтому простой разрыв градиента по вектору st оставляет открытыми пути через кэш KV. Любая схема с усеченным BPTT требует явного указания всех отсекаемых тензоров.
При обслуживании многоходовых диалогов (multi-turn serving) точный снимок состояния (prefix snapshot) включает:
- кэш и память кодера;
- полное состояние декодера;
- метаданные позиционирования;
- параметры окна скользящего внимания;
- версию весов модели.
Такой снимок с фиксированными весами можно безопасно переиспользовать между репликами, так как состояние не зависит от разбиения на роли. Однако обновление весов модели или редактирование ранних токенов контекста требует полного перерасчета состояний с ближайшего валидного чекпоинта.
Связь с предыдущими фундаментальными исследованиями
Предложенная архитектура RLT не возникла на пустом месте — она опирается на ряд известных концепций в области машинного обучения:
- Перенос памяти из кодера: идея перекрёстной памяти развивает наработки YOCO (где кэш KV вычисляется однократно для декодера) и DeepSeek-V4.1-Flash (где глобальный кэш декодера проецируется из финальных состояний кодера). Однако RLT отказывается от пропуска декодера на промпте.
- Временная обратная связь: идея передачи состояний восходит к Feedback Transformer и Recurrent Transformer. Отличие RLT заключается в том, что выходной вектор декодера подается на вход следующего шага непрерывно, включая стадию обработки промпта.
- Повторное использование глубины: концепция замыкания слоев перекликается с Universal Transformers и исследованиями рекуррентной глубины для скрытых рассуждений.
Итоги и ключевые выводы
Подводя итог анализу архитектуры Recurrent Looped Transformer, выделю главные особенности этого подхода:
- Сквозное состояние: RLT передает полный вектор декодера и кэш SWA через все токены промпта и ответа без сброса на границах.
- Глубокая рекурсия: 48 связанных слоев кодера и декодера дают 96 логических блоков на токен и траекторию глубиной 48t блоков после t токенов.
- Строгая согласованность в RL: во время RL-обучения все состояния перестраиваются с нуля на актуальных весах, гарантируя точный расчет градиентов.
- Теоретический статус: на данный момент RLT — это тщательно проработанная архитектурная спецификация. Реальная эффективность, качество логических рассуждений и масштабирование пока ждут своей практической проверки.
Источник: www.marktechpost.com
