Мой блог
NVIDIA Kumo Tabular: новая эра точности и эффективности в прогнозировании по таблицам
Компания NVIDIA представила NVIDIA Kumo Tabular — передовую открытую базовую модель для работы с табличными данными, которая устанавливает новые стандарты в задачах классификации и регрессии. Я внимательно изучил архитектуру новинки, её возможности и результаты тестов, чтобы рассказать вам об этом важном прорыве в сфере машинного обучения.
Табличные данные остаются фундаментом корпоративного искусственного интеллекта и бизнес-аналитики. Из года в год специалисты используют градиентный бустинг для прогнозирования оттока клиентов, оценки рисков, спроса или стоимости активов. Тем не менее, жизненный цикл традиционных моделей практически не менялся: сбор разметки, ручной инжиниринг признаков, подбор гиперпараметров и обучение с нуля под каждую новую задачу. Я часто сталкиваюсь с тем, что классические подходы требуют огромных трудозатрат на подготовку данных.
Эволюция к базовым моделям для таблиц
Большие языковые модели продемонстрировали принципиально иной подход к решению задач за счет контекстного обучения. Когда модель получает несколько примеров прямо в промпте, она способна выдавать результат без изменения весов. Этот принцип применим и к таблицам: обученный на миллионах массивов данных алгоритм может воспринимать размеченную таблицу как контекст и мгновенно прогнозировать целевые значения для новых строк. Именно такую философию реализует новая разработка.
Как устроена модель Kumo Tabular
Архитектурно Kumo Tabular представляет собой специализированный Трансформер, использующий колонковое, строковое и внутриконтекстное внимание. Чтобы выдать точный прогноз, система выполняет три ключевых шага: анализирует смысл каждого значения в пределах конкретного столбца, исследует взаимодействие признаков внутри одной строки, а затем сопоставляет контекстные строки с известными метками и запросами без разметки.
Эмбеддинги ячеек и строк
На первом этапе группа ячеек преобразуется в единый токен. Числовые и категориальные параметры проходят через функции Фурье с настраиваемыми весами, а пропущенные значения не требуют специальной импутации и обрабатываются особым образом. Затем алгоритм формирует строковые эмбеддинги, чередуя колонковое и строковое внимание. Колонковое внимание оценивает типичность значений в рамках распределения столбца, а строковое внимание анализирует связи между признаками внутри строки с помощью поворотных позиций.
Контекстное обучение и масштабирование внимания
Финальный модуль Трансформера работает со строковыми эмбеддингами, где контекстные строки взаимодействуют друг с другом, а строки запросов обращаются исключительно к контексту. Это позволяет повторно использовать кэш ключей и значений для последующих предсказаний. Для сохранения стабильности при работе с массивами разного масштаба используется адаптивная температура внимания, которая подстраивается под количество ключей в зависимости от объема выборки.
Особенности обучения и генерации данных
Модель обучалась исключительно на искусственных таблицах, сгенерированных с помощью процедурного семплера на базе структурных причинных моделей. Такой подход позволил смоделировать реальные несовершенства данных: пропуски, зашумленные признаки, категориальные переменные с множеством уровней и тяжелые хвосты в регрессии. В процессе обучения Kumo Tabular последовательно обрабатывала массивы разной длины — от тысячи до шестидесяти тысяч строк, что обеспечило высокую универсальность.
Производительность и результаты тестирования
Я проанализировал сравнительные тесты новинки и убедился в её выдающейся эффективности. На лидерборде TabArena модель заняла первое место с показателем ELO 1950, опережая существующие аналоги и работая значительно быстрее. Высокие результаты зафиксированы и в бенчмарках BeyondArena, TALENT и ScoringBench, где решение продемонстрировало лидерство как по точности классификации, так и по качеству регрессии.

Ограничения в работе
Важно учитывать, что архитектура работает непосредственно с числовыми и категориальными столбцами. Текст, временные метки или изображения предварительно преобразуются с помощью встроенных рецептов препроцессинга. Один прямой проход поддерживает до десяти классов, однако библиотека позволяет масштабировать этот показатель для любого числа категорий с помощью корректирующих кодов ошибок.



Практический пример запуска
Новая модель поставляется через открытую GPU-ориентированную библиотеку NVIDIA для структурных данных. Инструментарий автоматически загружает веса из репозитория и берет на себя всю предварительную обработку. Для получения предсказания из фреймворка pandas достаточно написать несколько строк кода на Python:

import sdm
table = sdm.TableTensor.from_pandas(pd.load_csv(...), device="cuda")
na_mask = table["target"].isnan()
model = sdm.models.KumoTabular(device="cuda")
pred = model(
x_context=table[~na_mask].drop_columns("target"),
y_context=table[~na_mask, "target"],
x_query=table[na_mask].drop_column("target"),
)
Заключение и лицензирование
Модель распространяется под лицензией OpenMDW версии 1.1 для коммерческого использования. Разработчики подчеркивают важность ответственного подхода к внедрению искусственного интеллекта и рекомендуют проводить валидацию точности на собственных отложенных выборках перед развертыванием систем в промышленной среде.
