Мой блог
AMD приобретает компанию Taalas для разработки специализированных AI-чипов

AMD делает ставку на специализированные AI-чипы: покупка Taalas
Компания AMD официально объявила о приобретении стартапа Taalas, чья деятельность сосредоточена на создании принципиально иного класса чипов для инференса искусственного интеллекта. В то время как современный рынок ориентирован на создание высокопрограммируемых архитектур, способных гибко адаптироваться под различные модели, стратегия Taalas движется в противоположном направлении. Их разработка предполагает создание специализированных чипов, «заточенных» под одну конкретную модель. Это означает, что при необходимости смены модели в серверной стойке пользователю придется физически заменить и сами вычислительные модули.
Технология вшитого интеллекта
Фундаментальная концепция Taalas заключается в отказе от традиционного подхода, при котором чип подгружает веса модели из памяти (например, HBM) и использует программируемые блоки для обработки матричных вычислений. Вместо этого Taalas фактически «зашивает» структуру модели непосредственно в CMOS-архитектуру. Преимущество такого подхода заключается в колоссальном приросте производительности по сравнению с любыми решениями, спроектированными с упором на универсальность. Текущее поколение оборудования компании представлено технологическим демонстратором HC1. В ходе испытаний чип продемонстрировал работу с моделью Llama 3.1 8B, показав впечатляющую скорость — до 17 000 токенов в секунду на пользователя. Сам чип выполнен по техпроцессу TSMC 6 нм, имеет площадь кристалла 815 мм² и включает 53 миллиарда транзисторов. В своих внутренних замерах Taalas сравнивает возможности HC1 с такими решениями, как Nvidia H200, B200, а также с продуктами Groq, SambaNova и Cerebras.
Масштабируемость и производственные риски
Реализация такой архитектуры подразумевает, что для работы крупных современных нейросетей потребуется использование сразу нескольких чипов предельного размера (reticle-size). Это ставит перед производителями непростую задачу: необходимо проектировать, упаковывать, тестировать и связывать воедино множество различных компонентов. Существует риск логистического сбоя, когда девять партий чипов готовы, а выпуск десятого задерживается, что останавливает всю сборку. Однако, несмотря на кажущуюся сложность, этот путь обещает создание невероятно быстрых и потенциально более дешевых систем для инференса. Разработчики утверждают, что для адаптации под изменение весов или размерности матриц достаточно модификации всего двух масочных слоев. Это значительно выгоднее, чем полноценная разработка и вывод в производство двух разных GPU, так как сокращает расходы на дорогостоящую фотолитографию.

Стратегический выбор для стабильных нагрузок
Специализированные чипы жертвуют гибкостью ради максимальной эффективности. Специализация позволяет перевести рабочую нагрузку в формат прямого потока данных, исключая вычислительные и «памятьевые» накладные расходы, характерные для универсальных процессоров. Такой подход наиболее привлекателен для секторов с высокой стабильностью нагрузок, где инференс работает с одними и теми же моделями в огромных масштабах. Именно этот сегмент рынка, по мнению AMD, демонстрирует сегодня наиболее активный рост. Существует также экономический аргумент: когда модель быстро обретает популярность и вокруг нее выстраиваются рабочие процессы, формируется стабильная базовая нагрузка, оправдывающая внедрение аппаратного ускорения. Чем дольше эксплуатируется специфическое оборудование, тем эффективнее становится бизнес-кейс.
Перспективы интеграции
AMD планирует внедрить наработки Taalas в свою дорожную карту ускорителей и развивать их в рамках системных продуктов, дополняющих линейку Instinct. Этот шаг значительно усиливает комплексную платформу AMD, включающую стоечные системы Helios, серверные процессоры EPYC и программную экосистему ROCm. Наличие собственного специализированного движка для инференса дает клиентам выбор между максимальной эффективностью для фиксированной модели и универсальностью стандартных ускорителей Instinct. Главный вопрос сейчас заключается в том, насколько быстро демонстрационные технологии превратятся в коммерческие продукты и сможет ли «одномодельный» кремний отвоевать значимую долю рынка у гибких ускорителей конкурентов. В любом случае, это решение является для AMD важным стратегическим маневром.
Источник: servethehome.com

