Аналитика

AMD покупает Taalas: аппаратный ИИ обходится без дефицитной памяти HBM

Компания AMD согласилась приобрести стартап Taalas из Торонто, который решает главную проблему инференса нейросетей — необходимость постоянно перекачивать веса модели из памяти в процессор для генерации каждого токена. Чипы Taalas обходятся без этой операции: веса модели буквально впаяны в транзисторы. Именно эта перекачка данных ограничивает скорость современного инференса и превратила память с высокой пропускной способностью (HBM) в самый дефицитный товар в полупроводниковой отрасли.

Сделку будут воспринимать как очередной раунд соперничества AMD и Nvidia в сфере инференса, но на этом фронте она мало что меняет. Куда интереснее то, что покупка говорит о состоянии рынка памяти — самой перегретой сделки в полупроводниках сейчас.

Что создала Taalas

Taalas основали в 2023 году Любиша Баджич (Ljubisa Bajic), ранее создавший чиповую компанию Tenstorrent, и его жена Лейла Баджич (Lejla Bajic), ветеран инженерных подразделений ATI и AMD, занявшая пост операционного директора. Компания привлекла $219 млн от Fidelity, Quiet Capital и инвестора в полупроводники Пьера Ламонда — деньги пошли на разработку так называемых интегральных схем под конкретную модель.

Первый тестовый чип, изготовленный по 6-нанометровому техпроцессу TSMC, обслуживал модель Llama 3.1 8B от Meta со скоростью 16 960 токенов в секунду. По заявлению компании, это в 48 раз быстрее видеокарт Nvidia и в 8,5 раза быстрее ускорителей Cerebras на момент сравнения. Чип второго поколения, рассчитанный на модели с 20 млрд параметров, должен выйти в этом году.

Архитектура делится на две зоны: область, где веса модели зашиты в виде масочной ROM-памяти, и обычная SRAM для кэшей и адаптеров тонкой настройки, которые всё ещё могут меняться. «Именно такая жёсткая прошивка отчасти и даёт нам скорость», — рассказывал Баджич изданию The Next Platform в феврале.

AMD планирует встроить чипы Taalas в стойки Helios по разделённой схеме: ускорители Instinct будут обрабатывать промпт, а кремний Taalas — генерировать токены, всё под управлением программного стека ROCm. В компании подчеркнули, что речь идёт именно о поглощении, а не о найме команды, — закрытие сделки ожидают в четвёртом квартале. Старший вице-президент AMD по ИИ Вамси Боппана (Vamsi Boppana) охарактеризовал покупку как расширение платформы.

Компромисс, на который идёт Taalas

Впаивание весов в кремний имеет очевидную цену: каждый чип обслуживает ровно одну модель — навсегда. Смена модели требует частичного пересчёта топологии, и даже с сокращённым циклом Taalas, когда меняют только два металлических слоя на почти готовой пластине, это занимает около двух месяцев на мощностях TSMC. Топовые модели обновляются быстрее. Ставка окупается только там, где модель стабильна, широко используется и достаточно ценна, чтобы её заморозить.

Этот же компромисс объясняет, почему сделка не меняет расклад сил на рынке инференса. Nvidia заплатила $20 млрд за Groq в декабре — крупнейшее приобретение в своей истории, — чтобы встроить специализированное железо для генерации токенов именно в ту платформу, вокруг которой уже выстроена вся индустрия. Борьба за инференс идёт на уровне экосистем и установленного софта, а чип, привязанный к одной модели, не участвует ни в том, ни в другом. Что действительно доказывает подход Taalas — тезис более узкий, но и более интересный: ограничение по памяти, от которого страдает инференс, — это инженерное решение, а не физическая данность, и его можно обойти.

Вопрос памяти

Рынок сейчас закладывает в цены предположение, что этот дефицит памяти постоянен. Цены на обычную DRAM выросли почти на 90% в первом квартале. Память с высокой пропускной способностью (HBM) фактически распродана на весь 2026 год, а объём рынка HBM в этом году ожидается на уровне $54,6 млрд. SK hynix, которая контролирует больше половины поставок HBM, преодолела капитализацию в $1 трлн и анонсировала строительство новых заводов на $38,1 млрду. Для рядового инвестора вся ставка на память держится на одном допущении: спрос на ИИ будет держать память в дефиците ещё годы.

Это допущение уже подвергается атаке сразу с нескольких сторон. Taalas полностью убирает память для весов из процесса обслуживания моделей, а инженеры Nvidia сжимают и квантуют модели именно для того, чтобы уменьшить объём памяти, который затрагивает развёрнутая модель.

Сами производители памяти работают в том же направлении. Технология zHBM от Samsung, показанная на конференции FMS на прошлой неделе, укладывает память прямо на ускоритель, умножая эффективную пропускную способность. SK hynix и Sandisk только что опубликовали первый стандарт высокоскоростной флеш-памяти, нацеленной заменить дешёвым NAND ту работу, которую сегодня выполняет HBM. Практически каждый крупный игрок отрасли финансирует свой способ снизить потребность в том самом ресурсе, который рынок считает дефицитным навсегда.

AMD купила доказательство того, что инференс может работать без обращения к компоненту, чей дефицит определяет весь текущий цикл спроса на ИИ, — и будет продавать это доказательство внутри стоек, где по-прежнему стоят GPU и HBM. Инвесторы, которые считают сегодняшние цены на память постоянной чертой всего цикла строительства ИИ-инфраструктуры, ставят против масштабного и растущего инженерного движения, нацеленного на обратный результат.

Память всегда была циклическим бизнесом. Те, кто платит за неё сегодняшние цены, только что профинансировали ещё одну причину, почему это останется так.

Мнение ИИ

С точки зрения машинного анализа данных, ключевой прецедент для чипов Taalas можно найти не в мире ИИ, а в криптоиндустрии. Специализированные интегральные схемы для майнинга биткоина решают похожую задачу — впаивают алгоритм в кремний ради скорости — и получают тот же побочный эффект: полную негибкость. Hash Telegraph уже описывал, как аппаратная специализация, доведенная до предела, порождает риск морального устаревания при смене базового алгоритма или появлении новой вычислительной парадигмы.

Технические аспекты, которые статья не раскрывает подробно, касаются экономики простоя: пока чип Taalas обслуживает одну модель, конкурирующие лаборатории выпускают новые версии каждые несколько месяцев, а цикл перепрошивки топологии занимает около двух месяцев на мощностях TSMC. История ASIC показывает, что специализация окупается только на стабильном алгоритме — вопрос в том, окажется ли архитектура крупных языковых моделей достаточно стабильной для этой ставки.

Источник

Добавить комментарий

Кнопка «Наверх»
  • bitcoinBitcoin (BTC) $ 65,099.00
  • ethereumEthereum (ETH) $ 1,922.65
  • tetherTether (USDT) $ 0.999435
  • usd-coinUSDC (USDC) $ 0.999707
  • tronTRON (TRX) $ 0.329467
  • dogecoinDogecoin (DOGE) $ 0.070608
  • leo-tokenLEO Token (LEO) $ 9.71
  • zcashZcash (ZEC) $ 516.91
  • cardanoCardano (ADA) $ 0.198929
  • moneroMonero (XMR) $ 390.85
  • chainlinkChainlink (LINK) $ 8.34
  • stellarStellar (XLM) $ 0.163633
  • daiDai (DAI) $ 1.00
  • bitcoin-cashBitcoin Cash (BCH) $ 216.27
  • litecoinLitecoin (LTC) $ 46.02
  • hedera-hashgraphHedera (HBAR) $ 0.069341
  • crypto-com-chainCronos (CRO) $ 0.047812
  • okbOKB (OKB) $ 94.24
  • ethereum-classicEthereum Classic (ETC) $ 6.50
  • kucoin-sharesKuCoin (KCS) $ 6.68
  • algorandAlgorand (ALGO) $ 0.084603
  • cosmosCosmos Hub (ATOM) $ 1.39
  • true-usdTrueUSD (TUSD) $ 0.995933
  • vechainVeChain (VET) $ 0.004761
  • dashDash (DASH) $ 31.43
  • decredDecred (DCR) $ 12.97
  • tezosTezos (XTZ) $ 0.205334
  • iotaIOTA (IOTA) $ 0.035521
  • neoNEO (NEO) $ 1.85
  • basic-attention-tokenBasic Attention (BAT) $ 0.068058
  • qtumQtum (QTUM) $ 0.674040
  • 0x0x Protocol (ZRX) $ 0.082191
  • ravencoinRavencoin (RVN) $ 0.003593
  • ontologyOntology (ONT) $ 0.039102
  • paxos-standardPax Dollar (USDP) $ 0.999832
  • iconICON (ICX) $ 0.023438
  • wavesWaves (WAVES) $ 0.204774
  • liskLisk (LSK) $ 0.077714
  • bitcoin-diamondBitcoin Diamond (BCD) $ 0.061182
  • huobi-tokenHuobi (HT) $ 0.095881
  • monacoinMonaCoin (MONA) $ 0.062204
Закрыть
Закрыть