|
Вот не копая особо вглубь по исходникам, процитирую:
AMD купила Taalas отсюдаTaalas делает довольно радикальную вещь: вместо того чтобы хранить веса нейросети в HBM и на каждом inference гонять их туда-сюда, они буквально зашивают модель в кремний. Базовые веса лежат в mask ROM. Причём архитектура устроена так, что для новой модели не нужно заново проектировать и производить весь чип. Меняются всего две маски — они задают веса и dataflow конкретной модели. То есть большая часть дизайна остаётся прежней. Это сильно меняет экономику специализированных ASIC: новый model-specific silicon становится не многолетним проектом с чудовищным NRE, а относительно дешёвой производственной вариацией уже существующего кристалла. Первый HC1 у Taalas: TSMC 6 nm, 815 мм², 53 млрд транзисторов, Llama 3.1 8B прямо внутри кристалла. Но теперь эту технологию купила AMD. А AMD умеет в чиплеты (chiplets). И вот здесь начинается самое интересное. Представьте не гигантский монолит, а набор простых weight-chiplets. Каждый содержит кусок фиксированных весов модели и способен отдавать их детерминированным потоком с нужной вычислителю полосой. Рядом — compute chiplet, который принимает этот поток и делает MAC. В грубом приближении модель на 80B параметров — это порядок десяти массивов ёмкостью около 8B каждый. Не обязательно десять буквальных HC1, конечно, но масштаб понятен. При этом базовая модель полностью immutable, а небольшой объём нормальной программируемой памяти остаётся для KV cache и LoRA. То есть модель физически зашита в железо, но её всё ещё можно адаптировать под конкретного клиента. И самое важное — исчезает огромная часть того безумия, которое сегодня называется AI accelerator: • никакой HBM для хранения весов; • никаких терабайт в секунду между GPU и внешней памятью; • никакого CoWoS ради того, чтобы поставить память достаточно близко; • никакого постоянного движения одних и тех же десятков гигабайт весов на каждый токен. ROM можно спокойно делать на зрелом техпроцессе. HC1 уже сделан на 6 nm — ему не нужны 2 nm. А если AMD действительно разложит эту архитектуру на chiplets, то требования к interconnect тоже становятся совсем другими. Не нужно строить универсальную когерентную систему с произвольными обращениями к памяти. Веса идут потоком. Latency отдельного обращения практически перестаёт иметь значение. Нужны предсказуемая bandwidth и правильный pipeline. Один блок стримит веса. Другой их умножает. Всё сидит рядом на подложке (substrate). По сути мы наконец приходим к железу, где нейросеть перестаёт быть программой, которую исполняет универсальный компьютер. Модель сама становится компьютером. Асики для нейронок файналли аррайвд (Andrew) Осталось сделать. И отгрузить в канал что-нибудь приличное. Вообще, что-то похожее напрашивалось. А потом - варианты с возможностью небольшой реконфигурации, так же как из asic выросли FPGA. Конечно, тут существенная проблема в самих методиках конвертации весов модели или там cuda кода в специфический чип - а это не так просто. Но... И как же замечательно ложится на многие фантастические сеттинги с умными роботами с особенностями мышления, зависящими от модели и серии. PS О Taalas на ixbt, о ней же на Хабре 1 и два. #ai #ии 8 августа в 03:05
5 |
|
Ещё, помнится, когда Шахтёра от Хорта читал, думал: эх, не увижу никогда нейросети!
А сейчас я уже боюсь, что увижу. |
|