↓
 ↑
Регистрация
Имя/email

Пароль

 
Вход при помощи VK ID
временно не работает,
как войти читайте здесь!
Marlagram
8 августа в 03:05
Aa Aa
Вот не копая особо вглубь по исходникам, процитирую:
AMD купила Taalas

Taalas делает довольно радикальную вещь: вместо того чтобы хранить веса нейросети в HBM и на каждом inference гонять их туда-сюда, они буквально зашивают модель в кремний.

Базовые веса лежат в mask ROM.

Причём архитектура устроена так, что для новой модели не нужно заново проектировать и производить весь чип. Меняются всего две маски — они задают веса и dataflow конкретной модели.

То есть большая часть дизайна остаётся прежней.

Это сильно меняет экономику специализированных ASIC: новый model-specific silicon становится не многолетним проектом с чудовищным NRE, а относительно дешёвой производственной вариацией уже существующего кристалла.

Первый HC1 у Taalas: TSMC 6 nm, 815 мм², 53 млрд транзисторов, Llama 3.1 8B прямо внутри кристалла.

Но теперь эту технологию купила AMD.

А AMD умеет в чиплеты (chiplets).

И вот здесь начинается самое интересное.

Представьте не гигантский монолит, а набор простых weight-chiplets.

Каждый содержит кусок фиксированных весов модели и способен отдавать их детерминированным потоком с нужной вычислителю полосой.

Рядом — compute chiplet, который принимает этот поток и делает MAC.

В грубом приближении модель на 80B параметров — это порядок десяти массивов ёмкостью около 8B каждый. Не обязательно десять буквальных HC1, конечно, но масштаб понятен.

При этом базовая модель полностью immutable, а небольшой объём нормальной программируемой памяти остаётся для KV cache и LoRA. То есть модель физически зашита в железо, но её всё ещё можно адаптировать под конкретного клиента.

И самое важное — исчезает огромная часть того безумия, которое сегодня называется AI accelerator:
• никакой HBM для хранения весов;
• никаких терабайт в секунду между GPU и внешней памятью;
• никакого CoWoS ради того, чтобы поставить память достаточно близко;
• никакого постоянного движения одних и тех же десятков гигабайт весов на каждый токен.

ROM можно спокойно делать на зрелом техпроцессе. HC1 уже сделан на 6 nm — ему не нужны 2 nm.

А если AMD действительно разложит эту архитектуру на chiplets, то требования к interconnect тоже становятся совсем другими.

Не нужно строить универсальную когерентную систему с произвольными обращениями к памяти.

Веса идут потоком.

Latency отдельного обращения практически перестаёт иметь значение. Нужны предсказуемая bandwidth и правильный pipeline.

Один блок стримит веса. Другой их умножает. Всё сидит рядом на подложке (substrate).

По сути мы наконец приходим к железу, где нейросеть перестаёт быть программой, которую исполняет универсальный компьютер.

Модель сама становится компьютером.

Асики для нейронок файналли аррайвд (Andrew)

Осталось сделать. И отгрузить в канал что-нибудь приличное.
отсюда

Вообще, что-то похожее напрашивалось. А потом - варианты с возможностью небольшой реконфигурации, так же как из asic выросли FPGA. Конечно, тут существенная проблема в самих методиках конвертации весов модели или там cuda кода в специфический чип - а это не так просто. Но...
И как же замечательно ложится на многие фантастические сеттинги с умными роботами с особенностями мышления, зависящими от модели и серии.

PS
О Taalas на ixbt, о ней же на Хабре 1 и два.

#ai #ии
8 августа в 03:05
3 комментария
Asteroid Онлайн
Тоже об этом думал. А ещё, от этого недалеко до нейросетей из eve онлайн. Я об этом пост писал, когда у таалас первый чип получился: с мозгом мы почти научились коннектиться, а тут и супербыстрые нейросетки на подходе, так что поймать мысль, быстро обработать её и вплести нейросетевой ответ в мысленный поток человека - это уже теоретически достижимо.
Asteroid Онлайн
Ещё, помнится, когда Шахтёра от Хорта читал, думал: эх, не увижу никогда нейросети!
А сейчас я уже боюсь, что увижу.
Конечно, тут существенная проблема в самих методиках конвертации весов модели или там cuda кода в специфический чип - а это не так просто. Но...
И как же замечательно ложится на многие фантастические сеттинги с умными роботами с особенностями мышления, зависящими от модели и серии.
Я в таком сеттинге как-то достраивал это ещё и оптроникой, позволяющей сильно экономить энергию и ещё плотнее упаковать "нейроны" и "аксоны".
Тем более там всякие "кристалы" распространены.
ПОИСК
ФАНФИКОВ









Закрыть
Закрыть
Закрыть