AMD купила Taalas
…
Taalas делает довольно радикальную вещь: вместо того чтобы хранить веса нейросети в HBM и на каждом inference гонять их туда-сюда, они буквально зашивают модель в кремний.
Базовые веса лежат в mask ROM.
Причём архитектура устроена так, что для новой модели не нужно заново проектировать и производить весь чип. Меняются всего две маски — они задают веса и dataflow конкретной модели.
То есть большая часть дизайна остаётся прежней.
Это сильно меняет экономику специализированных ASIC: новый model-specific silicon становится не многолетним проектом с чудовищным NRE, а относительно дешёвой производственной вариацией уже существующего кристалла.
Первый HC1 у Taalas: TSMC 6 nm, 815 мм², 53 млрд транзисторов, Llama 3.1 8B прямо внутри кристалла.
Но теперь эту технологию купила AMD.
А AMD умеет в чиплеты (chiplets).
И вот здесь начинается самое интересное.
Представьте не гигантский монолит, а набор простых weight-chiplets.
Каждый содержит кусок фиксированных весов модели и способен отдавать их детерминированным потоком с нужной вычислителю полосой.
Рядом — compute chiplet, который принимает этот поток и делает MAC.
В грубом приближении модель на 80B параметров — это порядок десяти массивов ёмкостью около 8B каждый. Не обязательно десять буквальных HC1, конечно, но масштаб понятен.
При этом базовая модель полностью immutable, а небольшой объём нормальной программируемой памяти остаётся для KV cache и LoRA. То есть модель физически зашита в железо, но её всё ещё можно адаптировать под конкретного клиента.
И самое важное — исчезает огромная часть того безумия, которое сегодня называется AI accelerator:
• никакой HBM для хранения весов;
• никаких терабайт в секунду между GPU и внешней памятью;
• никакого CoWoS ради того, чтобы поставить память достаточно близко;
• никакого постоянного движения одних и тех же десятков гигабайт весов на каждый токен.
ROM можно спокойно делать на зрелом техпроцессе. HC1 уже сделан на 6 nm — ему не нужны 2 nm.
А если AMD действительно разложит эту архитектуру на chiplets, то требования к interconnect тоже становятся совсем другими.
Не нужно строить универсальную когерентную систему с произвольными обращениями к памяти.
Веса идут потоком.
Latency отдельного обращения практически перестаёт иметь значение. Нужны предсказуемая bandwidth и правильный pipeline.
Один блок стримит веса. Другой их умножает. Всё сидит рядом на подложке (substrate).
По сути мы наконец приходим к железу, где нейросеть перестаёт быть программой, которую исполняет универсальный компьютер.
Модель сама становится компьютером.
Асики для нейронок файналли аррайвд (Andrew)
Осталось сделать. И отгрузить в канал что-нибудь приличное.
