Ринок ШІ зміщує фокус із навчання моделей на інференс

Ринок ШІ зміщує фокус із навчання моделей на інференс

Компанії Nvidia, AWS і Cerebras розвивають нові чипи та архітектури пам’яті для прискорення інференсу ШІ.

Технологічні компанії дедалі більше зосереджуються на інференсі — роботі вже навчених моделей штучного інтелекту, які генерують текст, код або зображення. Зростання попиту на такі обчислення змушує виробників поєднувати різні типи чипів і шукати архітектури, орієнтовані насамперед на швидкість доступу до пам’яті, повідомляє IEEE Spectrum.

Після 2020 року індустрія переважно нарощувала масштаби навчання великих мовних моделей. Водночас поширення моделей міркування, які можуть кілька разів обробляти запит у процесі формування відповіді, та агентних систем, що працюють автономно цілодобово, різко збільшує навантаження під час інференсу.

 

Чому ключовою стала пам’ять

 

Генерація відповіді мовною моделлю складається з етапів prefill і decode. Під час prefill система опрацьовує весь запит паралельно та формує KV-кеш — набір даних, потрібних для врахування контексту. На етапі decode модель створює наступні токени послідовно, щоразу звертаючись і до кешу, і до параметрів моделі, які можуть займати десятки або сотні гігабайтів.

Через це продуктивність часто обмежує не обчислювальна потужність, а пропускна здатність пам’яті. За наведеними у публікації даними дослідників, графічні процесори Nvidia H100 під час роботи з відкритими мовними моделями можуть простоювати на 50–80% часу, очікуючи на надходження даних із пам’яті.

 

Нові архітектури для декодування

 

Стартап d-Matrix пропонує розміщувати обчислювальний прискорювач поверх кристала DRAM, скорочуючи шлях передавання даних із міліметрів до мікрометрів. Majestic Labs, навпаки, розробляє інтерфейс, який має дозволити підключати пам’ять на відстані приблизно до метра. Компанія заявляє, що її серверна стійка може підтримувати до 128 ТБ DRAM. Для порівняння, у стійці Nvidia GB300 NVL72 близько 20 ТБ пам’яті HBM3E.

Nvidia після придбання інтелектуальної власності та найму фахівців стартапу Groq представила мовний процесор Groq 3 LPU. Він має 500 МБ вбудованої SRAM і, за словами віцепрезидента Nvidia Іана Бака, забезпечує у сім разів більшу пропускну здатність пам’яті, ніж GPU. Компанія планує використовувати GPU Vera Rubin для обробки контексту, а LPU — для матричних обчислень під час декодування.

 

Поєднання чипів і стиснення моделей

 

AWS уклала угоду з Cerebras: прискорювачі Trainium мають виконувати prefill, а Wafer-Scale Engine 3 — decode. Чип Cerebras розміром із кремнієву пластину містить понад 4 трильйони транзисторів і 44 ГБ SRAM. За даними видання, OpenAI застосувала WSE-3 для GPT-5.3-Codex-Spark, який видає понад 1 000 токенів за секунду; стандартне розгортання GPT-5.4 генерує від 50 до 125 токенів за секунду.

Паралельно розробники зменшують точність числового представлення параметрів моделей — цей процес називають квантизацією. Nvidia повідомила, що після переведення DeepSeek-R1 з FP8 у чотирибітний формат NVFP4 результати на семи тестах знизилися менш ніж на 1%, тоді як продуктивність зросла втричі.