ШІ-індустрія зміщує фокус із навчання моделей на інференс

ШІ-індустрія зміщує фокус із навчання моделей на інференс

Компанії розробляють нові чипи та архітектури пам’яті, щоб прискорити інференс мовних моделей і ШІ-агентів.

Технологічні компанії дедалі більше зосереджуються на прискоренні інференсу — етапу, коли вже навчена модель штучного інтелекту генерує відповідь, код або зображення. Як повідомляє IEEE Spectrum, зростання використання мовних моделей, моделей міркування та автономних ШІ-агентів посилює попит на спеціалізоване обчислювальне обладнання.

Моделі міркування можуть запускати інференс кілька разів для одного запиту та створювати значно довші відповіді. Водночас агентні системи здатні виконувати завдання безперервно, а не лише реагувати на звернення користувача в реальному часі.

 

Пам’ять стає вузьким місцем

 

На відміну від навчання, під час інференсу модель формує відповідь послідовно — токен за токеном. Для кожного нового токена їй потрібно звертатися до параметрів моделі та збереженого контексту діалогу, зокрема попередніх запитів, відповідей і завантажених файлів. Цей контекст накопичується у так званому KV-кеші та може займати десятки гігабайтів пам’яті.

Саме пропускна здатність пам’яті, а не лише продуктивність обчислювальних блоків, стає ключовим обмеженням. За даними видання, дослідники встановили, що графічні процесори Nvidia H100 під час роботи з відкритими мовними моделями можуть простоювати від 50% до 80% часу в очікуванні даних із пам’яті.

 

Компанії комбінують різні чипи

 

Nvidia та Amazon Web Services розвивають схеми, у яких різні прискорювачі виконують окремі частини інференсу. Графічні процесори та Trainium можуть ефективно обробляти початковий етап читання запиту й формування контексту, тоді як для послідовної генерації токенів компанії залучають архітектури, орієнтовані на пам’ять.

Nvidia після придбання інтелектуальної власності та найму фахівців стартапу Groq представила мовний процесор Groq 3 LPU. За словами віцепрезидента Nvidia Іана Бака, цей процесор має 500 МБ вбудованої SRAM-пам’яті та забезпечує у сім разів більшу пропускну здатність пам’яті, ніж GPU. AWS, своєю чергою, планує поєднувати Trainium із процесорами Wafer-Scale Engine 3 від Cerebras.

 

Ставка на нові архітектури

 

Стартапи d-Matrix і Majestic Labs пропонують різні підходи до подолання обмежень пам’яті: перша компанія розміщує обчислювальний прискорювач поверх кристала DRAM, а друга розробляє інтерфейс, який дає змогу підключати пам’ять на відстані до приблизно одного метра. Majestic заявляє, що її серверна стійка може підтримувати до 128 ТБ DRAM.

Виробники також зменшують точність обчислень, використовуючи 4-бітні формати для зниження споживання пам’яті й енергії. Nvidia повідомляла, що квантування DeepSeek-R1 з FP8 до NVFP4 утричі підвищило продуктивність, тоді як результати на семи основних тестах погіршилися менш ніж на 1%.