DeepSeek разом із Peking University представили DSpark — систему інференсу, створену для підвищення ефективності роботи великих мовних моделей без зміни їхніх базових можливостей.
Рішення швидко привернуло увагу інженерної спільноти. Зокрема, його детально проаналізував мейнтейнер PyTorch і співзасновник Fireworks AI Дмитро Джулгаков, відзначивши сильну продакшен-орієнтовану архітектуру та високий рівень інженерного опрацювання.
DSpark вирішує ключову проблему LLM — послідовну генерацію токенів, яка обмежує швидкість роботи GPU. Традиційні методи батчингу лише частково компенсують цю проблему, не усуваючи вузьке місце інференсу.
Основна інновація системи полягає в напівпаралельній архітектурі “drafting”, яка поєднує швидкість паралельної генерації з легкими механізмами послідовної залежності. Це дозволяє зберігати баланс між продуктивністю та точністю, вирішуючи класичну дилему: швидкість або якість.
За даними аналізу, DSpark забезпечує приріст швидкості генерації на 60–85% для одного користувача та до 4 разів більшу пропускну здатність у виробничих навантаженнях. У системах на базі DeepSeek V4 це дає суттєве прискорення роботи без втрати якості відповідей.
Проєкт випущено з відкритим кодом, що дозволяє ширшій спільноті досліджувати та застосовувати нові підходи до оптимізації інференсу великих мовних моделей.