Высокая скорость работы — одно из главных условий для массового применения больших языковых моделей (LLM). Cohere Labs анонсировала презентацию, где представит новый дискретный диффузионный подход, обещающий радикально ускорить LLM без потерь качества.
Метод, названный Discrete Diffusion Forcing (D2F), впервые позволяет диффузионным большим языковым моделям (dLLM) превзойти авторегрессивные (AR) модели по скорости инференса. Ранее dLLM, несмотря на потенциал параллельного декодирования, уступали AR-моделям, что ограничивало их широкое применение. D2F решает эту проблему медленной генерации текста.
На презентации будет показано, что D2F обеспечивает ускорение до 2.5 раз по сравнению с AR-моделями, включая LLaMA3 и Qwen2. Разработчики утверждают, что это достигается без потери качества генерации.
Презентация метода D2F запланирована на 29 сентября. Если заявленные показатели ускорения и сохранения качества подтвердятся независимыми тестами, это может устранить одно из главных препятствий для внедрения диффузионных LLM в реальные приложения.