کتابخانه vLLM با انتشار نسخه ۰.۲۸.۰، گام بزرگی در بهینهسازی مدلهای زبانی بزرگ برداشته است. این بهروزرسانی شامل ۵۸۴ تغییر توسط ۲۷۰ مشارکتکننده است که تمرکز اصلی آن بر بهبود عملکرد مدلهای Kimi-K3 و DeepSeek V4 قرار دارد. از جمله ویژگیهای کلیدی این نسخه میتوان به پشتیبانی از Decode Context Parallel، کاهش مصرف حافظه تا ۱۷ گیگابایت به ازای هر پردازنده گرافیکی و بهبود ۶۰ درصدی در زمان اولین توکن (TTFT) اشاره کرد. همچنین، قابلیتهای جدیدی برای مدیریت حافظه کش KV و پشتیبانی از سختافزارهای AMD ROCm اضافه شده است. در این نسخه، محدودیت تعداد توکنهای دستهای از ۸۱۹۲ به ۱۶۳۸۴ افزایش یافته و تغییرات ساختاری در نحوه اجرای مدلها اعمال شده است. این نسخه اکنون برای دانلود در قالبهای مختلف از جمله Docker و Python Wheels در دسترس کاربران قرار دارد.