vLLM تطلق محركًا خلفيًا للنمذجة المحولات بسرعة أصلية
مساحة إعلانية داخل المقال
أعلنت vLLM، محرك الاستدلال عالي الأداء لنماذج اللغة الكبيرة، عن إطلاق محرك خلفي جديد للنمذجة المحولات بسرعة أصلية. يهدف هذا التحديث إلى تحسين تنفيذ بنى المحولات، مما يقلل زمن الاستجابة ويزيد الإنتاجية لأعباء عمل الذكاء الاصطناعي. يستخدم المحرك الخلفي تقنيات متقدمة لدمج النوى وإدارة الذاكرة لتحقيق أداء قريب من مستوى العتاد، مما يجعله مثاليًا للنشر الإنتاجي لنماذج مثل GPT وBERT وLLaMA. يمكن للمطورين توقع أوقات استجابة أسرع وتكاليف تشغيل أقل.
رأي تكنوفايب
هذا التطور يغير قواعد اللعبة للشركات التي تنشر نماذج اللغة الكبيرة على نطاق واسع. من خلال إزالة العبء الزائد في تنفيذ المحولات، يتيح vLLM استخدامًا أكثر كفاءة لموارد وحدة معالجة الرسوميات، مما يترجم إلى توفير في التكاليف وتجارب مستخدم أفضل. مع ازدياد حجم نماذج الذكاء الاصطناعي، تصبح هذه التحسينات حاسمة للحفاظ على الأداء في الوقت الفعلي.
المصدر الأصلي: https://huggingface.co/blog/native-speed-vllm-transformers-backend
التعليقات
لا توجد تعليقات بعد.