مساحة إعلانية

vLLM تطلق محركًا خلفيًا للنمذجة المحولات بسرعة أصلية

العودة إلى الذكاء الاصطناعي

Native-speed vLLM transformers modeling backend
مساحة إعلانية داخل المقال
أعلنت vLLM، محرك الاستدلال عالي الأداء لنماذج اللغة الكبيرة، عن إطلاق محرك خلفي جديد للنمذجة المحولات بسرعة أصلية. يهدف هذا التحديث إلى تحسين تنفيذ بنى المحولات، مما يقلل زمن الاستجابة ويزيد الإنتاجية لأعباء عمل الذكاء الاصطناعي. يستخدم المحرك الخلفي تقنيات متقدمة لدمج النوى وإدارة الذاكرة لتحقيق أداء قريب من مستوى العتاد، مما يجعله مثاليًا للنشر الإنتاجي لنماذج مثل GPT وBERT وLLaMA. يمكن للمطورين توقع أوقات استجابة أسرع وتكاليف تشغيل أقل.

رأي تكنوفايب

هذا التطور يغير قواعد اللعبة للشركات التي تنشر نماذج اللغة الكبيرة على نطاق واسع. من خلال إزالة العبء الزائد في تنفيذ المحولات، يتيح vLLM استخدامًا أكثر كفاءة لموارد وحدة معالجة الرسوميات، مما يترجم إلى توفير في التكاليف وتجارب مستخدم أفضل. مع ازدياد حجم نماذج الذكاء الاصطناعي، تصبح هذه التحسينات حاسمة للحفاظ على الأداء في الوقت الفعلي.

المصدر الأصلي: https://huggingface.co/blog/native-speed-vllm-transformers-backend

التعليقات

لا توجد تعليقات بعد.

أضف تعليقًا