خليط الخبراء (MoE)
خليط الخبراء هو بنية شبكة عصبية تقسم النموذج إلى شبكات فرعية متخصصة متعددة تسمى خبراء، كل منها مسؤول عن معالجة أنواع مختلفة من المدخلات، وتستخدم آلية توجيه لتوجيه كل إدخال إلى الخبراء الأكثر صلة. هذه البنية تمكن تدريب نماذج بعدد إجمالي كبير جداً من المعاملات مع الحفاظ على تكلفة حسابية لكل استدلال أقل بكثير من نموذج كثيف بحجم مكافئ. في بنية MoE، يتكون النموذج من مجموعة من خبراء الشبكة التغذية الأمامية، عادةً بين 8 و256 أو أكثر، وموجه أو وظيفة توجيه تتعلم تعيين كل رمز إدخال إلى مجموعة فرعية من الخبراء، عادةً أعلى 1 أو أعلى 2 من الأكثر صلة. هذا يعني أنه لأي إدخال معين، يتم تنشيط جزء فقط من معاملات النموذج الإجمالية، بينما يبقى الباقي خاملاً. الميزة الرئيسية لـ MoE هي أنه يفصل سعة النموذج، المقاسة بإجمالي المعاملات، عن التكلفة الحسابية، المقاسة بالمعاملات المنشطة لكل استدلال. نموذج بحجم 1 تريليون معامل إجمالي ولكن فقط 100 مليار معامل منشط لكل رمز يمكنه مطابقة سعة المعرفة لنموذج كثيف بحجم 1 تريليون معامل مع العمل بسرعة وتكلفة نموذج بحجم 100 مليار معامل. تم اعتماد بنيات MoE على نطاق واسع في النماذج الرائدة، بما في ذلك Mixtral 8x7B، الذي يستخدم 8 خبراء مع 7 مليارات معامل لكل منهم، ويقوم بتنشيط خبيرين لكل رمز لـ 12.9 مليار معامل نشط فعال؛ ونماذج DeepSeek، التي تستخدم تصاميم MoE أكثر تقدماً مع تخصيص دقيق للخبراء؛ وتنفيذات GPT-4 المختلفة، التي يعتقد على نطاق واسع أنها تستخدم بنيات MoE. تدريب نماذج MoE يقدم تحديات فريدة، بما في ذلك موازنة التحميل عبر الخبراء لمنع بعض الخبراء من الإفراط في الاستخدام بينما يظل آخرون غير مدربين بشكل كافٍ، وعبء الاتصال في التدريب الموزع، والحاجة إلى بنية تحتية متخصصة للتعامل مع التوجيه الديناميكي للرموز عبر الخبراء.
في الخدمات المالية
مثال واقعي
تنشر شركة تكنولوجيا مالية كبيرة تقدم تحليلات مدعومة بالذكاء الاصطناعي لـ 500 مؤسسة مالية نموذج خليط خبراء لخدمة قاعدة عملائها المتنوعة. تحتاج منصة الشركة إلى التعامل مع مجموعة واسعة من المهام عبر مجالات مالية مختلفة، بما في ذلك تحليل مخاطر الائتمان للبنوك وتحسين المحافظ الاستثمارية لمديري الأصول ومعالجة المطالبات لشركات التأمين ومراقبة الامتثال للمنظمين. تختار الشركة نموذج MoE بحجم 56 مليار معامل مع 16 خبيراً، وتفعيل خبيرين لكل رمز لنموذج نشط فعال بحجم 7 مليارات معامل. يتم نشر النموذج على مجموعة من 32 خادم GPU قياسي، يخدم حوالي 10000 مستخدم متزامن. آلية التوجيه تتعلم توزيع الاستعلامات عبر الخبراء بناءً على المجال ونوع المهمة. عندما يسأل محلل ائتمان في بنك إقليمي عن مخاطر قرض عقاري تجاري، يتم توجيه الاستعلام إلى خبراء تخصصوا في التمويل العقاري وتحليل مخاطر الائتمان. عندما يسأل مدير مطالبات تأمين عن مؤشرات احتيال في مطالبة طبية، يتم توجيه الاستعلام إلى خبراء تخصصوا في كشف الاحتيال التأميني والترميز الطبي. تقيس الشركة أداء النموذج عبر 50 مهمة مالية مختلفة وتجد أن نموذج MoE يحقق أو يتجاوز جودة نموذج كثيف بحجم 40 مليار معامل مع الحاجة إلى 40% فقط من حساب الاستدلال. التكلفة الإجمالية للنشر، بما في ذلك الأجهزة والكهرباء والتبريد، أقل بنسبة 55% من نشر النموذج الكثيف المكافئ. تلاحظ الشركة أيضاً أن خبراء نموذج MoE يظهرون أنماط تخصص واضحة، حيث يعالج بعض الخبراء باستمرار الاستعلامات المتعلقة بالائتمان، وآخرون استعلامات التأمين، وآخرون استعلامات الامتثال التنظيمي.
لماذا يهم في التمويل
تمثل بنية خليط الخبراء تقدماً أساسياً في تصميم نماذج اللغات الكبيرة، وتقدم حلاً عملياً للتوتر بين جودة النموذج وتكلفة الاستدلال الذي كان تحدياً مركزياً في نشر الذكاء الاصطناعي. للمؤسسات المالية، هذه المفاضلة حادة بشكل خاص لأنها تحتاج إلى أعلى قدرات الذكاء الاصطناعي جودة لمهام مثل تحليل الامتثال وتقييم المخاطر والاستدلال المالي، ولكنها تحتاج أيضاً إلى نشر هذه القدرات على نطاق واسع عبر آلاف المستخدمين وملايين المعاملات. بنيات MoE تجعل هذا ممكناً عن طريق فصل سعة النموذج عن تكلفة الاستدلال، مما يمكن المؤسسات من الاستفادة من معرفة وقدرات استدلال نماذج كبيرة جداً مع دفع تكلفة حسابية فقط لنماذج أصغر بكثير. الآثار الاقتصادية كبيرة. لبنك كبير ينشر الذكاء الاصطناعي عبر المؤسسة، الفرق بين نموذج كثيف ونموذج MoE بجودة مكافئة يمكن أن يترجم إلى ملايين الدولارات سنوياً في تكاليف البنية التحتية. يمكن إعادة استثمار هذه التوفيرات في توسيع قدرات الذكاء الاصطناعي أو تحسين جودة النموذج أو تقليل التكاليف للعملاء. تخصص الخبراء في نماذج MoE يقدم أيضاً إمكانيات مثيرة للاهتمام للتخصيص الخاص بالمجال. يمكن للمؤسسات المالية ضبط أو تكييف خبراء محددين داخل نموذج MoE لتحسين الأداء على المهام المالية دون التأثير على قدرات النموذج العامة، مما يوفر نهجاً أكثر استهدافاً وكفاءة لتخصيص النموذج من الضبط الكامل للنماذج الكثيفة. ومع ذلك، تقدم بنيات MoE أيضاً تعقيداً في النشر والمراقبة والتحسين. يجب مراقبة آلية التوجيه بعناية لضمان استخدام متوازن للخبراء، حيث يمكن أن يؤدي التوجيه غير المتوازن إلى تدريب مفرط لبعض الخبراء بينما يظل آخرون غير مستخدمين بشكل كافٍ. عبء الاتصال لتوجيه الرموز بين الخبراء في التدريب والاستدلال الموزعين يمكن أن يكون كبيراً أيضاً.
مصطلحات ذات صلة
استكشف في Finatune
أسئلة شائعة
ما هو خليط الخبراء في الذكاء الاصطناعي؟
خليط الخبراء (MoE) هو بنية شبكة عصبية تقسم النموذج إلى شبكات فرعية متخصصة تسمى خبراء، مع آلية توجيه ترسل كل إدخال إلى الخبراء الأكثر صلة. هذا يسمح للنماذج بأعداد معاملات كبيرة بالعمل بسرعة نماذج أصغر بكثير.
كيف تفيد بنية MoE تطبيقات الذكاء الاصطناعي المالي؟
يقلل MoE تكاليف الاستدلال مع الحفاظ على جودة نموذج عالية. يمكن للمؤسسات المالية نشر نماذج كبيرة السعة بجزء صغير من تكلفة النماذج الكثيفة، مما يجعل الذكاء الاصطناعي أكثر سهولة في الوصول.
ما هي أفضل نماذج MoE للخدمات المالية؟
Mixtral 8x7B وDeepSeek هما نموذجان رائدان مفتوحا المصدر من MoE. Mixtral يستخدم 8 خبراء مع 2 نشطين لكل رمز. DeepSeek يستخدم تصاميم MoE أكثر تقدماً لتخصص أفضل.