لقد أحدثت بنية المحولات ثورة في مجال معالجة اللغات الطبيعية (NLP) والمجالات الأخرى منذ تقديمها في ورقة "الانتباه هو كل ما تحتاجه". أحد الجوانب الحاسمة التي تؤثر بشكل كبير على عملية التدريب لنماذج المحولات هو اختيار المحسن. في هذه المدونة، بصفتي موردًا للمحولات، سوف أتعمق في تأثيرات اختيارات المحسن المختلفة على تدريب المحولات وكيف يمكن أن تؤثر على الأداء العام لهذه النماذج القوية.
فهم المُحسِّنين في تدريب المحولات
تلعب أدوات التحسين دورًا محوريًا في تدريب الشبكات العصبية، بما في ذلك نماذج المحولات. وتتمثل وظيفتها الأساسية في ضبط معلمات النموذج بشكل متكرر لتقليل دالة الخسارة المحددة مسبقًا. أثناء التدريب، يقوم المحسن بحساب تدرجات دالة الخسارة فيما يتعلق بمعلمات النموذج ثم يقوم بتحديث هذه المعلمات بناءً على التدرجات المحسوبة.
في سياق تدريب المحولات، يمكن أن يؤثر اختيار المحسن على العديد من الجوانب الرئيسية، مثل سرعة التقارب، والقدرة على التعميم، واستقرار عملية التدريب. تحتوي أدوات التحسين المختلفة على خوارزميات ومعلمات تشعبية مختلفة، مما قد يؤدي إلى اختلاف الأداء عند تطبيقها على نماذج المحولات.
أدوات التحسين الشائعة لتدريب المحولات
الهبوط التدرج العشوائي (SGD)
SGD هي واحدة من أبسط خوارزميات التحسين وأكثرها أهمية. يقوم بتحديث معلمات النموذج من خلال اتخاذ خطوات صغيرة في اتجاه التدرج السلبي لوظيفة الخسارة. بالنسبة لتدريب المحولات، يمكن أن يكون SGD فعالاً في بعض الحالات، خاصة عند دمجه مع تقنيات مثل انخفاض معدل التعلم. ومع ذلك، SGD لديه بعض القيود. يمكن أن يكون التقارب بطيئًا، خاصة بالنسبة لمجموعات البيانات الكبيرة والنماذج المعقدة مثل المحولات. بالإضافة إلى ذلك، يمكن أن يعلق SGD في الحد الأدنى المحلي، مما يؤدي إلى أداء دون المستوى الأمثل.
تقدير اللحظة التكيفية (آدم)
آدم هو محسن يستخدم على نطاق واسع في تدريب المحولات. فهو يجمع بين مزايا AdaGrad وRMSProp، باستخدام معدلات التعلم التكيفية لكل معلمة. يحسب آدم معدلات التعلم التكيفي من خلال تقدير اللحظات الأولى والثانية من التدرجات. وهذا يسمح لها بالتكيف مع خصائص كل معلمة، مما يجعلها أكثر كفاءة وقوة مقارنة بـ SGD. في نماذج المحولات، تبين أن آدم يتقارب بشكل أسرع ويحقق أداء أفضل في كثير من الحالات. يمكنه التعامل مع التدرجات المتفرقة بشكل جيد، وهو أمر شائع في مهام البرمجة اللغوية العصبية حيث قد تظهر بعض الكلمات بشكل أقل تكرارًا.
الجرعات
Adagrad هو مُحسِّن يقوم بتكييف معدل التعلم لكل معلمة بناءً على التدرجات التاريخية. وهو مفيد بشكل خاص لمشاكل البيانات المتفرقة، حيث يمكن أن يوفر تحديثات أكبر للمعلمات التي يتم تحديثها بشكل غير متكرر. في تدريب المحولات، يمكن أن يكون Adagrad مفيدًا عند التعامل مع ميزات الإدخال المتفرقة. ومع ذلك، أحد عيوب Adagrad هو أن معدل التعلم يمكن أن ينخفض بسرعة كبيرة جدًا بمرور الوقت، مما يتسبب في إبطاء عملية التدريب أو حتى التوقف قبل الوصول إلى الحل الأمثل.
RMSProp
RMSProp هو مُحسِّن تكيفي آخر يعالج مشكلة انخفاض معدل التعلم بسرعة كبيرة في Adagrad. ويستخدم متوسطًا متحركًا للتدرجات المربعة لضبط معدل التعلم لكل معلمة. لقد ثبت أن RMSProp فعال في تدريب الشبكات العصبية العميقة، بما في ذلك نماذج المحولات. يمكن أن يوفر تدريبًا أكثر استقرارًا مقارنة بـ Adagrad، خاصة في السيناريوهات التي تختلف فيها التدرجات بشكل كبير.
تأثيرات اختيار المحسن على سرعة التقارب
تعد سرعة التقارب لنموذج المحولات أثناء التدريب أمرًا بالغ الأهمية، خاصة عند التعامل مع مجموعات البيانات الكبيرة والبنيات المعقدة. يمكن أن يكون للمحسنات المختلفة تأثير كبير على مدى سرعة وصول النموذج إلى مستوى مرضٍ من الأداء.
يُعرف آدم عمومًا بسرعة التقارب السريعة. تتيح آلية معدل التعلم التكيفي الخاصة بها اتخاذ خطوات أكبر في المراحل الأولى من التدريب ثم تقليل حجم الخطوة تدريجيًا مع اقترابها من الحل الأمثل. يتيح ذلك لنماذج Transformer التعلم بسرعة من البيانات والوصول إلى مستوى أداء جيد في عدد قصير نسبيًا من العصور.


من ناحية أخرى، يمكن أن يكون SGD أبطأ بكثير في التقارب. نظرًا لأنه يستخدم معدل تعلم ثابتًا لجميع المعلمات، فقد يتطلب الأمر المزيد من العصور للوصول إلى نفس مستوى الأداء الذي حققه آدم. ومع ذلك، مع جدولة معدل التعلم المناسب، لا يزال من الممكن أن يكون SGD خيارًا قابلاً للتطبيق، خاصة بالنسبة للنماذج التي تحتوي على عدد كبير من المعلمات حيث يكون التجهيز الزائد أمرًا مثيرًا للقلق.
التأثير على القدرة على التعميم
التعميم هو قدرة النموذج على الأداء الجيد على البيانات غير المرئية. يمكن أن يؤثر اختيار المحسن على قدرة تعميم نماذج المحولات.
يمكن أن يؤدي المحسنون التكيفيون، مثل Adam، في بعض الأحيان إلى التجاوز، خاصة إذا تم تدريب النموذج لفترة طويلة جدًا أو لم يتم ضبط المعلمات الفائقة بشكل صحيح. وذلك لأن آدم يمكنه التكيف بسرعة كبيرة مع بيانات التدريب، والتقاط الضوضاء والخصوصيات التي قد لا تكون موجودة في بيانات الاختبار.
من ناحية أخرى، يمكن لـ SGD تعزيز تعميم أفضل في بعض الحالات. من خلال اتخاذ خطوات أصغر وأكثر اتساقًا أثناء التدريب، يمكن لـ SGD أن يساعد النموذج على تجنب الإفراط في التجهيز ومعرفة المزيد من الأنماط العامة في البيانات. ومع ذلك، يعتمد هذا أيضًا على معدل التعلم والمعلمات الفائقة الأخرى.
استقرار العملية التدريبية
يعد استقرار عملية التدريب عاملاً مهمًا آخر يتأثر باختيار المحسن. تضمن عملية التدريب المستقرة عدم تقلب أداء النموذج بشكل كبير أثناء التدريب وانخفاض وظيفة الخسارة بسلاسة.
يعتبر آدم عمومًا مُحسِّنًا مستقرًا لتدريب المحولات. تساعد آلية معدل التعلم التكيفي الخاصة بها على منع التحديثات الكبيرة التي قد تتسبب في عدم استقرار عملية التدريب. يوفر RMSProp أيضًا عملية تدريب مستقرة نسبيًا، وذلك بفضل المتوسط المتحرك للتدرجات المربعة.
في المقابل، يمكن أن يكون SGD أقل استقرارًا، خاصة عندما يكون معدل التعلم مرتفعًا جدًا. يمكن أن تؤدي معدلات التعلم المرتفعة إلى تجاوز معلمات النموذج للحل الأمثل، مما يؤدي إلى زيادة الخسارة وعدم الاستقرار في عملية التدريب.
اعتبارات عملية لموردي المحولات
باعتبارنا موردًا للمحولات، فإن فهم تأثيرات اختيار المحسن على تدريب المحولات يعد أمرًا بالغ الأهمية لتوفير أفضل الحلول لعملائنا. نحن بحاجة إلى النظر في المتطلبات المحددة لكل مشروع، مثل حجم مجموعة البيانات، وتعقيد النموذج، ومستوى الأداء المطلوب.
بالنسبة للعملاء الذين يحتاجون إلى تدريب سريع ويتعاملون مع مجموعات بيانات كبيرة، فقد نوصي باستخدام Adam أو غيره من أدوات التحسين التكيفية. يمكن أن تساعد أدوات التحسين هذه النماذج على التقارب بسرعة وتحقيق أداء جيد في وقت أقصر.
من ناحية أخرى، إذا كان العميل قلقًا بشأن التجهيز الزائد ويريد نموذجًا أكثر قابلية للتعميم، فقد يكون SGD مع جدولة معدل التعلم المناسب خيارًا أفضل. يمكننا أيضًا تقديم إرشادات حول ضبط المعلمات الفائقة لمحسنات مختلفة لضمان أفضل أداء ممكن.
توصيات المنتج
كمورد للمحولات، فإننا نقدم مجموعة من المحولات عالية الجودة المناسبة لمختلف التطبيقات. بالنسبة لمتطلبات الطاقة الكهربائية ذات الجهد المنخفض، نوصي باستخدام منتجاتنامحولات الطاقة الكهربائية ذات الجهد المنخفض. وهي مصممة لتوفير تحويل طاقة موثوق وفعال.
ملكنامحول التحكم من سلسلة BKيعد خيارًا ممتازًا لدوائر التحكم، حيث يوفر أداءً مستقرًا وتنظيمًا دقيقًا للجهد.
إذا كنت بحاجة إلى محول تحكم أحادي الطور، فلدينامحول التحكم أحادي الطورهو خيار موثوق يمكن أن يلبي احتياجاتك الخاصة.
خاتمة
إن اختيار المحسن له تأثير عميق على تدريب المحولات، مما يؤثر على سرعة التقارب، والقدرة على التعميم، واستقرار عملية التدريب. باعتبارنا موردًا للمحولات، فإننا ندرك أهمية مساعدة عملائنا على اتخاذ الاختيار الأمثل لمشاريعهم المحددة. من خلال النظر في خصائص أدوات التحسين المختلفة ومتطلبات كل تطبيق، يمكننا تقديم أفضل الحلول لضمان نجاح الأنظمة المعتمدة على المحولات.
إذا كنت مهتمًا بمنتجات المحولات الخاصة بنا أو كنت بحاجة إلى مزيد من المعلومات حول اختيار المحسن للتدريب على المحولات، فلا تتردد في الاتصال بنا للشراء وإجراء المزيد من المناقشات.
مراجع
- Vaswani, A., Shazer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, An,... & Polosukhin, I. (2017). الاهتمام هو كل ما تحتاجه. التقدم في أنظمة معالجة المعلومات العصبية.
- كينغما، دي بي، وبا، جيه (2014). آدم: طريقة للتحسين العشوائي. arXiv الطباعة المسبقة arXiv:1412.6980.
- دوتشي، ج.، هازان، إي، وسينجر، ي. (2011). أساليب التدرج التكيفي للتعلم عبر الإنترنت والتحسين العشوائي. مجلة أبحاث التعلم الآلي، 12 (يوليو)، 2121 - 2159.
- تيلمان، تي، وهينتون، جي. (2012). المحاضرة 6.5 - rmsprop: قسمة التدرج على المتوسط الجاري لمقداره الحديث. كورسيرا: الشبكات العصبية للتعلم الآلي، 4 (2)، 26 - 31.
