خوارزمية مانع التأرجح RL للرافعات: من PPO إلى SAC

تعتمد كيلود للصناعات الثقيلة على خوارزميات التعلم المعزز العميق PPO وSAC، لبناء حلقة تحكم متكاملة في مانع التأرجح تمتد من المحاكاة التدريبية إلى النشر الفعلي على وحدات التحكم S7-1500 PLC. يحقق نظام مانع التأرجح بالتعلم المعزز انخفاضًا في زمن التخميد بنسبة 74.4% مقارنةً بوحدات التحكم PID، مع بقاء زاوية التخميد المتبقية عند 0.3° فقط، دون الحاجة إلى إعادة ضبط المعامل عند تغيّر طول الحبل أو اختلاف الأحمال.

تحديات مانع التأرجح في الروافع ودور الذكاء الاصطناعي

كيلود للصناعات الثقيلة · بنية التحكم في مانع التأرجح بالتعلم المعزز
المستشعرات
الزاوية · الموضع · سعة التأرجح
مراقب الحالة
الترشيح · التطبيع
الوكيل الذكي RL
شبكة استراتيجية PPO / SAC
أوامر الحركة
السرعة · العزم
نظام الرافعة
الجسر · العربة · الرفع
التغذية الراجعة البيئية (إشارة المكافأة · الحالة التالية) تدريب تكراري مغلق الحلقة
في البيئات الصناعية مثل الموانئ ومصانع الصلب والمستودعات اللوجستية، يُعد تأرجح الرفع في الروافع الجسرية العائق الأبرز أمام كفاءة التشغيل والسلامة. ينتج عن حركات البدء والإيقاف للرافعة تأرجح متبقٍّ في الرفع، ويضطر المشغّلون ذوو الخبرة إلى الاعتماد على مهاراتهم اليدوية لتثبيت الرفع، إذ يستغرق ضبط الموضع الواحد عشرات الثواني أو حتى دقائق من التعديلات المتكررة، مما يؤثر بشكل كبير على إيقاع العمل العام. أما الطرق التقليدية لمكافحة التأرجح — مثل مانع التأرجح الميكانيكي، ومانع التأرجح الإلكتروني (PID)، وتشكيل المدخلات (Input Shaping) — فإنها تؤدي أداءً مقبولًا في ظروف التشغيل الثابتة، لكنها تفقد متانتها بشكل ملحوظ عند مواجهة تغيّر طول الحبل، أو اختلاف كتلة الحمولة، أو الاضطرابات الهوائية، مما يستدعي إعادة ضبط المعامل يدويًا بشكل متكرر. منذ عام 2020، فتحت أساليب الذكاء الاصطناعي المتمثلة في التعلم المعزز (Reinforcement Learning, RL) مسارًا جديدًا تمامًا للتحكم في مانع التأرجح. يتفاعل الوكيل الذكي RL باستمرار مع البيئة ليتعلم بشكل ذاتي استراتيجية التحكم المثلى، دون الحاجة إلى نمذجة صريحة لديناميكيات النظام، ويتمتع بقدرات قوية على ملاءمة اللاخطية والتكيّف الذاتي. وقد بادر فريق كيلود في مجال الروافع الذكية إلى تطبيق خوارزميتي التعلم المعزز العميق PPO (Proximal Policy Optimization) وSAC (Soft Actor-Critic) في نظام التحكم الفعلي بمانع التأرجح. يستعرض هذا المقال بشكل منهجي كامل التقنية المتبعة في هذا الحل، بدءًا من مبدأ الخوارزمية، وبناء بيئة المحاكاة، وضبط التدريب، وصولًا إلى النشر الصناعي، مع تقديم بيانات مقارنة كمية مع الأساليب التقليدية.

تصميم فضاء الحالة وفضاء الحركة

مستشعر الميلان ونظام مانع التأرجح في الرافعات: من MDP إلى Sim2Real

المهمة الأساسية لنظام مانع التأرجح RL هي تحويل النظام الفيزيائي للرافعة إلى عملية قرار ماركوف (MDP)، حيث يؤثر تعريف فضاء الحالة وفضاء الإجراءات بشكل مباشر على فعالية تعلم الاستراتيجية وسرعة التقارب. يتضمن فضاء الحالة في حل كيلود خمسة أبعاد رئيسية:

  • زاوية تأرجح الرفع θ: تُقاس في الوقت الفعلي بواسطة مستشعر الميلان أو نظام الرؤية، وعادةً ما تكون الدقة في حدود ±0.1°، وهي كمية التغذية الراجعة الأكثر أهمية لمنع التأرجح، وتعكس سعة التأرجح مباشرة.
  • السرعة الزاوية ω: المشتقة الأولى لزاوية التأرجح، وتعكس اتجاه التأرجح واتجاهه، مما يساعد الوكيل الذكي على تقدير تغيرات الحالة المستقبلية واتخاذ إجراءات تخميد مسبقة.
  • موضع العربة x: يتم الحصول عليه من خلال التغذية الراجعة من المشفر، ويستخدم لتحقيق هدف تحديد المواقع الدقيق — الهدف النهائي لمنع التأرجح هو تثبيت العربة فوق الموضع المستهدف بأقل سعة تأرجح.
  • سرعة العربة v: قيمة التغذية الراجعة لحلقة السرعة المغلقة، وتمنع التأرجح الثانوي الناتج عن التغيرات المفاجئة في التسارع، وتساعد الوكيل الذكي على فهم خصائص الزخم للنظام.
  • طول الحبل L: قيمة طول الحبل في الوقت الفعلي لآلية الرفع، وتؤثر مباشرة على التردد الطبيعي للنظام (T=2π√(L/g))، فكلما زاد طول الحبل، زادت دورة التأرجح، ويجب تكييف استراتيجية وحدة التحكم وفقًا لذلك.

يحدد بُعد متجه الحالة مباشرة حجم طبقة الإدخال لشبكة الاستراتيجية (Policy Network). تغطي الأبعاد الخمسة فيزيائيًا جميع الكميات القابلة للقياس للنظام ناقص التحفيز، مما يضمن قابلية ملاحظة النظام بشكل كامل للوكيل الذكي RL. في التنفيذ، يجب تطبيع كل بُعد حالة إلى الفاصل الزمني [-1, 1] أو [0, 1] لتجنب عدم استقرار تدريب الشبكة بسبب اختلاف وحدات القياس.

تم تصميم فضاء الإجراءات كمخرج مستمر ثنائي الأبعاد:

  • أمر تسارع العربة ax: نطاق القيمة [-1.0, 1.0] م/ث²، كقيمة هدفية لحلقة السرعة في وحدة التحكم بالتردد. التسارع الإيجابي يدفع العربة للتسارع للأمام، والسلبي يبطئها ويكبحها.
  • تعويض سرعة الرفع Δvh: يعوض سرعة الرفع عند تغير طول الحبل. عندما ترفع العربة في نفس الوقت، يغير تغير طول الحبل الخصائص الديناميكية للنظام، ويمكن أن يمنع عنصر التعويض الاضطرابات الإضافية الناتجة عن تغير طول الحبل.

يحقق فضاء الإجراءات المستمر منحنى تحكم أكثر سلاسة مقارنة بالإجراءات المنفصلة (مثل التحكم في ثلاث سرعات فقط: تسارع/تباطؤ/سرعة ثابتة)، وهذا أمر بالغ الأهمية للمعدات الثقيلة مثل الرافعات — فالبدء والتوقف المتكرر المفاجئ لا يزيد من إجهاد الآلات ويقصر عمر الحبل السلكي فحسب، بل قد يؤدي أيضًا إلى مخاطر تتعلق بالسلامة مثل انفصال الحمولة. يتيح الإخراج المستمر ثنائي الأبعاد للوكيل الذكي إكمال تحديد المواقع المانع للتأرجح بشكل مثالي بمنحنى تسارع سلس، تمامًا مثل المشغل المتمرس.

تصميم دالة المكافأة متعددة الأهداف

دالة المكافأة هي جوهر تدريب RL — فهي تشفر معرفة المهندس في أهداف تعلم الوكيل الذكي. يعتمد حل كيلود مكافأة مركبة موزونة، تتضمن أربعة عناصر فرعية:

R = w₁·Rswing + w₂·Rpos + w₃·Renergy + w₄·Rterminal

  • عقوبة زاوية التأرجح Rswing = -α·θ² – β·ω². يطبق هذا العنصر مكافأة سلبية مستمرة عندما تكون زاوية التأرجح أو السرعة الزاوية غير صفرية، مما يدفع الوكيل الذكي للقضاء على التأرجح أولاً. تتحكم نسبة α وβ في ما إذا كانت "الأولوية للموضع" أم "الأولوية لزاوية التأرجح" — في سيناريوهات السلامة يمكن زيادة قيمة αβ، وفي سيناريوهات الكفاءة يمكن تقليلها بشكل مناسب.
  • مكافأة تحديد المواقع Rpos = -γ·|x – xtarget|. تعطي مكافأة سلبية أكبر عندما تكون العربة بعيدة عن الموضع المستهدف، مما يدفع الوكيل الذكي للوصول إلى الهدف في أسرع وقت ممكن. عند استخدامها مع المكافأة النهائية، تمنع الوكيل الذكي من السعي لإزالة التأرجح دون تحديد المواقع.
  • عنصر استهلاك الطاقة Renergy = -δ·ax² – ε·Δvh². يعاقب على التسارع غير الضروري وإجراءات التعويض. صُمم هذا التصميم ليجعل الوكيل الذكي يجد نقطة توازن بين جودة التحكم واستهلاك الطاقة، متجنبًا سلوك "التحكم المفرط" مثل الاهتزاز عالي التردد.
  • المكافأة النهائية Rterminal: تُعطى مكافأة إيجابية لمرة واحدة عندما يكون |θ| < θth (حد زاوية التأرجح، عادةً 0.5°) و|x – xtarget| < dth (حد تحديد المواقع، 10 مم) لمدة تزيد عن 3 ثوانٍ، لتشجيع الوكيل الذكي على إكمال المهمة بحالة مستقرة.

يتم تحديد معاملات الوزن {w₁, w₂, w₃, w₄} من خلال مسح المعاملات الفائقة. يستخدم فريق كيلود التحسين البايزي (Bayesian Optimization) للبحث عن أفضل مجموعة أوزان في فضاء المعاملات، والمبدأ النهائي المحدد هو: معامل عقوبة زاوية التأرجح هو الأكبر (w₁ هو الأولوية القصوى)، يليه معامل تحديد المواقع (w₂ هو الأولوية الثانية)، ومعامل استهلاك الطاقة هو الأصغر (w₃ كقيد مرن). يضمن هذا التصميم الهرمي أن يتعلم الوكيل الذكي إزالة التأرجح أولاً، ثم تحديد المواقع بدقة وتوفير الطاقة — وهذا يتماشى مع المبدأ الأساسي للسلامة الصناعية.

بناء بيئة المحاكاة: محاكاة مشتركة Simulink + Adams

يتطلب تدريب RL ملايين الخطوات الزمنية من بيانات التفاعل، والتدريب المباشر على الآلة الحقيقية ليس آمنًا ولا اقتصاديًا — خطأ واحد قد يؤدي إلى انقلاب الرافعة أو كسر الحبل السلكي. يبني حل كيلود بيئة محاكاة مشتركة عالية الدقة تعتمد على MATLAB/Simulink + Adams، تجمع بين مرونة خوارزميات Simulink ودقة ديناميكيات الأجسام المتعددة في Adams.

في Simulink، يتم بناء نموذج البندول البسيط بطول حبل متغير، ومعادلته الديناميكية الأساسية هي:

(mL²)·θ" + 2mL·vh·θ' + mgL·sinθ = -mL·cosθ·ax

حيث m هي كتلة الحمولة، L هو طول الحبل، vh هي سرعة الرفع، ax هو تسارع العربة. الحد الأول على الجانب الأيسر يمثل عزم القصور الذاتي، والحد الثاني يمثل عزم كوريوليس (الناتج عن تغير طول الحبل)، والحد الثالث يمثل عزم الاستعادة الجاذبي؛ والجانب الأيمن يمثل عزم الإثارة الناتج عن تسارع العربة المنقول إلى الحمولة عبر الحبل. على الرغم من أن هذا النموذج يفترض جسمًا صلبًا، إلا أنه يصف الخصائص الديناميكية الرئيسية لمنع تأرجح الرافعة.

من ناحية أخرى، يوفر Adams محاكاة ديناميكيات الأجسام المتعددة ثلاثية الأبعاد دقيقة، بما في ذلك نمذجة الحبل السلكي كجسم مرن (تقسيم إلى أجزاء متعددة الأجسام الصلبة + اتصالات بنابض ومخمد)، واحتكاك تلامس العجلات مع السكة (نموذج احتكاك كولوم + تأثير Stribeck)، وخصائص عزم دوران المحرك (بما في ذلك تشبع الحدود وتأخير الاستجابة) وغيرها من العوامل غير الخطية. يتبادل Simulink البيانات مع Adams عبر واجهة المحاكاة المشتركة (Simulink Coder / Adams Controls Toolkit) كل 10 مللي ثانية — يرسل Simulink أوامر التسارع إلى Adams، ويعيد Adams زاوية التأرجح والموضع والحالات الأخرى إلى Simulink — مما يشكل حلقة مغلقة عالية الدقة.

تكمن ميزة هذه المحاكاة المشتركة في الاستفادة من نقاط القوة لكل منهما: يتولى Simulink التكرار السريع لخوارزمية RL وضبط المعاملات الفائقة، ويتولى Adams التحقق من الدقة الفيزيائية. وجد فريق كيلود في المشاريع الفعلية أن استراتيجية RL المدربة على نموذج البندول البسيط في Simulink، عند اختبارها في بيئة Adams عالية الدقة، ينخفض أداؤها بنحو 15% إلى 20%، ولكن بعد الضبط الدقيق ببيانات Adams يمكن استعادتها إلى مستوى قريب من المحاكاة.

مقارنة تدريب PPO وSAC وضبط المعاملات الفائقة

قام كيلود بالتحقق الهندسي والمقارنة المنهجية لكل من خوارزميتي PPO (Proximal Policy Optimization) وSAC (Soft Actor-Critic) في نفس الوقت، وهذه هي المرة الأولى في صناعة الرافعات المحلية التي يتم فيها إكمال تجربة مقارنة شاملة للخوارزميتين الرئيسيتين RL على نفس المنصة.

تشتهر PPO باستقرار تدريبها ومتانة معاملاتها الفائقة، وتتقارب بسرعة في مهام منع التأرجح — تصل إلى مستوى قابل للاستخدام مع زمن إزالة التأرجح أقل من 3 ثوانٍ في حوالي 500,000 خطوة زمنية. آليتها الأساسية هي استخدام عملية القص (clip) لتقييد خطوة تحديث الاستراتيجية، لتجنب الابتعاد المفرط عن الاستراتيجية القديمة في تحديث واحد مما يؤدي إلى انهيار التدريب. إعدادات المعاملات الفائقة الرئيسية هي: clip epsilon=0.2، معدل التعلم=3×10⁻⁴، GAE λ=0.95، هدف تباعد KL=0.02، بنية الشبكة عبارة عن طبقتين متصلتين بالكامل بـ 256 عقدة. تتميز آلية القص في PPO بميزة فريدة في المشاريع الصناعية: حتى لو لم يكن تصميم دالة المكافأة مثاليًا، تظل PPO قادرة على التقارب بشكل مستقر، مما يقلل من متطلبات خبرة المهندس في ضبط المعاملات.

بينما تتفوق SAC في كفاءة الاستكشاف والأداء النهائي. تعتمد SAC على إطار الإنتروبيا القصوى (Maximum Entropy)، حيث تزيد من إنتروبيا الاستراتيجية إلى أقصى حد مع تعظيم المكافأة، مما يشجع الوكيل الذكي على استكشاف فضاء الإجراءات بشكل كامل أثناء التدريب. بعد حوالي 800,000 خطوة زمنية من التدريب، يمكن لـ SAC الاقتراب من حل أفضل: ينخفض متوسط زاوية التأرجح المتبقية بنحو 15%، لكن منحنى التدريب في المراحل المبكرة يتقلب أكثر من PPO، وهي أكثر حساسية للمعاملات الفائقة لدالة المكافأة. تشمل المعاملات الفائقة الرئيسية لـ SAC: معامل درجة الحرارة α=0.2 (مع آلية ضبط تلقائي)، الإنتروبيا المستهدفة=-dim(A) (A هو بُعد فضاء الإجراءات، هنا 2)، بنية الشبكة هي أيضًا طبقتان بـ 256 عقدة.

كشف تحليل منحنيات التدريب عن اختلافات مثيرة للاهتمام: منحنى المكافأة التراكمية لـ PPO يتقارب بشكل أسرع لكنه يصل إلى مرحلة ثبات في وقت لاحق، مما يعكس أن قيد KL يحد من مساحة تحسين الاستراتيجية؛ بينما يتقلب منحنى SAC بشكل كبير في المراحل المبكرة لكنه يظل في اتجاه تصاعدي في المراحل اللاحقة، مما يُظهر قوة استكشاف أكبر. بناءً على هذا الاكتشاف، اعتمد فريق كيلود بشكل مبتكر استراتيجية تدريب على مرحلتين — في المرحلة الأولى، تُستخدم PPO (1,000,000 خطوة زمنية) للحصول بسرعة على استراتيجية أولية موثوقة، وفي المرحلة الثانية، تُستخدم هذه الاستراتيجية كنقطة بداية، ويُتحول إلى SAC (500,000 خطوة زمنية إضافية) للضبط الدقيق، ويكون الأداء النهائي المركب أعلى بنحو 12% من استخدام أي خوارزمية بمفردها.

انتقال Sim2Real: استراتيجية عشوائية المجال

يُعدّ الانتقال من المحاكاة إلى الآلة الفعلية (Sim2Real) أحد أكبر العوائق أمام تطبيق تعلّم التعزيز (RL) في البيئات الصناعية، والفجوة الأكثر صعوبة في عبورها بين الأوساط الأكاديمية والصناعية. لا يمكن لبيئة المحاكاة أن تعكس بشكل مثالي جميع الخصائص الفيزيائية للعالم الحقيقي — مثل ضوضاء المستشعرات، وتباين قوة الاحتكاك، وتقلبات زمن استجابة المحرك، والصلابة غير الخطية للحبل السلكي، ومقاومة الهواء. يعتمد حل كيلود على استراتيجية randomization (Randomization المجال) لسدّ هذه الفجوة بشكل منهجي.

تتمثل طريقة التنفيذ المحددة في أخذ عينات عشوائية من المعاملات الفيزيائية الرئيسية في بداية كل حلقة محاكاة:

  • طول الحبل L: يتم أخذ عينات موحدة من 3 أمتار إلى 15 مترًا، لتغطية نطاق التشغيل الأكثر شيوعًا للرافعات.
  • كتلة الحمولة m: عشوائية من 500 كجم إلى 10000 كجم، لمحاكاة التغير من عدم الحمل إلى الحمولة الكاملة.
  • معامل الاحتكاك: يتغير بنسبة ±30% حول القيمة الاسمية، لمحاكاة درجات الاهتراء وظروف التشحيم المختلفة.
  • ضوضاء المستشعر: تُضاف ضوضاء غاوسية N(0, σ²) إلى قياس زاوية التأرجح، حيث يتغير σ عشوائيًا في نطاق 0.01~0.05 راديان، لمحاكاة التداخل الكهربائي في الموقع الصناعي.
  • تأخر استجابة المحرك: أخذ عينات موحدة من 5~20 مللي ثانية، لمحاكاة التقلبات في زمن استجابة محول التردد.
  • معامل تخميد الحبل السلكي: يتغير بنسبة ±50% حول القيمة الاسمية، لمحاكاة الاختلافات في خصائص التخميد تحت أطوال وأقطار مختلفة للحبل.

من خلال أسلوب التدريب هذا القائم على "البقاء في ظل الفوضى"، تتعلم الشبكة الاستراتيجية إيجاد استراتيجية مانع تأرجح قوية في ظل ظروف عدم اليقين المختلفة — تمامًا مثل رياضي يتدرب في ظروف جوية متنوعة، فيتمكن من الأداء بثبات في أي بيئة. تحقق فريق كيلود من فعالية randomization المجال في الاختبارات الفعلية: استراتيجيات RL غير المدربة على randomization كانت نسبة نجاح نقل Sim2Real فيها أقل من 30%، وكانت أولى مرات التشغيل على الآلة الفعلية تُظهر تأرجحًا شديدًا بشكل شبه مؤكد؛ بينما الاستراتيجيات المدربة على randomization المجال بشكل كافٍ، ارتفعت نسبة نجاح النقل إلى أكثر من 85%، وحققت جودة تحكم قريبة من المحاكاة عند أول تشغيل فعلي.

تحليل مقارن مع طرق مانع التأرجح التقليدية

أجرى فريق كيلود مقارنة أفقية منهجية لثلاثة حلول على نفس المنصة التجريبية الموحدة: مانع التأرجح الإلكتروني PID (بعد الضبط الهندسي)، ومُشكّل المدخلات (Zero Vibration Shaper، ZV)، ومانع التأرجح RL (نظام متكامل بتدريب مرحلي PPO+SAC). تم توحيد الظروف التجريبية بشكل صارم لضمان موضوعية وقابلية استنساخ بيانات المقارنة.

معاملات التجربة: سعة الرفع 10 أطنان، طول الحبل 10 أمتار، مسافة حركة العربة 20 مترًا، متطلبات دقة تحديد المواقع ±10 مم.

مقارنة زمن إخماد التأرجح: يتصدر مانع التأرجح RL بزمن إخماد يبلغ 2.1 ثانية، متفوقًا بفارق كبير على PID الذي يبلغ 8.2 ثانية (انخفاض بنسبة 74.4%)، وعلى مُشكّل المدخلات ZV الذي يبلغ 5.6 ثانية (انخفاض بنسبة 62.5%). هذا يعني أنه في مهمة نقل واحدة، يمكن لحل RL توفير 3.5 إلى 6.1 ثانية من زمن انتظار إخماد التأرجح. وبحساب 30 دورة عمل في الساعة، يمكن توفير 105 إلى 183 ثانية كل ساعة — أي ما يعادل إنجاز 2 إلى 3 عمليات نقل إضافية في الساعة.

مقارنة زاوية التأرجح المتبقية: تبلغ زاوية التأرجح المتبقية لمانع التأرجح RL 0.3° فقط، وهي أفضل بكثير من 1.8° لـ PID و0.9° لـ ZV. زاوية التأرجح المتبقية الأصغر تعني إمكانية إجراء محاذاة الرفع وفك الخطاف فورًا بعد تحديد المواقع، دون انتظار اضمحلال التأرجح، مما يقلل بشكل كبير من زمن دورة العمل الواحدة.

مقارنة المتانة: في اختبار مقارن حيث تغير طول الحبل من 6 أمتار إلى 14 مترًا، احتاج PID إلى إعادة ضبط المعاملات يدويًا وإلا تدهور زمن إخماد التأرجح إلى أكثر من 12 ثانية؛ واحتاج مُشكّل المدخلات ZV إلى إعادة حساب معاملات نبضة التشكيل، وإلا نتج عنه تأرجح ثانوي حاد؛ بينما لم يتطلب حل RL أي ضبط، وبقي زمن إخماد التأرجح بين 2.1 و2.8 ثانية عبر نطاق أطوال الحبل بالكامل، مما أظهر قدرة تكيف ممتازة.

تجدر الإشارة إلى أن مانع التأرجح RL لا يستبدل الطرق التقليدية تمامًا — بل على العكس، فهو مبني على أساس تحكم سفلي موثوق وناضج. على مستوى حلقة السرعة المغلقة، لا يزال يتم استخدام حلقة سرعة PID، بينما يخرج RL فقط تسلسل القرار الأمثل على مستوى التسارع. هذا الهيكل الهجين "قرار RL + تنفيذ PID" يجمع بين ذكاء الاستراتيجية وموثوقية الطبقة السفلية، وهو النموذج السائد حاليًا لتطبيق RL الصناعي.

النشر الفعلي: نموذج ONNX على PLC S7-1500

يعد نشر الشبكة العصبية العميقة على PLC الصناعي القطعة الأخيرة من اللغز في هذا الحل، وأكثر المراحل تحديًا من الناحية الهندسية. لا يمكن لأطر عمل التعلم العميق التقليدية (مثل PyTorch وTensorFlow) العمل مباشرة على PLC، لذلك تستخدم كيلود ONNX Runtime كمحرك استدلال عبر المنصات، حيث يتم تصدير الشبكة الاستراتيجية المدربة إلى تنسيق ONNX القياسي ونشرها على PLC سيمنز S7-1500.

يعد التصميم خفيف الوزن للنموذج جوهر تقنية النشر، ويتضمن ثلاث خطوات رئيسية:

  • القياس الكمي (Quantization): استخدام تقنية القياس الكمي الثابت لضغط أوزان وقيم التنشيط من 32 بت (FP32) إلى 8 بت (INT8)، مما يقلل حجم النموذج من 2.3 ميجابايت إلى 0.6 ميجابايت، بانخفاض يصل إلى 74%. يتمالتحكم في فقدان دقة الاستدلال للنموذج بعد القياس الكمي ضمن 3%، دون تأثير ملموس على جودة التحكم.
  • دمج الطبقات (Layer Fusion): دمج عمليات BatchNorm + ReLU + Conv (أو الطبقات المتصلة بالكامل) المتتالية في عقدة حسابية واحدة، مما يقلل من عنق الزجاجة في عرض النطاق الترددي للذاكرة ويزيد سرعة الاستدلال بحوالي 40%.
  • تقليم الشبكة (Network Pruning): تقليم هيكلي يعتمد على حجم الأوزان، مما يقلل عقد الطبقة المخفية من 256 إلى 128، مع إزالة جميع أوزان الاتصال التي تقل مساهمتها عن 0.1%. ينخفض عدد معاملات النموذج النهائي بحوالي 56%، مع خسارة في الأداء أقل من 3%.

بنية النموذج النهائي المنشور على S7-1500 هي شبكة عصبية متصلة بالكامل من طبقة واحدة: طبقة إدخال بها 5 عقد (θ, ω, x, v, L)، طبقة مخفية بها 128 عقدة (تفعيل ReLU)، وطبقة إخراج بها عقدتان (تفعيل tanh، تُخرج ax وΔvh). يستغرق الاستدلال الواحد حوالي 0.8 مللي ثانية (مقاسًا على وحدة المعالجة المركزية المحلية لـ S7-1500)، وهو ما يلبي تمامًا متطلبات الوقت الفعلي لدورة تحكم تبلغ 10 مللي ثانية. يستدعي PLC مكتبة ONNX Runtime الديناميكية عبر كتلة وظيفية مخصصة (FB)، وينفذ استدلالًا أماميًا ويخرج أمر الحركة كل 10 مللي ثانية وفق دورة قياسية.

فيما يتعلق بآليات السلامة، يقدم حل النشر منطق تحديد الناتج والحماية من التدهور: عندما يكون استدلال ONNX Runtime غير طبيعي أو يتجاوز الناتج عتبات الأمان المحددة مسبقًا، يتحول تلقائيًا إلى التحكم السفلي PID، مما يضمن عدم تنفيذ أي أمر حركة خطير في أي ظرف.

الخلاصة والآفاق

نجح حل مانع التأرجح RL من كيلود في دفع خوارزميتي التعلم المعزز العميق PPO وSAC من البحث الأكاديمي إلى الممارسة الصناعية. من خلال تصميم مساحة الحالة الدقيق، ودالة المكافأة متعددة الأهداف، والتحقق المشترك عبر محاكاة Simulink+Adams، واستراتيجية نقل randomization المجال، والنشر خفيف الوزن لنموذج ONNX على PLC S7-1500، تم بناء حلقة تقنية متكاملة "تدريب بالمحاكاة، نشر على الآلة الفعلية".

يتفوق هذا الحل بشكل ملحوظ على الطرق التقليدية مثل PID ومُشكّل المدخلات في كفاءة إخماد التأرجح، ودقة تحديد المواقع، والقدرة على التكيف مع ظروف العمل، مع تقليل زمن إخماد التأرجح بأكثر من 60%، مما يوفر مسارًا تقنيًا عمليًا لذكاء وأتمتة الرافعات الصناعية. في المستقبل، ستستكشف كيلود اتجاهات أكثر تقدمًا مثل مانع التأرجح للرافعات المتعددة التعاونية، والمراقبة المباشرة لزاوية التأرجح باستخدام الرؤية الآلية، والتعلم التكيفي عبر الإنترنت على الحافة، والجدولة التعاونية متعددة الوكلاء، لمواصلة دفع تطور آلات الرفع من الأتمتة إلى الذكاء.

المراجع

الأسئلة الشائعة (FAQ)

س: ما هي متطلبات الأجهزة لتشغيل نموذج ONNX على PLC S7-1500؟ ج: يتطلب التشغيل المحلي لنموذج ONNX على S7-1500 وحدة معالجة مركزية تدعم تعليمات FP32 أو INT8، وذاكرة كافية لاستيعاب حجم النموذج (حوالي 0.6 ميجابايت بعد القياس الكمي). النموذج المذكور يعمل على وحدة المعالجة المركزية المحلية دون الحاجة إلى مسرعات خارجية.
س: كيف يتم ضمان السلامة عند فشل استدلال نموذج RL؟ ج: يتضمن حل النشر آلية أمان متعددة الطبقات. أولاً، يتم تحديد ناتج النموذج ضمن حدود آمنة. ثانيًا، إذا تم اكتشاف استدلال غير طبيعي أو ناتج خارج النطاق الآمن، يتحول النظام تلقائيًا إلى التحكم PID التقليدي السفلي، مما يضمن بقاء الرافعة في حالة تشغيل آمنة دائمًا.
س: هل يمكن تطبيق هذا الحل على رافعات بسعات وأحجام مختلفة؟ ج: نعم، تم تصميم استراتيجية randomization المجال لتغطية نطاق واسع من الاختلافات الفيزيائية. تم التحقق من الحل على نطاق أطوال حبل من 3 إلى 15 مترًا وأحمال من 500 كجم إلى 10 أطنان. لإعادة التطبيق على رافعة مختلفة، قد تكون هناك حاجة إلى إعادة تدريب بسيطة أو ضبط دقيق لمعاملات المحاكاة لتتناسب مع الخصائص الجديدة.
س: ما هو الفرق الرئيسي بين هذا الحل وطرق مانع التأرجح التقليدية؟ ج: الفرق الجوهري هو أن حل RL يتعلم استراتيجية تحكم ديناميكية من البيانات، مما يسمح له بالتكيف تلقائيًا مع التغيرات في ظروف العمل (مثل طول الحبل، والحمولة، والاهتراء) دون الحاجة إلى إعادة ضبط يدوية. بينما تعتمد الطرق التقليدية مثل PID وZV على نماذج رياضية ثابتة وتتطلب ضبطًا دقيقًا لتحقيق الأداء الأمثل في ظل ظروف محددة.

المواصفات القياسية ذات الصلة

FEM 1.001-1:2007 — رافعات — المصطلحات — الجزء 1: رافعات السكك الحديدية
FEM 1.001-2:2012 — رافعات — المصطلحات — الجزء 2: الرافعات العائمة
ISO 12480-1:1997 — رافعات — معدات الوصول والحماية — الجزء 4: الرافعات بذراع

مقالات ذات صلة

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP