كشف عيوب الرافعة العلوية بأساليب العينات الصغيرة والتعلم بالنقل

الحل التقني لكشف عيوب الرافعة العلوية بالتعلم النقلي

باستخدام ResNet-18 المُدرَّب مسبقًا على ImageNet كنموذج أساسي، ننقل التعلم إلى مهمة تصنيف العيوب السطحية لمكونات الرافعة العلوية (5 فئات عيوب + فئة سليمة). قارنّا ثلاث استراتيجيات عبر أربعة مستويات من حجم العينة (50/100/300/500): تعزيز البيانات (CutMix + تحويلات هندسية، تحسّن الدقة +4%~7%)، تجميد مستخرج الميزات (تدريب طبقة FC فقط، T1=89.5% عند 300 عينة)، والضبط الدقيق للنموذج كاملًا (جميع الطبقات، T1=93.2% عند 500 عينة). سير العمل الموصى به: تعزيز البيانات ← تجميد FC كخط أساس سريع ← ضبط دقيق كامل للتحسين النهائي. بيئة التجربة: PyTorch 2.1.0 + NVIDIA A10، وفق معيار ISO 4301 لتقييم الأداء.

من أبرز التحديات في الكشف البصري عن العيوب الصناعية ندرة البيانات المُعلَّمة — فمكونات الرافعة العلوية (الحبل السلكي، العجلات، السكة، الخطاف، المكبح) تتنوع أشكال عيوبها (شرخ، اهتراء، تنقّر، تشوه، كسر)، ويتطلب جمع مئات الصور المُعلَّمة لكل نوع أسابيع من العمل. يتيح التعلم قليل العينات (Few-Shot Learning) والتعلم النقلي (Transfer Learning) الاستفادة من النماذج البصرية المُدرَّبة مسبقًا على مجموعات بيانات عامة واسعة النطاق (مثل ImageNet بـ 14 مليون صورة) ونقلها إلى مهام الكشف عن العيوب الصناعية حيث تكون بيانات المجال المستهدف شحيحة. تتناول هذه المقالة كشف 5 أنواع شائعة من العيوب السطحية لمكونات الرافعة العلوية (كسر أسلاك الحبل، اهتراء مداس العجلة، شرخ السكة، تشوه الخطاف، تشقق بطانة المكبح) كسيناريو تطبيقي، وتقارن منهجيًا فعالية استراتيجيات النقل المختلفة عند أحجام عينات تتراوح بين 50 و500 عينة.

تطبيق التعلم قليل العينات والنقلي في كشف عيوب الرافعة العلوية

إعداد التجربة ومجموعة البيانات

مجموعة البيانات: مجموعة صور العيوب السطحية لمكونات الرافعة العلوية (مُعلَّمة داخليًا من كيلود للصناعات الثقيلة، تم جمعها عام 2024، باستخدام كاميرا صناعية Basler acA2440-75um + مصدر إضاءة حلقي LED). إجمالي 1,875 صورة، 6 فئات (سليمة + 5 عيوب)، مقسمة إلى 4 مستويات تجريبية حسب حجم العينة (50/100/300/500 صورة/فئة، والباقي للتحقق/الاختبار). معالجة مسبقة موحدة: تغيير الحجم إلى 224×224، تطبيع بمتوسط [0.485,0.456,0.406] وانحراف معياري [0.229,0.224,0.225] (معيار ImageNet). النموذج الأساسي: ResNet-18 (مُدرَّب مسبقًا على ImageNet، 11.7 مليون معامل). مؤشرات التقييم: دقة Top-1 (المؤشر الرئيسي)، درجة F1.

أنواع العيوب
كسر أسلاك الحبل · اهتراء مداس العجلة · شرخ السكة · تشوه الخطاف · تشقق بطانة المكبح · سليمة
توزيع البيانات
إجمالي 1,875 صورة · 6 فئات متوازنة (312 صورة/فئة) · 224×224 RGB · كاميرا Basler صناعية
تجارب حجم العينة
4 مستويات: 50/100/300/500 صورة/فئة · الباقي كمجموعة تحقق/اختبار · 5 تكرارات لكل مستوى مع حساب المتوسط
النموذج الأساسي
ResNet-18 · مُدرَّب مسبقًا على ImageNet · 11.7 مليون معامل · PyTorch 2.1.0 · معالج A10 GPU

أساليب تعزيز البيانات

يُعد تعزيز البيانات من أكثر الاستراتيجيات أساسية وفعالية في سيناريوهات العينات المحدودة. اعتمدت هذه التجربة مزيجًا من ثلاث فئات من أساليب التعزيز: ① التحويلات الهندسية — دوران عشوائي (±15°)، قلب أفقي (احتمال 0.5)، إزاحة عشوائية (±10%)، تكبير/تصغير عشوائي (0.8~1.2)، قص عشوائي (0.08~1.0)؛ ② التحويلات الضوئية — ضبط السطوع (±20%)، ضبط التباين (±15%)، ضبط التشبع (±15%)، اهتزاز درجة اللون (±0.1)، ضوضاء غاوسية (σ=0.01)؛ ③ التعزيز المتقدم — المسح العشوائي (Random Erasing, p=0.5, max_area=0.2)، CutMix (قص عشوائي لصورة أخرى ودمجها، α=1.0). تم ضبط مضاعف التعزيز بين 5 و20 مرة.

التحويلات الهندسية
دوران ±15° · قلب أفقي · إزاحة ±10% · تكبير/تصغير 0.8~1.2 · قص عشوائي 0.08~1.0
تحويل الإضاءة
السطوع ±20% · التباين ±15% · التشبع ±15% · درجة اللون ±0.1 · ضوضاء غاوسية σ=0.01
تعزيز متقدم
Random Erasing p=0.5 · CutMix α=1.0 · مضاعف التعزيز 5x-20x
تحسين الدقة
50 عينة + تعزيز: T1 من 62.3% إلى 68.5% (+6.2%) · 300 عينة: من 85.2% إلى 89.5% (+4.3%)

مقارنة استراتيجيات النقل

استراتيجية النقل50عينة100عينة300عينة500عينةوقت التدريبخطر الإفراط في التلاؤم
تجميدFC+تعزيز68.5%77.2%89.5%91.3%<5minمنخفض
ضبط دقيق كامل+تعزيز70.1%80.8%91.7%93.2%~35minمتوسط
تجميدFC(بدون تعزيز)62.3%71.5%85.2%88.6%<3minمنخفض
ضبط دقيق كامل(بدون تعزيز)64.8%74.6%87.1%90.3%~30minمتوسط-مرتفع

عند التدريب من الصفر (بدون استخدام أوزان مُدرّبة مسبقًا)، بلغت دقة T1 نسبة 41.8% فقط مع 50 عينة، وهي أقل بكثير من أي استراتيجية نقل تعلم. حقّق تحسين البيانات (Data Augmentation) أكبر تحسّن في حالات العينات المحدودة (50/100 عينة) بنسبة (+5~6%)، ويتناقص هذا التحسّن مع زيادة حجم العينات (+4.3% عند 300 عينة، +2.9% عند 500 عينة). عندما تبلغ البيانات المصنّفة ≥300 صورة، تحقق استراتيجية تجميد الطبقة الأخيرة (Freeze FC) دقة T1 تصل إلى ≈90%، وهو ما يلبّي معظم متطلبات النشر الصناعي. في سيناريو 500 عينة، يحقق الضبط الكامل (Full Fine-tuning) دقة T1 = 93.2%، مقتربًا من الحد الأقصى للتعلم الخاضع للإشراف.


خطوات النشر الهندسي الموصى بها

بناءً على التجارب المذكورة أعلاه، يُنصح باتباع الخطوات الهندسية التالية: الخطوة الأولى (إنشاء خط الأساس) — استخدام استراتيجية تجميد الطبقة الأخيرة (Freeze FC) مع تحسين البيانات الأساسي (تدوير + قلب + سطوع + تشويش)، وإنشاء نموذج أساسي سريعًا باستخدام 100~300 عينة مصنّفة (دقة T1 ≈ 90%). الخطوة الثانية (تحسين متقدم) — إضافة استراتيجيات تحسين متقدمة مثل CutMix تدريجيًا، ومراقبة ما إذا كانت دقة مجموعة التحقق تستمر في الارتفاع. الخطوة الثالثة (الضبط الكامل) — بعد استقرار دقة خط الأساس، يتم فك تجميد جميع الطبقات لإجراء ضبط كامل للنموذج (تصغير معدل التعلم 10 مرات إلى 0.0001)، وعادةً ما يحقق ذلك تحسنًا إضافيًا بنسبة 1~2%. الخطوة الرابعة (النشر) — تصدير النموذج بصيغة ONNX، وبعد التكميم باستخدام TensorRT INT8 يتم نشره على Jetson Orin NX (زمن الاستدلال ≈ 1.2ms لكل صورة). يمكن إكمال العملية بأكملها خلال 1~2 يوم.


الأسئلة الشائعة حول كشف عيوب الرافعات

س: لماذا لا نستخدم نموذجًا أكبر مثل ResNet-50/101 مباشرة في نقل التعلم لكشف عيوب الرافعة العلوية؟

ج: غالبًا ما يكون ResNet-18 هو الخيار الأمثل في البيئات الصناعية، للأسباب التالية: ① كشف عيوب الرافعة العلوية هو مهمة تصنيف دقيق (Fine-grained)، والعمق الزائد للطبقات يؤدي إلى ميزات مجردة جدًا لا تساعد على التقاط خصائص النسيج المحلية؛ ② مجموعات بيانات العيوب الصناعية أصغر بكثير من الصور الطبيعية، ومعاملات ResNet-18 البالغة 11.7 مليون معامل كافية تمامًا؛ ③ زمن استدلال ResNet-18 يبلغ حوالي 60% فقط من زمن ResNet-50 (1.2ms مقابل 2.0ms على Jetson Orin NX). النماذج الكبيرة لا تُظهر ميزة ملحوظة إلا عندما يتجاوز حجم البيانات ≥5,000 صورة لكل فئة.

س: أيّهما أكثر ملاءمة لكشف العيوب الصناعية: CutMix أم MixUp في تحسين البيانات؟

ج: CutMix هو الخيار الأفضل. يعتمد MixUp على المزج الخطي على مستوى البكسل (تراكب الصور)، مما يولّد "صورًا شبحية" غير طبيعية في الصور الصناعية (عيوب شفافة متراكبة) ويقلل من حساسية النموذج لحواف العيوب. أما CutMix فيعتمد على الدمج على مستوى المناطق (قص منطقة مستطيلة من صورة ولصقها في صورة أخرى)، مما يحافظ على سلامة العيب الفردي. في هذه التجارب، تفوّق CutMix على MixUp بنسبة F1 أعلى بحوالي 2.3% (في سيناريو 300 عينة).

س: هل تحتاج مكونات الرافعة المختلفة (الحبل السلكي / العجلات / السكة / الخطاف) إلى نماذج تدريب منفصلة؟

ج: يُنصح بتدريب نموذج تصنيف سداسي الفئات منفصل لكل نوع مكوّن (5 عيوب + 1 سليم)، بدلاً من نموذج موحّد متعدد المكونات والعيوب. السبب هو أن الخلفية النسيجية وظروف الإضاءة وأشكال العيوب تختلف اختلافًا كبيرًا بين المكونات المختلفة، مما يتطلب من النموذج الموحّد حجم بيانات وسعة نموذج أكبر بكثير. يمكن تدريب نموذج التصنيف السداسي (50~300 صورة لكل فئة) باستخدام استراتيجية تجميد الطبقة الأخيرة خلال 30 دقيقة فقط، وعند النشر تتم إدارة النماذج الستة بصيغة ONNX عبر حاويات مصغّرة (Microservices).

س: ما مقدار مساحة التخزين المطلوبة لنشر نموذج نقل التعلم على أجهزة Jetson الطرفية؟

ج: يبلغ حجم نموذج ResNet-18 بصيغة FP32 حوالي 45MB، وبعد التكميم باستخدام TensorRT INT8 ينخفض إلى حوالي 12MB. إجمالي المساحة المطلوبة: 6 نماذج للمكونات (6×12MB=72MB) + محرك الاستدلال (حوالي 200MB) + ملفات الإعدادات، أي أقل من 300MB إجمالاً. يمكن لنسخة Jetson Orin NX بسعة 16GB نشر أكثر من 20 نموذجًا بسهولة. زمن الاستدلال للنموذج الواحد حوالي 1.2ms (INT8, batch=1)، وزمن الاستدلال المتسلسل للنماذج الستة أقل من 8ms.

مقالات ذات صلة

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP