تقطير المعرفة: دقة النموذج الكبير في نموذج صغير مع توفير قوة الحوسبة

📋 الملخص الرئيسي

جوهر التقطير المعرفي هو تمكين نموذج كبير مدرَّب مسبقًا (المعلم) من نقل توزيع الاحتمالات الذي يخرجه — أي العلاقات التشابهية بين التصنيفات الناعمة والفئات — إلى نموذج أصغر بكثير (الطالب). يتعلم النموذج الصغير من التصنيفات الناعمة للمعلم بدلاً من حفظ التصنيفات الصلبة فقط، وبالتالي يمكنه الحفاظ على معظم الدقة مع تقليص حجم المعاملات بمقدار مرتبة واحدة تقريبًا. يقدم هذا المقال أربعة شروط حدية للتقطير، واشتقاق دالة الخسارة المتعلقة بتليين درجة الحرارة وتباعد KL، ومثال تحقق عملي لكشف عيوب الرافعات، بالإضافة إلى أربعة أخطاء شائعة. ظروف التشغيل المناسبة: نموذج المعلم يعمل بالفعل على الخادم بتحقيق دقة مقبولة، والهدف هو نقل الاستدلال إلى صندوق طرفي للحصول على استجابة فورية واستهلاك منخفض للطاقة. غير مناسب عندما: دقة المعلم غير كافية، أو يكون توزيع بيانات التدريب والنشر مختلفًا بشكل كبير، أو تتطلب القرارات تفسيرًا صارمًا.

مخطط عام لحساب تقطير المعرفة من نموذج كبير إلى نموذج صغير

لنحسب التكلفة: عند نشر نموذج فحص بصري على الرافعات، تكون الدقة وحجم النموذج متناقضين. نموذج كبير بعمق عشرات الطبقات، بعدد معاملات يصل إلى مئات الملايين، يكون أكثر دقة في التعرف على كسر سلك الحبل وتقييم وضعية الحمولة، لكنه إما يعمل على خادم بزمن استدلال يبلغ عشرات الميلي ثانية، أو لا يستطيع الصندوق الطرفي تشغيله أصلًا. وبالنسبة للالتقاط والمحاذاة والفحص عبر الإنترنت التي تتطلب استجابة بمستوى الميلي ثانية، فإن تأخير عشرات الميلي ثانية يشكل خطرًا بحد ذاته.

على الجانب الآخر، النموذج الصغير الخالص يتميز بزمن استجابة منخفض واستهلاك طاقة منخفض، ويمكن تشغيله على صندوق طرفي ببضع واط، لكن دقته غالبًا ما تكون أقل. عند الموازنة النهائية، نجد أن النموذج الكبير على السحابة يتمتع بقوة حوسبة وفيرة لكنه يعاني من زمن استجابة مرتفع، بينما النموذج الصغير الطرفي يتمتع بزمن استجابة منخفض لكن دقته أقل. الفجوة في الدقة بينهما هي ما يسعى التقطير المعرفي إلى سدّه — ليس عبر استبدال عتاد أكبر، بل عبر تعليم النموذج الكبير للنموذج الصغير "كيف يحكم".

قد يبدو الأمر وكأنه "نقل خبرة"، لكنه هندسيًا يعتمد على دالة خسارة قابلة للحساب وشروط حدية. لقد تحققت كيلود للصناعات الثقيلة مرارًا في نشر الاستدلال الطرفي من أمر واحد: نجاح التقطير يعتمد أولًا على وضوح الشروط الحدية، وليس على حفظ الصيغ. لنبدأ من الشروط الحدية ونحسب الأمر بدقة.

متى يستحق التقطير المعرفي؟ أربعة شروط حدية يجب حسابها أولًا

الشرط الحدّي الأول: يجب أن يكون نموذج المعلم قد حقق الدقة المطلوبة. التقطير المعرفي هو نقل معرفة، وليس إصلاح نموذج. إذا كانت دقة نموذج المعلم نفسه غير مقبولة، فإن التقطير سينقل أخطاءه كما هي إلى النموذج الصغير، بل وقد تتضخم الأخطاء بسبب السعة الأصغر للنموذج الصغير. مبدأ كيلود للصناعات الثقيلة في النشر الطرفي هو: تدريب النموذج الكبير على الخادم حتى يحقق معايير القبول أولًا، ثم التفكير في الضغط.

الشرط الحدّي الثاني: يجب أن يكون هدف النشر واضحًا. إذا كان موقع النشر النهائي هو صندوق طرفي بمتطلبات استجابة بمستوى الميلي ثانية واستهلاك طاقة ببضع واط فقط، فإن ضغط النموذج الكبير يحقق فائدة واضحة؛ أما إذا كان النموذج يعمل أصلًا على مجموعة خوادم ولا يهتم بزمن الاستجابة، فإن التقطير يفتقر إلى الدافع. تحدد ميزانية قوة الحوسبة الحد الأقصى للنموذج الطالب، وتحدد أيضًا ما إذا كان الأمر يستحق العناء.

الشرط الحدّي الثالث: يجب أن يكون توزيع بيانات التدريب وبيانات النشر متسقًا. النموذج الطالب الناتج عن التقطير أصغر سعة وأضعف في التعميم، وأكثر حساسية لانحراف البيانات. كلما زاد الاختلاف بين مجموعة التدريب وظروف التشغيل الفعلية، زاد فقدان الدقة في النموذج الصغير. الشرط الحدّي الرابع: يجب أن يكون هناك توقع كمي لفقدان الدقة المقبول — التقطير يؤدي دائمًا تقريبًا إلى انخفاض طفيف في الدقة، والمفتاح هو ما إذا كان هذا الانخفاض ضمن النطاق المسموح به في المشروع، مع اعتماد التحقق وفقًا لظروف التشغيل الفعلية.

→ اسحب الجدول يميناً ويساراً ←
معامل المعنى القيمة النموذجية تأثير علىالتقطيرالتأثير على
المعلمعدد معلمات النموذجحجم النموذج الكبير السحابيمئات الملايين(حسب المشروع)كلما زاد، زاد الإفراطمعاملالتشبع,مساحة الضغط أكبر
الطالبعدد معلمات النموذجحجم النموذج الصغير الطرفيملايين قليلةيحدد الطرفيزمن الاستجابةواستهلاك الطاقة
درجة الحرارةمعامل Tالتليينsoftmaxمقياس4~8(يتطلب ضبطًا للمهمة)كلما زادت، كان التوزيع أنعم、المعرفة الضمنية أكثر
وزن الخسارة αنسبة الخسارة الناعمة إلى الخسارة الصلبة0.5~0.9موازنة العلاقات بين الفئات والملصقات الحقيقية
بيانات التدريبالكميةحجم العينات الموسومةوالمعلممجموعة التدريبنفس التوزيعانحراف البيانات يضخمفقدان الدقة
زمن الاستدلالالهدفمرة واحدة طرفيًاوقت الاستدلالبالميلي ثانية(وفقًا لـظروف التشغيلحسب المشروع)يحدد الطالبحجم النموذجالحد الأعلى
قوة الحوسبةواستهلاك الطاقةالميزانيةالموارد المتاحة طرفيًابضعة واط~عشرات الواطيحدد إمكانية نشر الطالب
دقةالهدف المحتفظ بهالانخفاض المقبول نسبيًا مقارنة بالمعلمحسب الفعليظروف التشغيلقبولحسب المشروعيحددالتقطيرما إذا كان يستحق القيام به

كيف يُحسب فقدان التقطير؟ اشتقاق معادلة تليين درجة الحرارة وتباعد كوالباك-ليبلر

المشكلة الجوهرية التي يعالجها التقطير المعرفي هي جعل توزيع مخرجات النموذج الطالب أقرب ما يمكن إلى توزيع مخرجات النموذج المعلّم. هناك آليتان رئيسيتان هنا: تليين درجة الحرارة وتباعد كوالباك-ليبلر (KL).

الخطوة الأولى هي تليين درجة الحرارة. فدالة softmax العادية تحوّل logits إلى توزيع احتمالي صلب شبيه بالتسميات الجامدة، بينما في التقطير نقسم أولاً على معامل درجة حرارة T لتنعيم التوزيع. كلما ارتفعت درجة الحرارة، أصبح التوزيع أكثر استواءً، وظهرت الفروق النسبية بين الفئات بشكل أوضح. يمكن كتابة الاحتمال المُليَّن على النحو التالي:

q_i = exp(z_i / T) / Σ_j exp(z_j / T)

حيث z_i هو مخرج logits الخام للفئة i من النموذج، وT هو معامل درجة الحرارة، وq_i هو الاحتمال المُليَّن.

الخطوة الثانية هي حساب الفرق بين توزيعي الطالب والمعلّم. تستخدم دالة الخسارة تباعد KL (الإنتروبيا النسبية) لقياس مدى الاختلاف بين توزيعين احتماليين، وتُكتب خسارة التقطير الناعمة على أنها T² مضروباً في تباعد KL، والضرب في T² يعوّض تأثير مقياس درجة الحرارة على التدرج. الخسارة الكلية النهائية هي مجموع مرجّح للخسارة الناعمة والخسارة الصلبة:

L = α · T² · KL(q_teacher ‖ q_student) + (1 − α) · CE(y_true, p_student)

حيث α هو وزن الخسارة الناعمة، وCE هي خسارة الإنتروبيا المتقاطعة مع التسميات الحقيقية، وp_student هو مخرجات النموذج الطالب القياسية عند درجة حرارة T تساوي 1.

لماذا نحتفظ ببند التسميات الصلبة؟ لأن التسميات الناعمة تعلّم العلاقات بين الفئات، بينما تضمن التسميات الصلبة ألا ينحرف الطالب عن الإجابة الصحيحة. كلاهما ضروري، وعادةً ما تُؤخذ قيمة α بين 0.5 و0.9، وتُضبط تجريبياً.

مثال تحقّق عملي لكشف العيوب في الرافعات: من مئات الملايين من المعاملات إلى ملايين قليلة

لنربط المعادلات أعلاه بسيناريو واقعي. لنفترض أن مصنعاً يريد إجراء فحص عبر الإنترنت للعيوب السطحية في الحبال السلكية: النموذج المعلّم هو شبكة كبيرة تُدرَّب على خادم، ويبلغ عدد معاملاتها مئات الملايين، وبيانات التدريب مستمدة من مكتبة صور العيوب المتراكمة في الموقع على مدى طويل — وهذا النوع من البيانات في هذه الصناعة يتطلب عادةً عشرات إلى مئات الآلاف من الصور، ونظام التعليق التوضيحي للعيوب في كيلود للصناعات الثقيلة يراكم هذه العينات باستمرار. بعد أن يحقق النموذج المعلّم الدقة المطلوبة على الخادم، يُقطَّر إلى نموذج طالب بعدة ملايين من المعاملات، ويُثبَّت على حافة الحوسبة الطرفية (Edge Box) لفحص الحبل السلكي إطاراً بإطار أثناء التشغيل.

السؤال الجوهري في مثال التحقق هذا واحد فقط: بعد كل هذا الضغط، هل تبقى الدقة مقبولة؟ لا يوجد رقم ثابت ينطبق على جميع الحالات — ففقدان الدقة النسبي بعد التقطير يعتمد على درجة التكرار في النموذج المعلّم، ودرجة الحرارة T، وحجم البيانات، وغيرها من المتغيرات، ويجب قياسه فعلياً وفق ظروف التشغيل الحقيقية. لكن هناك قاعدة هندسية مستقرة نسبياً: كلما كان النموذج المعلّم أكبر وأكثر فرطاً في parametrization، زادت مساحة الضغط الممكنة، وارتفعت نسبة الدقة المحتفظ بها بعد التقطير.

→ اسحب الجدول يميناً ويساراً ←
مؤشر نموذج المعلم نموذج الطالب(التقطيربعد) ملاحظة
عدد المعلماتمئات الملايينملايين قليلةضغط بمقدار مرتبة واحدة تقريبًا
مرة واحدة طرفيًازمن الاستدلالخادمعشرات الميلي ثانيةبالميلي ثانية طرفيًاحسب الفعليظروف التشغيلحسب القياس الفعلي
موقع النشرالسحابة/خادمصندوق الحافة/مدمجالبيانات لاالمصنع、استجابة أسرع
نسبيًادقةالمرجع(يُسجل كـ100%)الاحتفاظ بمعظمالانخفاض المحدد حسب القياس الفعلي
استهلاك الطاقةخادممئات الملايينبضعة واط~أكثر من عشرة واطمنخفض طرفيًااستهلاك الطاقةالتشغيل

من النتائج، نجد أن نموذج الطالب حقق ضغطًا في عدد المعلمات يقارب مرتبة كاملة من الحجم، حيث انخفض زمن الاستدلال من عشرات المللي ثانية على مستوى الخادم إلى مستوى المللي ثانية على الطرف، وانخفض استهلاك الطاقة إلى بضعة واطات أو نحو عشرة واطات. هذه المكاسب تقابل المراحل الحساسة للاستجابة الفورية مثل التقاط وتحديد المواقع والفحص عبر الإنترنت. في حلول النشر الطرفي، تعتمد كيلود للصناعات الثقيلة هذه النماذج المصغّرة بعد التقطيع كوحدات استدلال رئيسية، بينما تبقى النماذج الكبيرة في جانب التدريب أو كمراجعة احتياطية.

من الضروري التأكيد على الحدود: مخرجات نماذج الفحص الطرفية هذه يجب أن تتصل في النهاية بمنطق مراقبة السلامة والقفل المتشابك للرافعة، ويجب أن تفي حدود النشر بمتطلبات جمع البيانات والاستجابة الفورية وفقًا لمعيار GB/T 28264 — نظام مراقبة وإدارة السلامة لآلات الرفع، كما يجب أن تعود أحكام الحمولة وظروف التشغيل المتعلقة بالنموذج إلى إطار ظروف التشغيل المحدد في معيار FEM 1.001 — مواصفة تصميم الرافعات. التقطير المعرفي لا يغيّر حدود السلامة هذه، بل يغيّر فقط حجم النموذج وسرعته.

أربعة أخطاء شائعة تجعل التقطير بلا جدوى غالبًا

الخطأ الأول: التقطير قبل تدريب النموذج المعلم جيدًا. مدخلات رديئة تعني مخرجات رديئة، فالتقطير يضخّم انحرافات المعلم الموجودة بدلًا من معالجتها.

الخطأ الثاني: ضبط درجة الحرارة T بشكل خاطئ. إذا كانت T منخفضة جدًا، تتحول التسميات اللينة إلى تسميات صلبة ويفقد المعرفة الضمنية؛ وإذا كانت مرتفعة جدًا، يصبح التوزيع لينًا جدًا ولا يتعلم الطالب القدرة التمييزية. يجب ضبط درجة الحرارة لكل مهمة على حدة، وليس نسخ قيمة ثابتة.

الخطأ الثالث: تعلم التسميات اللينة فقط والتخلي عن التسميات الصلبة. التسميات اللينة تعلّم العلاقات، والتسميات الصلبة تضمن الصحة، وكلاهما ضروري، ويتم موازنتهما عبر معامل الخسارة α.

الخطأ الرابع: تجاهل انحراف توزيع البيانات. نموذج الطالب صغير السعة وضعيف التعميم، وإذا حدث تباين بين بيانات التدريب وظروف التشغيل الفعلية، يتضخم فقدان الدقة. يجب إجراء التحقق من توزيع البيانات قبل التقطير وبعده.

ضغط دقة النموذج الكبير في نموذج صغير هو في جوهره مقايضة قابلة للحساب بين ثلاثة متغيرات: الدقة، وزمن الاستجابة، واستهلاك الطاقة. في نشر الذكاء الاصطناعي الطرفي، تعتمد كيلود للصناعات الثقيلة التقطير المعرفي كوسيلة مهمة لنقل قدرات النموذج الثقيل إلى الحواف الطرفية، مع دمج مراحل سابقة مثل تنظيف البيانات والتعلم شبه الخاضع للإشراف، لتمكين الرافعة من إتمام الفحص والإنذار المبكر في موقع قريب من الميدان بدلًا من انتظار السحابة في كل مرة. الشرط الأساسي يبقى دائمًا: حساب الشروط الحدودية بدقة أولًا، وفقدان الدقة يُقبل وفقًا للقياس الفعلي.

📖 قراءات ذات صلة:تشغيل نماذج الذكاء الاصطناعي على طرف الرافعة: كيف نوازن بين الدقة وتكلفة قوة الحوسبة؟ | ما الذي يمكن للنماذج الكبيرة تحقيقه فعليًا في صيانة الرافعات؟

الأسئلة الشائعة

س: هل يظل النموذج المصغّر بعد التقطير منشورًا على الطرف متوافقًا مع متطلبات الاستجابة الفورية لمراقبة سلامة الرافعة؟

ج: التقطير المعرفي يغيّر حجم النموذج وسرعة الاستدلال فقط، ولا يغيّر حدود وظيفة السلامة في النظام. بالاستناد إلى متطلبات جمع البيانات والاستجابة الفورية في معيار GB/T 28264 لنظام مراقبة وإدارة السلامة لآلات الرفع، طالما أن زمن الاستدلال والدقة بعد التقطير يحققان معايير القبول الهندسية، ويظل مخرج النموذج متصلًا بمسارات القفل المتشابك والمراجعة اليدوية الأصلية، يمكن النشر. تلتزم كيلود للصناعات الثقيلة دائمًا بهذه النقطة في حلولها الطرفية: يجب التحقق من المؤشرات المحددة بندًا بندًا وفقًا لظروف التشغيل الفعلية عند قبول المشروع، ولا يجوز تخطي التحقق من السلامة لمجرد أن النموذج أصغر.

س: متى لا يستحق التقطير المعرفي القيام به، وكيف نحكم على ما إذا كان المشروع مناسبًا له؟

ج: انظر إلى ثلاث إشارات. الإشارة الأولى: دقة النموذج المعلم نفسه غير مرضية، وسينقل التقطير الخطأ إلى النموذج الصغير. الإشارة الثانية: تباين كبير بين توزيع بيانات التدريب وظروف التشغيل الفعلية، فالنموذج الصغير أضعف في التعميم وأكثر وضوحًا في الانحراف. الإشارة الثالثة: ميزانية قوة الحوسبة الطرفية قادرة أصلًا على تشغيل النموذج الكبير، فلا تتحقق فائدة توفير قوة الحوسبة. إذا ظهرت أي من هذه الإشارات الثلاث، يجب معالجة مشكلتي البيانات والنموذج المعلم أولًا قبل الحديث عن التقطير.

س: لماذا يكون تعلم النموذج الصغير من التسميات اللينة للنموذج الكبير أدق من تعلم التسميات الصلبة مباشرة؟

ج: لأن مخرجات softmax للنموذج الكبير لا تحدد الإجابة فحسب، بل تعطي أيضًا توزيع الاحتمالات الذي يوضح مدى تشابه هذه الإجابة مع الإجابات الأخرى، وهذا هو المعرفة الضمنية. على سبيل المثال، في صورة اهتراء، قد يخرج النموذج المعلم اهتراء 0.7، تآكل 0.2، طبيعي 0.1، وعندما يتعلم الطالب هذا التوزيع، يكتسب معرفة إضافية بأن الاهتراء والتآكل متقاربان في الخصائص. هذا يحمل معلومات أكثر بكثير من مجرد حفظ تسمية صلبة واحدة، وهذا هو السبب الجذري لقدرة التقطير على الحفاظ على الدقة.

مقالات ذات صلة

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP