التنقل الرئيسي

التقييمات: من تجارب الذكاء الاصطناعي إلى الإنتاج بثقة

تعرّف على كيفية سدّ التقييم للفجوة بين تجارب الذكاء الاصطناعي والنشر الموثوق والجاهز للإنتاج.

الملخص التنفيذي

  • رغم تحسّن النماذج الأساسية، فإن التحول الحقيقي الذي أتاح استخدامها بثقة في بيئات الإنتاج جاء من ممارسات التقييم المنضبطة.

  • تساعد التقييمات المصممة جيدًا مديري المنتجات ومسؤولي حوكمة الذكاء الاصطناعي ومديري التقنية على نشر وكلاء الذكاء الاصطناعي بأمان وعلى نطاق واسع، وتحويله من أداة معزولة للتجربة إلى ميزة تنافسية.

  • تنبع هذه الثقة من تقييم سلوك وكيل الذكاء الاصطناعي استنادًا إلى استفسارات المستخدمين الحقيقية والحالات الحدّية والسيناريوهات المتخصصة التي تعكس سياق عملك الفعلي، لا من معيار عام يعلن أن «هذا النموذج هو الأفضل».

  • الهدف هو تبرير هذه الثقة بنتائج قابلة للقياس. يعني النجاح تعريف ما هو "جيد" بعبارات محددة وقابلة للقياس ومتوافقة مع احتياجات عملك وقدرتك على تحمّل المخاطر، سواء تعلق ذلك بدقة الحقائق أو ملاءمة النبرة أو السرعة أو كفاءة التكلفة.

  • ومن خلال دمج التقييم في النظام بأكمله، بما يشمل القياس والتسجيل واختبارات A/B وضوابط الحماية، والموازنة بين الدقة والكفاءة، تستطيع الفرق زيادة سرعة النشر ومتانته.

ترتاح معظم الشركات إلى تجربة موظفيها ChatGPT أو Gemini. لكن استخدام النماذج اللغوية الكبيرة (LLM) في مسارات العمل أو البيئات الحساسة لا يزال أقل شيوعًا.

وغالبًا ما كانت أسباب ذلك وجيهة؛ إذ تفاوتت الجودة، وفاقت مخاطر الهلوسة أو السلوك غير المرغوب فيه الفوائد المحتملة للتقنية.

لكن التوازن بين المخاطر والمكاسب تغيّر بوضوح خلال العام الماضي. يمكن عزو بعض ذلك إلى تحسّن أداء النماذج الأساسية، لكن قدرًا كبيرًا منه يعود إلى تزايد الانضباط في التقييمات. تمنحنا التقييمات نحن وعملاءنا الثقة لنشر وكلاء واسعَي النطاق وموجّهين للعملاء في غضون أسابيع.

يشرح هذا الدليل أسس التقييمات وكيفية تصميمها وتنفيذها وتشغيلها لحالات الاستخدام الإنتاجية.

أسس التقييمات (1): كيف يبدو النجاح؟

ليس هدف التقييم العثور على نموذج مثالي، بل بناء ثقة مبررة بأن نموذجك يتصرف بما يتوافق مع احتياجات عملك وتوقعات مستخدميك وقدرة مؤسستك على تحمّل المخاطر.

يقوم أي نهج للتقييم على سؤال بسيط: كيف يبدو الأداء «الجيد»؟ يجب أن تكون الإجابة محددة. قد يعني «الجيد» لدى مؤسسة ما دقة الحقائق ضمن حدود صارمة، بينما تعطي أخرى الأولوية للسرعة أو كفاءة التكلفة أو نبرة مميزة. كل قيد تعمل في ظله، بدءًا من البيانات المسموح باستخدامها ووصولًا إلى الالتزامات التنظيمية، يسهم في صياغة هذا التعريف.

والأهم أن يتألف 'الجيد' من عناصر يمكن قياسها فعلًا. إذا كان النجاح يعني تقديم إرشادات مالية مفيدة، فيجب التعبير عن الفائدة بسمات تشمل صحة الحقائق، وإخلاءات المسؤولية الملائمة، والاستدلال المخصص، والحدود الآمنة. بعد تعريف «الجيد» بعبارات قابلة للقياس، يأتي السؤال التالي: كيف ستحلل النتائج وتفسرها؟ العمل بناءً على هذه النتائج هو ما يحوّل التقييم إلى منهج، بدل أن يظل مجرد أحكام تقديرية.

أسس التقييم (2): المدخلات وسلوك النموذج والمقاييس

يقوم كل مسار تقييم على ثلاث ركائز مترابطة:

  1. المدخلات/المعايير: أمثلة واقعية ممثلة لقياس الأداء العام، ومجموعات بيانات داخلية منسقة لاختبار ملاءمة المجال.

  2. سلوك النموذج: كيفية استدعاء النموذج، مثل التوليد المعزز بالاسترجاع والتلخيص واسترجاع المعلومات المنظَّمة واستخدام الأدوات.

  3. المقاييس: كيفية قياس الأداء وتفسيره.

يجب أن تمثّل المدخلات العالم الذي سيواجهه نظامك. تأتي أهم الرؤى من أمثلة حقيقية، مثل استفسارات عملائك أو السيناريوهات المالية أو الحالات الخاصة بقطاعك. ولا يمكنك معرفة ما إذا كان النموذج يفهم حقًا الفروق الدقيقة التي يحتاجها المستخدمون ويلبي حاجة العمل إلا باختباره بهذه الأمثلة.

لا يقل سلوك النموذج أهمية عن النموذج نفسه؛ بما في ذلك صياغة مطالبته، وتنسيق الاسترجاع أو استخدام الأدوات، وكيفية تزويده بالسياق. قد يتصرف نموذجان متطابقان بصورة مختلفة جدًا بحسب طريقة نشرهما. لذلك يجب إدراج هذه الطبقة في تصميم التقييم.

وأخيرًا، تأتي المقاييس. نادرًا ما تروي الأرقام وحدها القصة كاملة، لكن المقاييس المختارة جيدًا تجعل سلوك النظام قابلًا للتفسير. يشكّل زمن الاستجابة والدقة والسلامة والاتساق والتحيز والتكلفة ورضا المستخدم، مجتمعةً، صورة متعددة الأبعاد للنظام في بيئة الإنتاج. تكمن المهارة في اختيار مقاييس تتوافق مع مؤشرات الأداء الرئيسية لمشروعك أو عملك، وتبرز الصفات الأهم لمستخدميك. غالبًا ما تكون المقاييس الأبسط أدق وأقل تكلفة، بينما قد تضلل الخيارات السيئة الفرق. إليك طريقة التفكير في اختيار المقاييس:

أمثلة على اختيارات جيدة للمقاييس:

  • روبوت محادثة لخدمة العملاء: معدل الحل من أول تواصل (هل حُلّت مشكلة المستخدم من دون تصعيد؟)، ومتوسط وقت المعالجة، ودرجة رضا المستخدم، ومعدل التصعيد إلى الموظفين.

  • أداة للبحث المالي: دقة الاستشهادات (نسبة الادعاءات الموثقة جيدًا)، ودقة الحقائق مقارنة بالمرجع الصحيح، وملاءمة الاسترجاع (هل وجدت المستندات الصحيحة؟)، واتساق الاستدلال بتقييم خبراء المجال.

  • مساعد لتوليد التعليمات البرمجية: صحة البنية، ومعدل اجتياز الاختبارات، وعدد الثغرات الأمنية، والوقت اللازم للوصول إلى حل عامل.

أمثلة على اختيارات سيئة للمقاييس:

  • استخدام طول الإجابة وحده مؤشرًا للجودة (الأطول ≠ الأفضل).

  • قياس السرعة من دون مراعاة أثرها في الدقة.

  • تتبّع درجات ثقة النموذج من دون التحقق منها مقابل الصحة الفعلية.

  • الاعتماد فقط على حيرة النموذج الداخلية من دون تحقق يركّز على المستخدم.

أخطاء شائعة في المقاييس ينبغي تجنبها:

  • المقاييس المتعارضة: تحسين السرعة والشمول في آن واحد من دون الإقرار بالمفاضلة بينهما.

  • الإفراط في المواءمة مع المعايير: تحقيق 95% في مجموعة الاختبار ثم الإخفاق في الإنتاج لأن المستخدمين الحقيقيين يتصرفون بصورة مختلفة.

كانت الدقة أولوية قصوى لدى أحد عملائنا في الخدمات المالية شديدة التنظيم، ضمن حل البحث التفصيلي الخاص به. أنشأنا مجموعات بيانات للأسئلة والأجوبة أعدّها خبراء، ودمجناها مع مجموعات مولّدة بالأدوات، لقياس الدقة وقدرة النظام على اختيار الأدوات واسترجاع المعلومات الصحيحة، والحصول على رؤية متوازنة لدقة النتائج وجودة الاستدلال. كان الأساس قياس أبعاد متعددة: دقة الحقائق (تحقق الخبراء)، وجودة الاسترجاع (الدقة والاستدعاء للمستندات ذات الصلة)، واتساق الاستدلال (تقييم منظَّم للتسلسل المنطقي).

متى تستخدم نموذجًا لغويًا كبيرًا حكمًا على الجودة الدقيقة؟

يستخدم أسلوب «النموذج اللغوي الكبير حكمًا» نموذج ذكاء اصطناعي ثانيًا مقيّمًا، مستبدلًا بالمراجعة البشرية تقييمًا آليًا للجودة قابلًا للتوسع. كثيرًا ما يُساء استخدام هذا الأسلوب حين تكفي مقاييس أبسط لتوفير الدقة المطلوبة. قد يفيد عندما تعجز الفحوص الحتمية عن قياس الجودة، مثل المقاييس الدلالية التي تشمل الفائدة والاستناد إلى المصادر وجودة الاستدلال والنبرة وتفسير السياسات. قد تحتاج إلى ملاحظات قابلة للتوسع عبر بدائل كثيرة من المطالبات والنماذج، وإلى تحديد سلّم تقييم واضح ومخطط مخرجات منظَّم. للاستفادة منه، اتبع الخطوات التالية:

  • حدّد أبعاد سلّم التقييم بوضوح: الصحة، والاستناد إلى المصادر، والامتثال للسياسات، وقابلية التنفيذ، والنبرة.

  • استخدم مخرجات منظَّمة (مخطط JSON) لإجابات الحَكَم.

  • سجّل درجات الاجتياز الثنائية والنص التشخيصي لتحليل الإخفاقات.

  • عاير مخرجات الحَكَم مقابل عينات صنّفها البشر في كل دورة إصدار.

  • استخدم حَكمين أو نفّذ فحوص توافق دورية في المجالات الحساسة.

  • تتبّع انحراف الحَكَم ومعدل الاختلاف بمرور الوقت.

لا تَتِه في المعايير

مجموعة بيانات المعيار هي مجموعة ثابتة ومنسقة من أمثلة الاختبار ذات إجابات معروفة، تُستخدم لتقييم النماذج باتساق ومقارنة نتائج الإصدارات بإنصاف. وتشمل عادةً مدخلات مثل استفسارات المستخدمين، ومخرجات متوقعة أو أحكامًا مرجعية، ومعايير أو تسميات للتقييم. تُستخدم اختبارات المعايير العامة لمقارنة أداء أحدث النماذج، وقد تفيد مرجعًا أوليًا عند تصميم نظامك وتحديد النماذج المرشحة للاستخدام.

لكن لا يمكنك الاعتماد عليها مؤشرًا لأداء نظامك في سياق عملك، لما تنطوي عليه هذه المعايير من مشكلات معروفة:

  • التلوث: ربما تكون النماذج قد تدرّبت على بيانات المعيار؛ لذا قد يشبه تقييمها بالمجموعة نفسها تصحيح اختبار باستخدام ورقة غش.

  • التشبع: تحقق أفضل النماذج بالفعل أقصى الدرجات، لذلك يقتصر التحسن أو التراجع على نقاط مئوية قليلة، وغالبًا يقع ضمن التباين الطبيعي لنتائج الاختبار.

  • ضيق النطاق: لا تعكس بيانات المعايير مهامك الفعلية، فهي منتقاة ومنقحة بدرجة كبيرة. بل إن بعضها مولّد بواسطة النماذج اللغوية الكبيرة (LLM)، فلا يعكس التعقيد والحالات الحدّية في بياناتك، مثل الأخطاء المطبعية والتعبيرات غير المألوفة والصور المشوشة.

مثال: معلّم رياضيات بالذكاء الاصطناعي يساعد الطلاب

يطلب طالب من التطبيق مساعدته في حل المسائل الكلامية.

مثال على معيار عام يمكنك استخدامه: GSM8K (الاستدلال الرياضي للمرحلة الابتدائية).

  • مجموعة أصعب اختيارية: MATH.

لماذا يفيد هذا المعيار؟

  • يتيح المقارنة السريعة لمعرفة النموذج الأفضل في الاستدلال الرياضي العام.

  • وهو مرشح أولي جيد قبل الاستثمار في تقييمات كاملة للمنتج.

لماذا تظل بحاجة إلى مجموعة بياناتك الخاصة؟

لتطبيقك متطلبات لا يختبرها GSM8K:

  • صياغة منهجك وترتيب موضوعاته.

  • أسلوب الشرح الملائم للفئة العمرية.

  • كيفية معالجة أسئلة الطلاب الملتبسة أو كثيرة الأخطاء المطبعية.

  • قواعد السياسات، مثل توقيت تقديم التلميحات بدل الإجابات الكاملة.

يعتمد التحقق الفعّال على إنشاء معايير تقييم خاصة بتطبيقك. يجب أن تستند مجموعات البيانات هذه إلى تفاعلات حقيقية وحالات حدّية شائعة وأنماط إخفاق محتملة. قد تكون هذه المهمة صعبة عند تنفيذ منتج أو عملية جديدة. لكن يمكن غالبًا جمع البيانات من منتج قائم أو في أقرب وقت ممكن، حتى خلال مرحلة الاختبار الأولية. بعد تطوير التطبيق، ينبغي أن تتطور هذه المعايير مع المنتج، فتصبح بمرور الوقت أغنى وأكثر تمثيلًا للواقع.

دراسة حالة: إنشاء معيار مخصص لمساعد مصرفي للأفراد

يجيب روبوت محادثة مصرفي عن أسئلة الميزانيات والإنفاق والمعاملات. لم تستوعب المعايير العامة للأسئلة والأجوبة أو تحويل النص إلى SQL مخاطر مصرفية أساسية، مثل حقن SQL وتسريب البيانات ونقل السياق بين عدة جولات. أنشأنا معيارًا مخصصًا يحاكي مسار وكيل هذا المنتج.

مكونات المعيار المخصص في قاعدة التعليمات البرمجية هذه:

  • حزمة اختبار هجومية من مطالبات ضارة لحقن SQL، واستخراج معلومات التعريف الشخصية (PII)، وتجاوز المطالبة، والتسريب بين الجلسات.

  • لا تسامح في السلامة: يجب رفض أي محاولة لحقن SQL أو استخراج معلومات التعريف الشخصية (PII) أو التسريب بين الجلسات.

  • دقة نقل السياق: يجب أن تحافظ الاستفسارات المعاد صياغتها على قصد المستخدم والكيانات.

الخلاصة: تعامل مع إنشاء المعيار بوصفه ميزة في المنتج. تثبت منظومة التقييم الحالية أن التقييم الشامل مترابط، لكن يجب توسيع التغطية وأحجام العينات لتعكس المخاطر المصرفية الواقعية، مثل الهجمات متعددة المقاصد وتجاوز ضوابط الحماية والاستفسارات المعتمدة على السياق. ينبغي توسيع المعيار بالتوازي مع الوكلاء وضوابط الحماية الجديدة.

التقييمات لإيجاد التوازن الصحيح: تحقيق الأداء المطلوب بأصغر نموذج ممكن

الصلة بين المعيار الخاص بتطبيقك واختيار النموذج بالغة الأهمية. لا يكشف معيارك نجاح الحل فحسب، بل يحدد أيضًا المزيج الأكثر كفاءة من حيث التكلفة بين حجم النموذج وتقنيات ما بعد التدريب لتقديم الأداء المطلوب. لا تأتي أقوى التحسينات للنماذج المدرّبة مسبقًا، أي «PT» في ChatGPT، من إعادة التدريب، بل من أساليب "ما بعد التدريب".

تركّز هذه الأساليب على تشكيل المعلومات المتاحة للنموذج، وكيفية تنظيمها، وطريقة توجيه النموذج وتنسيقه وقت الاستدلال. تشمل تقنيات ما بعد التدريب:

  • المطالبة بسلسلة الاستدلال والتخصيص الديناميكي للحوسبة، أي التفكير أكثر في المسائل الأصعب.

  • الاتساق الذاتي، حيث تُنشأ مخرجات متعددة ثم يُختار أفضلها.

  • بناء السياق وتنسيقه، مثل التوليد المعزز بالاسترجاع (RAG)، والأمثلة قليلة الأمثلة، ومسارات عمل الوكلاء.

  • استخدام الأدوات والوصول إلى المعرفة الخارجية، بما يمكّن النموذج من العمل خارج نطاق معاييره الداخلية.

  • استراتيجيات تمثيل المعرفة وتخزينها، المصممة للاسترجاع الفعّال والاستدلال على البيانات المنظَّمة وغير المنظَّمة.

مع أن تقنيات ما بعد التدريب قد تحسّن أداء النظام كثيرًا، فإنها تنطوي أيضًا على مفاضلات. كل طبقة إضافية من التنسيق أو الاسترجاع أو الاستدلال تزيد تعقيد النظام ووقت الاستدلال وتكلفة التشغيل. لكن عند تطبيق المزيج الصحيح من تقنيات ما بعد التدريب بعناية، يمكن غالبًا الاعتماد على نماذج أصغر وأسرع وأقل تكلفة مع تلبية متطلبات الأداء. فبدل زيادة حجم النموذج، يتحقق الأداء عبر تصميم أفضل للنظام.

يعتمد إيجاد هذا التوازن بطبيعته على كل تطبيق، وينبغي الاستناد إلى تقييماته الخاصة لتحديد المزيج الأمثل من التقنيات. ستتيح لك هذه التقييمات تحديد النقطة التي لا يعود عندها التنسيق الإضافي محققًا لمكاسب مهمة، مما يمكّن الفرق من اختيار الحد الأدنى اللازم من تعقيد ما بعد التدريب لتحقيق الأداء المستهدف.

تحرك بسرعة، لكن قيّم بعناية

ينبغي النظر إلى حل الذكاء الاصطناعي بوصفه نظامًا كاملًا يشمل قواعد البيانات وواجهات API وواجهات المستخدم وطبقات التنسيق وبنية المراقبة وغيرها. لذلك يجب أن يشمل التقييم جميع طبقات المنظومة التقنية. راقب الأجزاء الرئيسية من النظام للإبقاء على وضوح المشكلات المحتملة وتسريع التطوير بمسؤولية.

تعني مراقبة الأجزاء الرئيسية من النظام ما يلي:

  • تجهيز مسارات المعالجة لقياس النتائج.

  • تسجيل التجارب حتى تتمكن من رؤية أثر كل تعديل.

  • استخدام مقارنات A/B بسيطة قبل نشر التغييرات الكبيرة لاختبار أي تراجع محتمل.

يختصر التحسين القائم على البيانات المسافة من النموذج الأولي إلى الإنتاج من دون نقاط عمياء. التسجيل والمراقبة مهمان أيضًا لفهم الاستخدام الفعلي للتطبيق. إليك مثالًا لضمان قابلية الرصد:

  • الخطوة 1: يدخل طلب المستخدم ومعه request_id وuser_segment وintent.

  • الخطوة 2: يسجل التتبّع إصدار النموذج وإصدار المطالبة ومستندات الاسترجاع واستدعاءات الأدوات.

  • الخطوة 3: يقيّم حَكَم من النماذج اللغوية الكبيرة (LLM) الإجابة وفق الصحة والاستناد إلى المصادر وpolicy_risk.

  • الخطوة 4: يقيّم محرك القواعد الحدود.

  • الخطوة 5: عند تجاوز حد، يُطلق تنبيه ويُحوّل الطلب إلى المسار الاحتياطي أو المراجعة البشرية.

  • الخطوة 6: يُضاف الإخفاق إلى قائمة الفرز، ثم إلى قائمة مهام المعيار.

تتبّع Langfuse لمساعد خاص بسياسة الإرجاع، يعرض مسار الطلب وأدوات الاسترجاع والقواعد وتقييم جودة الإجابة وبوابة الجودة وبيانات التسجيل الوصفية والإجابة المنشأة.

نادرًا ما يتصرف المستخدمون الحقيقيون تمامًا كما يتوقع المصممون. قد يسيء بعضهم فهم التعليمات. وقد يتعمد آخرون اختبار نقاط الضعف. هذه الحالات الحدّية ليست شواذ، بل إشارات قيّمة للغاية. يلتقطها مسار التقييم المنفّذ جيدًا ويحللها ويدمجها في الاختبارات المستقبلية. لا يمكن التكرار السريع من دون نقاط عمياء إلا عندما يكون التقييم مدمجًا في النظام، لا مضافًا إليه بعد التطوير.

نوصي بدمج ضوابط الحماية والمراقبة منذ اليوم الأول:

  • تتبّع مقاييس النموذج وحالات التراجع بانتظام باستخدام معيار خاص بتطبيقك.

  • سجّل الحالات الحدّية أو المدخلات العدائية وراجعها، وأضفها إلى مجموعة بيانات المعيار الخاص بتطبيقك.

  • تأكد من توافق مقاييس التقييم مع مؤشرات الأداء الرئيسية الأساسية.

  • اختبر مجموعة بياناتك ومعيارك بانتظام للتأكد من عدم إغفال مخاطر جديدة أو التأثر بالتحيزات.

  • نفّذ تنبيهات آلية عند تراجع المقاييس (مثل إطلاق مراجعة إذا انخفضت الدقة عن 85%).

  • حافظ على مراجعة بشرية للقرارات الحساسة، مثل الاستشارات القانونية والإرشادات الطبية والمعاملات المالية.

قيّم بمسؤولية: الطاقة والتكلفة والامتثال

كل تشغيل للمعيار يستهلك موارد حوسبة وطاقة. كل تجربة زائدة ترفع التكلفة. ينبغي أن يوازن التقييم المسؤول بين الدقة والكفاءة.

يمكن اتخاذ خطوات عملية لمنع انفلات استهلاك الطاقة والتكاليف:

  • استخدم نماذج أصغر متى أمكن، ونفّذ التجارب الأولية على نماذج أقل تكلفة، ثم توسع فقط بعد التحقق من صلاحية النهج.

  • خزّن المطالبات واستدعاءات API مؤقتًا.

  • استخدم جدولة تراعي الطاقة، مثل المعالجة الدفعية والمثيلات الفورية والأولوية المرنة.

  • تتبّع استخدام موارد الحوسبة بالتوازي مع الأداء.

وابقَ كذلك متيقظًا للوائح الذكاء الاصطناعي الناشئة. حتى في غياب قانون مخصص، تظل الأطر الحالية والخطوات اللازمة واجبة التطبيق، ومنها:

حماية البيانات:

  • تأكد من خلو مجموعات بيانات المعايير من معلومات التعريف الشخصية (PII) ما لم تتوفر موافقة صحيحة.

  • طبّق سياسات للاحتفاظ بالبيانات على الاستفسارات المسجّلة.

  • وفّر آليات لطلبات حذف البيانات.

المساواة والتحيز:

  • اختبر الأداء عبر مختلف الفئات السكانية.

  • احرص على تنوع التمثيل عند إنشاء المعايير.

حقوق الإنسان والشفافية:

  • وثّق قيود النموذج بوضوح للمستخدمين.

  • قدّم تفسيرات للقرارات الحساسة.

  • أتِح الإشراف البشري على التطبيقات الحرجة.

الخلاصة: من التقييم إلى التطور

التقييم ليس حدثًا لمرة واحدة، بل نظام يتطور باستمرار. في مجال سريع التغير، تكمن ميزتك في سرعة الاختبار والتعلم والتكيف، بما يتيح نشر النماذج والحلول الجديدة بفاعلية أكبر.

من خلال جعل التقييم نشاطًا محوريًا في الهندسة وإدارة المنتجات، تستطيع الفرق الابتكار بسرعة وأمان أكبر. ابدأ بتحديد معنى الأداء الجيد في سياق تطبيق الذكاء الاصطناعي، وأنشئ منصة للتقييم وطوّرها حتى تمتلك معيارًا خاصًا بتطبيقك يمنحك الثقة بجاهزيته للإنتاج مع كل تكرار.

المؤلفان

Fatemeh Tahavori وRomain Bourboulou