تقرير تقييم LLM
إجمالي وقت الاستجابة (ث): الوقت الإجمالي الذي استغرقه النموذج لتوليد جميع المخرجات.
الاختبارات الناجحة: عدد اختبارات الوحدة التي اجتازها النموذج خلال التقييم، من إجمالي 164 اختبارًا.
متوسط CodeBLEU: متوسط درجة CodeBLEU، وهو مقياس لتقييم جودة توليد الكود بناءً على كل من الصحة النحوية والدلالية.
متوسط درجة الفائدة: متوسط تقييم فائدة مخرجات النموذج كما تم تقييمها بواسطة نموذج LLM.
0: المقتطف غير مفيد على الإطلاق، فهو غير ذي صلة بالمشكلة.
1: المقتطف مفيد قليلاً، يحتوي على معلومات ذات صلة بالمشكلة، ولكن من الأسهل كتابة الحل من الصفر.
2: المقتطف مفيد إلى حد ما، يتطلب تغييرات كبيرة (مقارنة بحجم المقتطف)، ولكنه لا يزال مفيدًا.
3: المقتطف مفيد، ولكنه يحتاج إلى تغييرات طفيفة لحل المشكلة.
4: المقتطف مفيد جدًا، فهو يحل المشكلة.
متوسط درجة الصحة الوظيفية: متوسط درجة الصحة الوظيفية لمخرجات النموذج، يقيم مدى توافق المخرجات مع المتطلبات الوظيفية، كما تم تقييمه بواسطة نموذج LLM.
0 (يفشل في جميع الاختبارات الممكنة): المقتطف البرمجي غير صحيح تمامًا وغير ذي معنى.
4 (ينجح في جميع الاختبارات الممكنة): المقتطف البرمجي صحيح تمامًا ويمكنه التعامل مع جميع الحالات.
Last updated