تقرير تقييم LLM

النموذجالتاريخإجمالي وقت الاستجابة (ث)الاختبارات الناجحةمتوسط CodeBLEU (0-1)متوسط درجة الفائدة (0-4)متوسط درجة الصحة الوظيفية (0-4)

gpt-4o-mini

2024-10-15

288.593

113

0.336386

3.65854

3.62805

gemini-1.5-pro

2024-10-15

691.622

104

0.342204

3.47561

3.40854

claude-3-5-sonnet-20240620

2024-10-15

369.063

113

0.303837

3.67683

3.59146

gpt-4o

2024-10-15

323.43

127

0.319079

3.73171

3.60976

claude-3-opus-20240229

2024-10-15

1069.89

107

0.307076

3.68902

3.60976

إجمالي وقت الاستجابة (ث): الوقت الإجمالي الذي استغرقه النموذج لتوليد جميع المخرجات.

الاختبارات الناجحة: عدد اختبارات الوحدة التي اجتازها النموذج خلال التقييم، من إجمالي 164 اختبارًا.

متوسط CodeBLEU: متوسط درجة CodeBLEU، وهو مقياس لتقييم جودة توليد الكود بناءً على كل من الصحة النحوية والدلالية.

متوسط درجة الفائدة: متوسط تقييم فائدة مخرجات النموذج كما تم تقييمه بواسطة نموذج LLM.

  • 0: المقتطف غير مفيد على الإطلاق، فهو غير ذي صلة بالمشكلة.

  • 1: المقتطف مفيد قليلاً، يحتوي على معلومات ذات صلة بالمشكلة، ولكن من الأسهل كتابة الحل من الصفر.

  • 2: المقتطف مفيد إلى حد ما، يتطلب تغييرات كبيرة (مقارنة بحجم المقتطف)، ولكنه لا يزال مفيدًا.

  • 3: المقتطف مفيد، ولكنه يحتاج إلى تغييرات طفيفة لحل المشكلة.

  • 4: المقتطف مفيد جدًا، فهو يحل المشكلة.

متوسط درجة الصحة الوظيفية: متوسط درجة الصحة الوظيفية لمخرجات النموذج، يقيم مدى توافق المخرجات مع المتطلبات الوظيفية، كما تم تقييمه بواسطة نموذج LLM.

  • 0 (يفشل في جميع الاختبارات الممكنة): المقتطف البرمجي غير صحيح تمامًا ولا معنى له.

  • 4 (ينجح في جميع الاختبارات الممكنة): المقتطف البرمجي صحيح تمامًا ويمكنه التعامل مع جميع الحالات.

Last updated