بعد تشغيل نموذج thai-chat (qwen38) على خوادم فريقنا لفترة، السؤال الذي يجب الإجابة عليه بالأرقام هو: "هل هو جيد بما يكفي لاستبدال z.ai؟" لا يحق للإجابة بدون أرقام أن تُقال. لذا قمنا بإجراء اختبار كامل بـ 50 حالة في 5 فئات، تشغيل النظامين جنبًا إلى جنب، ثم جعل النموذج يقيّم النقاط دون معرفة أي إجابة من أي نظام.

طريقة الاختبار

  • جانب bomLLM: نموذج thai-chat عبر llm.siam2r.com (موجّه LiteLLM على خوادمنا)
  • جانب السحابة: glm-4.5-flash مباشرة عبر واجهة z.ai API (إيقاف التفكير، max_tokens 2000 حسب الميزانية)
  • 5 فئات، 10 حالات لكل فئة: أسئلة وأجوبة LINE باللغة التايلاندية، تلخيص الإشارات (RAGSA)، تصنيف الفئات، الترجمة، وحالات الحافة بتنسيق صارم
  • المقيّم الرئيسي: نموذج qwen38 يقيّم من 1-10 لكل حالة، مع Gemini 2.5 Flash كمقيّم متقاطع (cross-grader) في 18 حالة متبقية من الحصة

النتائج الإجمالية

الفئة bomLLM z.ai النسبة
أسئلة وأجوبة LINE (تايلاندية) 8.93 6.33 1.41
تلخيص الإشارات RAGSA 8.53 5.80 1.47
تصنيف الفئات 1.00 (الدقة) 1.00 تعادل
الترجمة 9.63 8.50 1.13
حالات الحافة (JSON صارم) 8.10 8.47 0.96
إجمالي 50 حالة 7.24 6.02 1.20

الفرق في السرعة أكبر: p50 لـ bomLLM = 5.19 ثانية (p95 = 19.9)، بينما p50 لـ z.ai = 35.1 ثانية (p95 = 85.6) — أسرع حوالي 7 مرات عند القيمة الوسطى، ومعدل خطأ bomLLM بلغ 2/50 حالة (كلاهما كانا بتنسيق صارم تجاوزت مدة تشغيله 30 ثانية).

ما يجب أن نكون صادقين معه

هذا الاختبار له نقاط يجب قراءتها بعناية قبل استخدامه لاتخاذ قرارات كبيرة:

  1. المقيّم والمتسابق من نفس العائلة — qwen38 يقيّم إجابات qwen38، مما يمنحه ميزة. مجموعة فرعية قَيّمتها Gemini نفسها انخفضت إلى نسبة 1.28، والتي لا تزال تفوز، لكن ليس بنفس القسوة مثل 1.44
  2. مطالبات الاختبار قصيرة (~310 رمز) — المهام الحقيقية التي ترسل سياقًا طويلاً لآلاف الرموز هي قصة مختلفة. واجهنا حالة حقيقية حيث جعلت مطالبة بـ 7,000 رمز الخادم المحلي أبطأ من حد EA البالغ 90 ثانية، مما اضطرنا للعودة إلى السحابة (اقرأ مقال مطالبة 6,928 رمز للمزيد)
  3. حالات الحافة هي نقطة ضعف حقيقية — حالات JSON الصارمة والمختلطة لغويًا هي الفئة الوحيدة التي خسرنا فيها (0.96). يجب توجيه المهام ذات التنسيق الثابت إلى نظام احتياطي

الخلاصة لفريقنا

لمهام الدردشة باللغة التايلاندية، تلخيص الإشارات، والترجمة — يفوز bomLLM على خوادمنا بشكل واضح في الجودة والسرعة دون تكلفة لكل رمز. أما للمهام ذات المطالبات الطويلة التي تتجاوز 3-4K رمز أو التنسيق الصارم الذي لا يحتمل الخطأ، فإن الطريق الأكثر أمانًا حاليًا هو السحابة + نظام احتياطي بالتبديل حسب نوع المهمة، وهي البنية التي بنيناها بالفعل على الموجّه.

قرار نقل النظام الفعلي، أنا دائمًا من يقرره — وظيفة الاختبار هي فقط رفع الأرقام الحقيقية للعرض، وليس الضغط على الزر نيابة عني.