استخدم إطار عمل MLX عبر Ollama على ماك. يتطلب نموذج qwen38-deep ذاكرة عشوائية 21 جيجابايت لسياق 32 ألف توكن. قم بإعداد أسماء مستعارة وفحص ذاكرة التخزين المؤقت KV لمنع تفريغ النموذج تلقائيًا.
إعداد الجهاز والتثبيت عبر الطرفية
اخترت تثبيت Qwen3 على ماك عبر Ollama لأنه الأداة التي تدعم بشكل أفضل إطار عمل MLX الخاص بأبل في الوقت الحالي. الخطوة الأولى هي تثبيت Ollama ثم سحب النموذج qwen38-chat لتجربته بأوامر أساسية. من فحوصات نظامي، وجد أن إصدار API لهذا النموذج يستجيب بشكل جيد بحالة 200، مما يؤكد أن الاتصال بين الجهاز المحلي والنموذج يعمل بشكل مثالي. لأولئك الذين يريدون قدرات استنتاجية أعمق، أنصح بسحب نموذج qwen38-deep الذي يستخدم موارد أكثر لكنه يقدم نتائج أدقة للمهام التقنية. استخدام الطرفية يتيح لنا رؤية سجلات التشغيل بوضوح وتصحيح الأخطاء بسهولة أكبر من بعض واجهات المستخدم الرسومية التي تخفي هذه التفاصيل. يمكنك التحميل والتثبيت من الموقع الرسمي.
إدارة ذاكرة VRAM ونافذة السياق بما يناسب المهمة
إدارة الذاكرة على ماك الذي يستخدم نظام الذاكرة الموحدة أمر يتطلب اهتمامًا كبيرًا، لأننا نشارك الذاكرة بين المعالج والوحدة الرسومية. من بيانات اختباراتى، حجم ملفات الأوزان لنموذج qwen38-deep يبلغ 18 جيجابايت، وهو كبير نسبيًا. لكن عندما حاولت حجز نافذة سياق بأقصى حد عند 32 ألف توكن لاستخدام مستندات كبيرة، وجدت أن إجمالي الذاكرة المستخدمة فعليًا يرتفع إلى 21 جيجابايت. الجزء الإضافي هو ذاكرة التخزين المؤقت KV بحجم حوالي 3 جيجابايت لتخزين بيانات الحساب أثناء المحادثة. إذا كان لديك ماك بذاكرة عشوائية 16 جيجابايت، فقد تحتاج إلى تقليل طول السياق إلى 16 ألف أو 8 آلاف توكن لإبقاء الجهاز يعمل بسلاسة دون تبديل البيانات إلى SSD، مما سيؤدي إلى انخفاض ملحوظ في سرعة توليد التوكنات.
اختبار حقيقي على جهازنا
قمت بإجراء اختبارات مكثفة على Mac Mini M4 Pro في 2 سبتمبر 2026 لفحص حدود نموذج qwen38-deep32k-test بإعداد نافذة سياق تصل إلى 32 ألف توكن واستخدام ذاكرة تخزين مؤقت KV بحجم 3 جيجابايت. قمت بتغذية النموذج بـ 20049 توكن من البيانات، وهو مقدار كبير نسبيًا. تبين أن النموذج استطاع المعالجة بنجاح واستخدم الذاكرة بدقة عند 21 جيجابايت كما كان محسوبًا. لكن الدرس المهم من الفشل الذي واجهته هو أن سكريبت predictive.sh الخاص بي قام بتفريغ هذا النموذج تلقائيًا لأنه لم يجد أي مسار إنتاجي يستدعي هذا النموذج مباشرة في ذلك الوقت، مما أدى إلى فقدان وقت إعادة تحميل النموذج عند ورود الأوامر. كما وجدت تحذيرًا من نظام LiteLLM حول فشل تحليل معاملات استدعاء الأدوات، مما يشير إلى أن إعداد أدوات النظام لا يزال يحتاج إلى بعض الضبط لدعم الأوامر المعقدة.
اختبار قدرات اللغة التايلاندية والرؤية
بالإضافة إلى محادثات النص، قمت أيضًا باختبار قدرات الرؤية وفهم اللغة التايلاندية في Qwen3. بشكل خاص، استخدمت مجموعة اختبار Thai 5-key مع نموذج qwen38-chat ووجدت أن النموذج يستطيع الاستجابة وفهم السياق التايلاندي بشكل جيد جدًا، مع إرجاع قيمة HTTP 200 بنجاح. فيما يتعلق بالتضمينات (Embeddings)، اختبرت كلًا من nomic-embed-text بحجم 768 وembed-bge بحجم 1024، ووجدت أن كليهما لا يزال يستخدم بادئة ollama/، مما يتطلب الحذر عند الاستدعاء عبر API. بالنسبة لميزة الرؤية، قمت بدمج نموذج qwen38-fast بحجم 18 جيجابايت (MLX) مع qwen2.5vl بحجم 7.3 جيجابايت (GGUF) لتمكين معالجة الصور في سير عمل واحد. اختبار مسارات رؤية الدخان باستخدام ملف PNG بحجم بكسل واحد عبر النظام نجح، مما يظهر أن دمج إطارات عمل مختلفة مثل MLX وGGUF على ماك ممكن ويحافظ على الاستقرار، رغم أنه يتطلب مساحة تخزين إضافية على جهاز التخزين الشخصي.
للمتابعة مع أعمال مختبرية مثل هذه، تابع LINE @icafefx أو حمّل الأدوات مجانًا من redhatai.net