Skip to main content
المدونة

النماذج الصغيرة مقابل GPT-4 للشركات السعودية

٢٨‏/٣‏/١٤٤٨ هـ

٩‏/٩‏/٢٠٢٦ م

الاختيار بين النماذج الصغيرة المحلية والواجهات الكبيرة مثل GPT-4 يحدد كلفتك وزمنك وإقامة بياناتك وجودة العربية. وللشركات السعودية الناشئة الإجابة نادرا إما أو. بل موجه هجين يستخدم نماذج محلية رخيصة لثمانين بالمئة من الحركة وكبيرة لعشرين بالمئة التي تحتاج استدلالا.

وهذا هو دليل القرار الكامل بالأرقام والبنية والتشغيل 2026.

1. حساب الكلفة الذي يهم

الواجهات الكبيرة تتقاضى 10 إلى 30 دولارا للمليون توكن لفئة GPT-4 مع رسوم صور وتضمين. وبوت دعم يعالج 100 ألف رسالة شهريا بألفي توكن يكلف 2000 إلى 6000 دولار توكن وحدها. ونماذج 7B إلى 8B مثل علّام 7B أو لاما 8B صفر للتوكن بعد سيرفر GPU بألفين إلى 4 آلاف دولار يعالج 50 طلبا بالثانية. والتعادل لحركة ثابتة غالبا 6 إلى 10 أسابيع.

وقس توزيعك أولا. وسجل التوكن لكل مهمة أسبوعين. فالتصنيف والاستخراج والتلخيص وصياغة الأسئلة غالبا 70 بالمئة من النداءات وتعمل جيدا على صغيرة. والاستدلال المعقد وصياغة العربية والتخطيط متعدد الخطوات 30 بالمئة وتبرر الكبيرة. ووجه حسب التوزيع بدل إرسال كل شيء للغالي.

وخزن بقوة. فتضمينات أعلى 500 سؤال وبادئات أوامر وإجابات سابقة تخفض نداءات الكبيرة 40 بالمئة. وSaaS سعودية خفضت من 4800 إلى 1900 دولار شهريا مع تخزين وتوجيه صغير أولا بدون هبوط رضا.

2. الجودة حسب المهمة بالعربية

لتصنيف اللهجة السعودية مثل كشف نية وش ابغى استرداد يطابق علّام 7B المضبوط GPT-4 بدقة 92 بالمئة في اختباراتنا عند تدريبه على 2000 تذكرة موسومة. ولاستخراج أرقام طلبات وإجماليات ضريبة وتواريخ من إيميلات عربية فالصغيرة مع JSON مقيد موثوقة وأسرع.

وللتوليد تبقى فجوة. ففئة GPT-4 تكتب فصحى سعودية ودية أطبيع وتعالج التبديل مع أسماء منتجات إنجليزية وتتبع قيود الطول أفضل. والصغيرة تحتاج أمثلة أكثر وما زالت تسرب مصرية مثل عايز بدون منع صريح. واستخدم صغيرة لمسودة ثم كبيرة لصقل عندما تهم الجودة ويسمح الزمن.

وللاستدلال مثل RAG متعدد مستندات مع قواعد فاتورة متعارضة تفوز الكبيرة بالدقة. والصغيرة تهلوس نسخ سياسات. والقاعدة صغيرة للإدراك والاستخراج وكبيرة للاستدلال وكتابة نهائي يواجه عميلا.

3. الزمن والتجربة

الصغيرة على GPU سحابة سعودية ترد 300 إلى 600ms لمئتي توكن مقابل 1.5 إلى 3 ثوانٍ للكبيرة من الخليج مع تفاوت شبكة. ولبوتات واتساب ومساعدي نقاط بيع هذا الفرق يقرر هل ينتظر المستخدم أو يهجر. وضع الصغيرة على المسار الساخن لأول توكن وابث الكبيرة فقط عند التصعيد.

وصمم بديلا احتياطيا. فإذا سقط GPU المحلي وجه للكبيرة تلقائيا. وإذا انتهت مهلة الكبيرة أعد إجابة صغيرة مع علم تحتاج مراجعة بدل خطأ. والمستخدمون يفضلون مسودة سريعة مع إخلاء على مهلة.

4. PDPL وإقامة البيانات

يشترط PDPL بقاء بيانات المقيمين الشخصية في المملكة إلا بضمانات وموافقة. وتذاكر الدعم تحوي أسماء وجوالات وهويات. وإرسال كل تذكرة لـ API أمريكي يخلق أوراق امتثال واعتراضات مؤسسات.

والنمط الذي يجتاز المشتريات هو تنقية PII مع معالجة محلية للاستقبال ثم كبيرة فقط لاستدلال مجهول عند الحاجة. واستضف الصغيرة على STC Cloud أو أوراكل جدة وأبق السجلات في Postgres سعودية ووثق المعالجين. واعرض هذا الرسم في العروض وتغلق أسرع من منافسين أرخص غير متوافقين.

وللحكومة والمصارف ابق محليا كاملا مع صغيرة ومراجعة بشرية. ولا نداءات خارجية. وفقد الدقة مقبول مقابل الاستبعاد.

5. تنفيذ الموجه الهجين

منطق الموجه بالثقة. والصغيرة تعيد إجابة مع ثقة 0 إلى 1. وإذا فوق 0.85 ومهمة منخفضة مثل أسئلة شائعة اخدم مباشرة. وإذا تحت العتبة أو عالية مثل استرداد صعّد للكبيرة مع سياق كامل ومسودة صغيرة كتلميح. وسجل كليهما للتقييم.

والتنفيذ خدمة 200 سطر أمام بوتك. وتحمل إعداد مهمة لكل نية ونقاط نماذج ومفاتيح تخزين وأعلام تقييم. واختبر A/B للعتبات أسبوعيا. وابدأ 0.85 ثم اضبط لإبقاء تصعيد تحت 30 بالمئة ومعدل سيئ تحت 5 بالمئة.

ورقم الأوامر منفصلة لكل نموذج. فالصغيرة تحتاج أمثلة أكثر ومنعا أشد. والكبيرة تحتاج أوامر أقصر لتوفير كلفة. ولا تشارك نفس الموجه عميا.

6. التشغيل والتقييم

احتفظ بـ 200 حالة مقسمة لهجة ومهمة ومخاطرة. وشغل ليليا عبر النموذجين. وتتبع كلفة لكل تذكرة محلولة ورضا عربي ونسبة تصعيد وPII مرسل خارجيا. ونبه عندما تهبط دقة الصغيرة بعد انجراف بيانات مثلا نوايا موسم حج جديدة.

واضبط الصغيرة ربعيا على 5000 تذكرة مصححة. وهذا يتراكم. وفريق رفع قبول الصغيرة من 62 إلى 81 بالمئة في ربعين خافضا نداءات الكبيرة نصفا.

والخلاصة وجه ولا تختر. وصغيرة محلية لسرعة وكلفة وامتثال. وكبيرة لاستدلال وصقل. وموجه 200 سطر مع تقييم أسبوعي يتفوق على أي رهان نموذج واحد.