معظم تقديرات تكلفة البيانات الاصطناعية حساب رموز: طول الموجّه × سعر الإدخال، زائد المخرجات المتوقعة × سعر الإخراج. هذا الحساب خاطئ عادةً بمقدار الضعف أو أكثر، لأنه يتجاهل ما يسيطر فعلياً على الفاتورة.
هذه أرقام مقاسة من توليد محادثات دعم عملاء بالعربية السعودية، وما تقوله عن اختيار النموذج.
حلقة إعادة المحاولة هي التكلفة
كل محادثة تمر ببوابة جودة. الإخفاقات تُعاد إلى النموذج مع مخرجاته ويُعاد التوليد، حتى ثلاث محاولات.
من بيانات الإنتاج، توزيع المحاولات لكل صف مُسلَّم بنجاح:
| المحاولات | الصفوف |
|---|---|
| ١ | ١٢ |
| ٢ | ٣٦ |
| ٣ | ٣٢ |
بمتوسط ٢٫٢٥ محاولة لكل صف مُسلَّم. ١٥٪ فقط نجحت من المحاولة الأولى.
هذا يغيّر الحساب تماماً. إعادة المحاولة ليست إضافة رخيصة: تُعيد إرسال موجّه النظام، وموجّه السيناريو كاملاً، والمخرجات الفاشلة السابقة، وموجّه الإصلاح. المحاولتان الثانية والثالثة مدخلاتهما أكبر من الأولى.
إذن التقدير الساذج للصف الواحد يحتاج للضرب في ٢٫٢٥ تقريباً — والمضاعِف خاصية من خصائص بوابة الجودة لديك، لا من قائمة أسعار النموذج.
مقاسة عبر ثلاثة نماذج
الموجّهات نفسها، البوابة نفسها، التصنيف نفسه:
| النموذج | معدل النجاح | تكلفة الصف المُسلَّم | ٤٩٬٩٠٠ صف |
|---|---|---|---|
| GLM 5.3 Flash (تفكير أدنى) | ٥٩/٦٢ (٩٥٪) | ~$0.00076 | ~$34–46 |
| DeepSeek v4 Flash | ٢٠/٢٧ (٧٤٪) | ~$0.0016–0.0027 | ~$80–133 |
أمران يلفتان النظر.
النموذج الأرخص كان أيضاً الأفضل هنا، وهذه ليست المقايضة المعتادة. لا شيء في السعر الأدنى يعني معالجة أسوأ للهجة، وافتراض ذلك يكلّفك مالاً.
ومعدلات النجاح متذبذبة عند هذه الأحجام. سجّل GLM ١٢/١٢، ثم ٢٤/٢٤، ثم ٢١/٢٤ بالإعداد نفسه. وسجّل DeepSeek ٣٣٪، ثم ٦٧٪، ثم ٩٢٪. قدّر ميزانيتك من الرقم المجمَّع عبر عدة تشغيلات؛ عيّنة واحدة من اثني عشر ليست معدل نجاح، بل حكاية.
الفخ الذي لا يعيد شيئاً
نموذج GLM 5.3 Flash لديه تفكير لا يمكن تعطيله. إرسال طلب دون تحديد مستوى تفكير أنتج التالي:
- ٨ من ٨ طلبات أعادت محتوى فارغاً
- كل طلب استهلك ميزانيته كاملة البالغة ٤٬٠٠٠ رمز
- ذهبت كلها إلى رموز التفكير
فكّر النموذج حتى نفد المجال ولم يكتب إجابة قط. ضبط
reasoning: { effort: "minimal" } يخفض التفكير إلى صفر تقريباً فتظهر المخرجات
طبيعية. ومحاولة تعطيل التفكير كلياً تُعيد خطأ ٤٠٠: "Reasoning is mandatory for
this endpoint and cannot be disabled."
يستحق هذا النمط أن يُستوعب لأنه صامت. لا تُرفض، ولا تُقيَّد، وتُحاسَب كاملاً على رموز الإخراج ولا تستلم شيئاً. إن كنت تبدّل النماذج على موجّه مستضاف، فتحقّق هل النموذج الجديد يفكّر افتراضياً قبل أن تصفّ خمسين ألف صف.
ما ينبغي قياسه فعلاً
قبل الالتزام بتشغيل كبير، ولّد نحو عشرين صفاً عبر موجّهك الحقيقي وبوابتك الحقيقية، وسجّل:
- معدل النجاح — كم صفاً ينتج صفاً صالحاً أصلاً
- المحاولات لكل نجاح — المضاعِف الحقيقي للتكلفة
- تكلفة الصف المُسلَّم من بيانات الاستخدام التي يبلّغ عنها المزوّد، لا من تقديرك للرموز
- الزمن الفعلي عند تزامنك — هذا يحدّد الجدول، وهو ما يوجع عادةً
عشرون صفاً تكلّف بضعة سنتات وتخبرك أكثر من أي حساب من صفحة الأسعار. تخطّي هذه الخطوة هو كيف تتحول مهمة بأربعين دولاراً إلى مئة وثلاثين.
ما لا يضعه أحد في الميزانية
الاستدلال ليس التكلفة الوحيدة، بل الظاهرة فقط. كتابات قاعدة البيانات، ووقت الحاويات لتشغيل يُقاس بالأيام، والتخزين — كلها تتراكم، متواضعة هنا ببضعة دولارات، لكنها ليست صفراً.
التكلفة الأكبر غير المحسوبة هي بوابة الجودة نفسها: الوقت المصروف في تحديد أي الفحوص يهم في مجالك. هذه ليست تكلفة استدلال ولا تظهر في أي فاتورة، لكنها معظم العمل، وهي ما يحدد إن كانت المخرجات تساوي شيئاً.