كل فريق منتج بنى الآن عرض LLM جعل الحضور يشهق. أقل بكثير من أطلق ميزة نجت من مستخدمين حقيقيين وبيانات حقيقية واتفاقية مستوى خدمة حقيقية. الفجوة ليست جودة النموذج — بل الانضباط الهندسي حوله.
هذه قائمة التحقق التي تمررها أمان-كلاود قبل اعتبار أي ميزة ذكاء اصطناعي جاهزة للإنتاج.
الاسترجاع قبل التوليد
كل ميزة ذكاء اصطناعي مفيدة تجاريًا تقريبًا هي استرجاع يرتدي قبعة توليد. سقف الجودة يحدده ما تضعه في نافذة السياق، لا براعة الموجّه. التقسيم المنضبط: نحو سبعون بالمئة من وقت هندسة الذكاء الاصطناعي على الاستيعاب والتقطيع والحداثة والترتيب — وثلاثين على استدعاء النموذج.
إذا كان الاسترجاع خاطئًا، لن ينقذك أي موجّه. وإذا كان صحيحًا، سيبدو حتى نموذج متوسط عبقريًا.
التقييم هو الميزة
قبل كتابة الميزة، اكتب التقييم: مجموعة بيانات مُدارة الإصدارات من مدخلات حقيقية بمخرجات متوقعة مصنفة، تعمل مع كل تغيير كحزمة اختبارات. الفرق التي تتجاوز هذا تُطلق تراجعات مع كل تعديل موجّه ولا تعلم أبدًا.
القاعدة العملية: لا تُدمج ميزة ذكاء اصطناعي بدون مجموعة تقييم من مئة حالة على الأقل وعتبة نجاح محددة.
صمم للفشل، لا للعرض
العرض يُظهر المسار السعيد؛ الإنتاج هو المسارات الأخرى. كل واجهة ذكاء اصطناعي إنتاجية تحتاج ثلاث حالات مصممة: إجابة واثقة بمصادر، وإجابة متحفظة مع مخرج إلى إنسان أو بحث، ورفض صادق. يغفر المستخدمون «لست متأكدًا من هذه» — ولا يغفرون الهراء الواثق.
أضف سقوف تكلفة وميزانيات كمون مع بث ومفتاح إيقاف يُرجع الميزة إلى بديلها التقليدي. ممل وغير برّاق — وهو الفرق بين ميزة وحادثة.