كل فريق منتج بنى الآن عرض LLM جعل الحضور يشهق. أقل بكثير من أطلق ميزة نجت من مستخدمين حقيقيين وبيانات حقيقية واتفاقية مستوى خدمة حقيقية. الفجوة ليست جودة النموذج — بل الانضباط الهندسي حوله.
هذه قائمة التحقق التي نمررها قبل وصول أي ميزة ذكاء اصطناعي إلى الإنتاج في نظام عميل.
الاسترجاع قبل التوليد
كل ميزة ذكاء اصطناعي مفيدة تجاريًا تقريبًا هي استرجاع يرتدي قبعة توليد. سقف الجودة يحدده ما تضعه في نافذة السياق، لا براعة الموجّه. ننفق نحو سبعين بالمئة من وقت هندسة الذكاء الاصطناعي على الاستيعاب والتقطيع والحداثة والترتيب — وثلاثين على استدعاء النموذج.
إذا كان الاسترجاع خاطئًا، لن ينقذك أي موجّه. وإذا كان صحيحًا، سيبدو حتى نموذج متوسط عبقريًا.
التقييم هو الميزة
قبل كتابة الميزة، اكتب التقييم: مجموعة بيانات مُدارة الإصدارات من مدخلات حقيقية بمخرجات متوقعة مصنفة، تعمل مع كل تغيير كحزمة اختبارات. الفرق التي تتجاوز هذا تُطلق تراجعات مع كل تعديل موجّه ولا تعلم أبدًا.
قاعدتنا التقريبية: لا تُدمج ميزة ذكاء اصطناعي بدون مجموعة تقييم من مئة حالة على الأقل وعتبة نجاح محددة.
صمم للفشل، لا للعرض
العرض يُظهر المسار السعيد؛ الإنتاج هو المسارات الأخرى. كل واجهة ذكاء اصطناعي نطلقها لها ثلاث حالات مصممة: إجابة واثقة بمصادر، وإجابة متحفظة مع مخرج إلى إنسان أو بحث، ورفض صادق. يغفر المستخدمون «لست متأكدًا من هذه» — ولا يغفرون الهراء الواثق.
أضف سقوف تكلفة وميزانيات كمون مع بث ومفتاح إيقاف يُرجع الميزة إلى بديلها التقليدي. ممل وغير برّاق — وهو الفرق بين ميزة وحادثة.