المسرد · concept
معادلة بيلمان
معادلة دالة قيمة تكرارية تجسد الشرط الكافي واللازم للسياسة المثلى في البرمجة الديناميكية؛ صاغها Bellman (1957) كمبدأ الأمثلية.
Bellman Equationمبدأ الأمثليةدالة القيمةارتجاع بيلمان
معادلة بيلمان (Bellman equation) هي التعبير الرياضي لـ **مبدأ الأمثلية** الذي صاغه Richard Bellman في كتابه 1957 (*Dynamic Programming*، Princeton University Press): تتميز السياسة المثلى بأنه أياً كانت الحالة الابتدائية والقرار الابتدائي، يجب أن تشكل القرارات المتبقية سياسة مثلى بالنسبة للحالة الناتجة. لمسألة حتمية بأفق منتهٍ تُكتب V*(s) = max_a { r(s, a) + V*(s') }، حيث V*(s) العائد الإجمالي الأمثل من الحالة s، r(s, a) المكافأة الفورية، وs' الحالة بعد القرار a. لمسألة مخصومة بأفق لا نهائي تُكتب V*(s) = max_a { r(s, a) + γ E[V*(s')] }، مع عامل الخصم γ ∈ (0, 1). لعمليات القرار العشوائية (Markov Decision Processes، MDP) فإن Bellman وDreyfus (1962) وBertsekas (1995) *Dynamic Programming and Optimal Control* مراجع قياسية؛ معادلة Hamilton-Jacobi-Bellman PDE هي الصيغة التفاضلية الزمنية المستمرة لنفس المبدأ للتحكم العشوائي. الخوارزميات الكلاسيكية لحل معادلة بيلمان تشمل value iteration (تحديث تكراري على جدول)، policy iteration (بديل Howard 1960)، وإعادة الصياغة بالبرمجة الخطية (Manne 1960). معادلة بيلمان النواة المشتركة للمخزون (Wagner-Whitin 1958)، استبدال المعدات (Bellman 1955)، البائع المتجول (DP Held-Karp 1962)، اختيار المحفظة (Merton 1969)، وكل تطبيق برمجة ديناميكية في بحوث العمليات/علوم الحاسب. Stochastic Dual Dynamic Programming (SDDP، Pereira وPinto 1991) وApproximate Dynamic Programming (Powell 2007) مناهج حديثة لمعادلات بيلمان عالية البعد.
Örnek
تعاونية مدخلات زراعية في أدرنة (إيرادات أسبوعية 8M TRY على 480 SKU) تنمذج سياسة المخزون الموسمي تحت طلب يقوده الطقس كـ MDP عشوائي 26 أسبوعاً؛ value iteration على معادلة بيلمان يتقارب في 12 دقيقة بتسامح 0.5% وينتج سياسة طلب مثلى. مقارنة بالإرشادية القديمة بنقطة إعادة طلب ثابتة، يرتفع مستوى الخدمة السنوي من 91% إلى 96.5% وتنخفض كلفة احتجاز رأس المال بـ 14%.