Skip to content
Opt Dir

Glossario · concept

Equazione di Bellman

Equazione ricorsiva della funzione valore che cattura la condizione necessaria e sufficiente per una politica ottima nella programmazione dinamica; formalizzata da Bellman (1957) come principio di ottimalità.

Bellman EquationPrincipio di OttimalitàFunzione ValoreRicorsione di Bellman
L'equazione di Bellman è l'espressione matematica del **principio di ottimalità** che Richard Bellman formalizzò nel suo libro del 1957 (*Dynamic Programming*, Princeton University Press): una politica ottima ha la proprietà che, qualunque siano lo stato iniziale e la decisione iniziale, le decisioni rimanenti devono costituire una politica ottima rispetto allo stato risultante. Per un problema deterministico a orizzonte finito si scrive V*(s) = max_a { r(s, a) + V*(s') }, dove V*(s) è il rendimento totale ottimo dallo stato s, r(s, a) la ricompensa immediata e s' lo stato dopo l'azione a. Per un problema scontato a orizzonte infinito si scrive V*(s) = max_a { r(s, a) + γ E[V*(s')] }, con fattore di sconto γ ∈ (0, 1). Per processi decisionali stocastici (Markov Decision Processes, MDP) Bellman e Dreyfus (1962) e Bertsekas (1995) *Dynamic Programming and Optimal Control* sono i riferimenti standard; la PDE di Hamilton-Jacobi-Bellman è la forma differenziale in tempo continuo dello stesso principio per il controllo stocastico. Gli algoritmi classici di soluzione dell'equazione di Bellman includono value iteration (aggiornamento ricorsivo su tabella), policy iteration (alternativa di Howard 1960) e la riformulazione di programmazione lineare (Manne 1960). L'equazione di Bellman è il nucleo comune di gestione delle scorte (Wagner-Whitin 1958), sostituzione di apparecchiature (Bellman 1955), commesso viaggiatore (DP Held-Karp 1962), selezione di portafoglio (Merton 1969) e ogni applicazione di programmazione dinamica in RO/IC. Stochastic Dual Dynamic Programming (SDDP, Pereira e Pinto 1991) e Approximate Dynamic Programming (Powell 2007) sono approcci moderni per equazioni di Bellman ad alta dimensione.
Örnek

Una cooperativa di input agricoli a Edirne (8M TRY di ricavi settimanali su 480 SKU) modella la propria politica stagionale di stock sotto domanda guidata dal meteo come un MDP stocastico a 26 settimane; value iteration sull'equazione di Bellman converge in 12 minuti con tolleranza dello 0,5% e produce una politica ottima di ordinazione. Rispetto all'euristica legacy con punto di riordino fisso, il livello di servizio annuale sale dal 91% al 96,5% e il costo di capitale immobilizzato cala del 14%.

Esc Chiudi