Skip to content
Opt Dir

Glosario · concept

Ecuación de Bellman

Ecuación recursiva de función de valor que captura la condición necesaria y suficiente para una política óptima en programación dinámica; formalizada por Bellman (1957) como principio de optimalidad.

Bellman EquationPrincipio de OptimalidadFunción de ValorRecursión de Bellman
La ecuación de Bellman es la expresión matemática del **principio de optimalidad** que Richard Bellman formalizó en su libro de 1957 (*Dynamic Programming*, Princeton University Press): una política óptima tiene la propiedad de que cualesquiera sean el estado inicial y la decisión inicial, las decisiones restantes deben constituir una política óptima respecto del estado resultante. Para un problema determinista de horizonte finito se escribe V*(s) = max_a { r(s, a) + V*(s') }, donde V*(s) es el retorno total óptimo desde el estado s, r(s, a) la recompensa inmediata y s' el estado tras la acción a. Para un problema descontado de horizonte infinito se escribe V*(s) = max_a { r(s, a) + γ E[V*(s')] }, con factor de descuento γ ∈ (0, 1). Para procesos de decisión estocásticos (Markov Decision Processes, MDP) Bellman y Dreyfus (1962) y Bertsekas (1995) *Dynamic Programming and Optimal Control* son las referencias estándar; la PDE de Hamilton-Jacobi-Bellman es la forma diferencial en tiempo continuo del mismo principio para control estocástico. Los algoritmos clásicos de solución de la ecuación de Bellman incluyen value iteration (actualización recursiva por tabla), policy iteration (alternativa de Howard 1960) y la reformulación de programación lineal (Manne 1960). La ecuación de Bellman es el núcleo común de inventario (Wagner-Whitin 1958), reemplazo de equipos (Bellman 1955), viajante (DP Held-Karp 1962), selección de cartera (Merton 1969) y cada aplicación de programación dinámica en IO/CC. Stochastic Dual Dynamic Programming (SDDP, Pereira y Pinto 1991) y Approximate Dynamic Programming (Powell 2007) son enfoques modernos para ecuaciones de Bellman de alta dimensión.
Örnek

Una cooperativa de insumos agrícolas en Edirne (8M TRY de ingresos semanales sobre 480 SKU) modela su política estacional de stock bajo demanda dependiente del clima como un MDP estocástico de 26 semanas; value iteration sobre la ecuación de Bellman converge en 12 minutos con tolerancia del 0,5% y produce una política óptima de pedidos. Comparado con la heurística legacy de punto de reorden fijo, el nivel de servicio anual sube del 91% al 96,5% y el coste de inmovilizado cae un 14%.

Esc Cerrar