2.3. Online.Bandit.ArrayProbSpace
Array-of-rewards probability space for stochastic bandits
We build a particular probability space for stochastic bandits, called the "array model", in which
an infinite array of i.i.d. rewards is first produced for all actions. When the algorithm chooses
action a for the nth time, it receives the reward in the row a of the array and column n.
Some statements about bandit algorithms are easier to prove in this space, and can then be transfered to any other probability space using the fact that the conditinonal distributions of the arms and rewards specified in the bandit model determine their laws uniquely.
Main definitions
-
streamMeasure ν: probability measure on the space of infinite arrays of rewards, where the rewards in each row are i.i.d. according toν. -
probSpace 𝓐 R: probability space for the array model of stochastic bandits with action space𝓐and reward spaceR. -
arrayMeasure ν: probability measure onprobSpace 𝓐 Rfor the array model of stochastic bandits with reward kernelν.
Module LeanMachineLearning.Online.Bandit.ArrayProbSpace contains 77 exposed declarations.
-
Bandits.streamMeasure -
Bandits.instIsProbabilityMeasureForallNatForallStreamMeasureOfIsMarkovKernel -
hasLaw_eval_infinitePi -
Bandits.hasLaw_eval_streamMeasure -
Bandits.hasLaw_eval_eval_streamMeasure -
Bandits.identDistrib_eval_eval_id_streamMeasure -
Bandits.integrable_eval_streamMeasure -
Bandits.integral_eval_streamMeasure -
Bandits.iIndepFun_eval_streamMeasure' -
Bandits.iIndepFun_eval_streamMeasure'' -
Bandits.iIndepFun_eval_streamMeasure -
Bandits.indepFun_eval_streamMeasure -
Bandits.indepFun_eval_streamMeasure' -
Bandits.ArrayModel.probSpace -
Bandits.ArrayModel.instMeasurableSpaceProbSpace -
Bandits.ArrayModel.instStandardBorelSpaceProbSpaceOfCountable -
Bandits.ArrayModel.arrayMeasure -
Bandits.ArrayModel.instIsProbabilityMeasureProbSpaceArrayMeasureOfIsMarkovKernel -
Bandits.ArrayModel.initAlgFunction -
Bandits.ArrayModel.initAlgFunction_map -
Bandits.ArrayModel.measurable_initAlgFunction -
Bandits.ArrayModel.algFunction -
Bandits.ArrayModel.algFunction_map -
Bandits.ArrayModel.measurable_algFunction -
Bandits.ArrayModel.hist -
Bandits.ArrayModel.hist_zero -
Bandits.ArrayModel.hist_add_one -
Bandits.ArrayModel.hist_eq -
Bandits.ArrayModel.hist_add_one_eq_IicSuccProd' -
Bandits.ArrayModel.action -
Bandits.ArrayModel.action_zero -
Bandits.ArrayModel.action_add_one_eq -
Bandits.ArrayModel.reward -
Bandits.ArrayModel.reward_zero -
Bandits.ArrayModel.reward_add_one -
Bandits.ArrayModel.reward_eq -
Bandits.ArrayModel.sumRewards_eq -
Bandits.ArrayModel.measurable_action_add_one' -
Bandits.ArrayModel.measurable_pullCount'_action_add_one -
Bandits.ArrayModel.measurable_hist -
Bandits.ArrayModel.measurable_action -
Bandits.ArrayModel.measurable_reward -
Bandits.ArrayModel.hist_add_one_eq_IicSuccProd -
Bandits.ArrayModel.measurable_pullCount_action_add_one -
Bandits.ArrayModel.hist_congr -
Bandits.ArrayModel.stepsUntil_congr_aux -
Bandits.ArrayModel.stepsUntil_congr -
Bandits.ArrayModel.stepsUntil_indicator_congr -
Bandits.ArrayModel.measurable_hist_comap -
Bandits.ArrayModel.truePast -
Bandits.ArrayModel.truePast_eq_of_pullCount_eq -
Bandits.ArrayModel.truePast_eq_of_pullCount_eq_of_ne_zero -
Bandits.ArrayModel.measurable_hist_truePast -
Bandits.ArrayModel.measurable_action_add_one_truePast -
Bandits.ArrayModel.measurable_pullCount_add_one_truePast -
Bandits.ArrayModel.measurable_stepsUntil -
Bandits.ArrayModel.measurable_pullCount_action_add_one_hist -
Bandits.ArrayModel.map_snd_apply_arrayMeasure -
Bandits.ArrayModel.indepFun_fst_snd -
Bandits.ArrayModel.indepFun_fst_zero_snd_zero_action -
Bandits.ArrayModel.indepFun_fst_add_one_aux -
Bandits.ArrayModel.indepFun_fst_add_one_hist -
Bandits.ArrayModel.indepFun_snd_apply_aux -
Bandits.ArrayModel.indepFun_snd_apply_pullCount_action -
Bandits.ArrayModel.indepFun_cond_comp -
Bandits.ArrayModel.indepFun_snd_hist_cond -
Bandits.ArrayModel.hasLaw_action_zero -
Bandits.ArrayModel.hasCondDistrib_reward_zero -
Bandits.ArrayModel.hasCondDistrib_action' -
Bandits.ArrayModel.hasCondDistrib_reward_pullCount_action -
Bandits.ArrayModel.reward_ae_eq_cond -
Bandits.ArrayModel.hasCondDistrib_reward_hist_action_pullCount -
Bandits.ArrayModel.condIndepFun_reward_hist -
Bandits.ArrayModel.hasCondDistrib_reward' -
Bandits.ArrayModel.hasCondDistrib_action -
Bandits.ArrayModel.hasCondDistrib_reward -
Bandits.ArrayModel.isAlgEnvSeq_arrayMeasure