Hva er 'posterior sampling' i Thompson Sampling?
Klikk for å snu kortet
I stedet for å bruke forventningsverdien (utnytting) eller uniform tilfeldighet (utforsking), samples en realiseringsverdier fra posteriorifordelingen for hver arm. Dette gir en stokastisk policy som automatisk balanserer explore og exploit.
Space / Enter for å snu