Modelling transition dynamics in mdps with rkhs embeddings
Grunewalder, S., Lever, G., Baldassarre, L., Pontil, M., and Gretton, A · 2012
Cited alongside, same era.
Counterfactual reasoning and learning systems: The example of computational advertising
Bottou, L., Peters, J., Quiñonero-Candela, J., Charles, D. X., Chickering, D. M., Portugaly, E., Ray, D., Simard, P., and Snelson, E · 2013
Cited alongside, same era.
Openai gym
Original
Brockman, G., Cheung, V., Pettersson, L., Schneider, J., Schulman, J., Tang, J., and Zaremba, W · 2016
Cited alongside, same era.
CVXPY: A Python-embedded modeling language for convex optimization
Diamond, S. and Boyd, S · 2016
Cited alongside, same era.
Regularized policy iteration with nonparametric function spaces
Farahmand, A.-m., Ghavamzadeh, M., Szepesvári, C., and Mannor, S · 2016
Cited alongside, same era.
Doubly robust off-policy evaluation for reinforcement learning
Jiang, N. and Li, L · 2016
Cited alongside, same era.
Data-efficient off-policy policy evaluation for reinforcement learning
Thomas, P. S. and Brunskill, E · 2016
Cited alongside, same era.
Bootstrapping with models: Confidence intervals for off-policy evaluation
Hanna, J. P., Stone, P., and Niekum, S · 2017
Cited alongside, same era.
Predictive off-policy policy evaluation for nonstationary decision problems, with applications to digital marketing
Thomas, P. S., Theocharous, G., Ghavamzadeh, M., Durugkar, I., and Brunskill, E · 2017
Cited alongside, same era.
Optimal and adaptive off-policy evaluation in contextual bandits
Wang, Y.-X., Agarwal, A., and Dudík, M · 2017
Cited alongside, same era.
A rewriting system for convex optimization problems
Agrawal, A., Verschueren, R., Diamond, S., and Boyd, S · 2018
Cited alongside, same era.
More robust doubly robust off-policy evaluation
Farajtabar, M., Chow, Y., and Ghavamzadeh, M · 2018
Cited alongside, same era.