Fetching the paper…
Reading the bibliography…
We provide the first importance sampling variants of variance reduced algorithms for empirical risk minimization with non-convex loss functions.
Fast incremental method for smooth nonconvex optimization
Sashank J Reddi, Suvrit Sra, Barnabás Póczos, and Alex Smola · 1977
Earlier work this paper cites.
Problem complexity and method efficiency in optimization
Arkadi Nemirovsky and David B. Yudin · 1983
Earlier work this paper cites.
Robust stochastic approximation approach to stochastic programming
A Nemirovski, A Juditsky, G Lan, and A Shapiro · 2009
Earlier work this paper cites.
Efficiency of coordinate descent methods on huge-scale optimization problems
Yurii Nesterov · 2012
Earlier work this paper cites.
A stochastic gradient method with an exponential convergence rate for finite training sets
Nicolas Le Roux, Mark Schmidt, and Francis Bach · 2012
Earlier work this paper cites.
Accelerating stochastic gradient descent using predictive variance reduction
Rie Johnson and Tong Zhang · 2013
Earlier work this paper cites.
Introductory lectures on convex optimization: A basic course , volume 87
Yurii Nesterov · 2013
Earlier work this paper cites.
Stochastic dual coordinate ascent methods for regularized loss
Shai Shalev-Shwartz and Tong Zhang · 2013
Earlier work this paper cites.
Mini-batch primal and dual methods for SVMs
Martin Takáč, Avleen Bijral, Peter Richtárik, and Nathan Srebro · 2013
Earlier work this paper cites.
Iteration complexity of randomized block-coordinate descent methods for minimizing a composite function
Peter Richtárik and Martin Takáč · 2014
Earlier work this paper cites.
Primal method for ERM with flexible mini-batching schemes and non-convex losses
Dominik Csiba and Peter Richtárik · 2015
Cited alongside, same era.
Adding vs. averaging in distributed primal-dual optimization
Chenxin Ma, Virginia Smith, Martin Jaggi, Michael I. Jordan, Peter Richtárik, and Martin Takáč · 2015
Cited alongside, same era.
Incremental majorization-minimization optimization with application to large-scale machine learning
Julien Mairal · 2015
Cited alongside, same era.
Quartz: Randomized dual coordinate ascent with arbitrary sampling
Zheng Qu, Peter Richtárik, and Tong Zhang · 2015
Cited alongside, same era.
Stochastic optimization with importance sampling for regularized loss minimization
Peilin Zhao and Tong Zhang · 2015
Cited alongside, same era.
Coordinate descent with arbitrary sampling II: expected separable overapproximation
Zheng Qu and Peter Richtárik · 2016
Later among the works it cites.
SDNA: stochastic dual Newton ascent for empirical risk minimization
Zheng Qu, Peter Richtárik, Martin Takáč, and Olivier Fercoq · 2016
Later among the works it cites.
S2GD: Semi-stochastic gradient descent methods
Jakub Konečný and Peter Richtárik · 2017
Later among the works it cites.
S2CD: Semi-stochastic coordinate descent
Jakub Konečný, Zheng Qu, and Peter Richtárik · 2017
Later among the works it cites.
Nicolas Loizou and Peter Richtárik · 2017
Later among the works it cites.
Distributed optimization with arbitrary local solvers
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Katyusha: The first direct acceleration of stochastic gradient methods
Zeyuan Allen-Zhu · 2016
Cited alongside, same era.
Variance reduction for faster non-convex optimization
Zeyuan Allen-Zhu and Elad Hazan · 2016
Cited alongside, same era.
Even faster accelerated coordinate descent using non-uniform sampling
Zeyuan Allen-Zhu, Zheng Qu, Peter Richtárik, and Yang Yuan · 2016
Cited alongside, same era.
Stochastic block BFGS: squeezing more curvature out of data
Robert Mansel Gower, Donald Goldfarb, and Peter Richtárik · 2016
Cited alongside, same era.
Coordinate descent with arbitrary sampling I: algorithms and complexity
Zheng Qu and Peter Richtárik · 2016
Cited alongside, same era.
SAGA: A fast incremental gradient method with support for non-strongly convex composite objectives
Aaron Defazio, Francis Bach, and Simon Lacoste-Julien
Cited in the paper.
Finito: A faster, permutable incremental gradient method for Big Data problems
Aaron Defazio, Tiberio Caetano, and Justin Domke
Cited in the paper.
Chenxin Ma, Jakub Konečný, Martin Jaggi, Virginia Smith, Michael I Jordan, Peter Richtárik, and Martin Takáč · 2017
Later among the works it cites.
Stochastic primal-dual hybrid gradient algorithm with arbitrary sampling and imaging applications
Antonin Chambolle, Matthias J. Ehrhardt, Peter Richtárik, and Carola-Bibiane Schöenlieb · 2018
Closest in time.
Importance sampling for minibatches
Dominik Csiba and Peter Richtárik · 2018
Closest in time.
Stochastic quasi-gradient methods: variance reduction via Jacobian sketching
Robert Mansel Gower, Peter Richtárik, and Francis Bach · 2018
Closest in time.
Accelerated coordinate descent with arbitrary sampling and best rates for minibatches
Filip Hanzely and Petert Richtárik · 2019
Closest in time.