Fetching the paper…
Reading the bibliography…
Large-scale GPU clusters are widely-used to speed up both latency-critical (online) and best-effort (offline) deep learning (DL) workloads.
Salus: Fine-grained GPU sharing primitives for deep learning applications
Peifeng Yu and Mosharaf Chowdhury. 2019 · 1902
Earlier work this paper cites.
The Hungarian method for the assignment problem
Harold W Kuhn. 1955 · 1955
Earlier work this paper cites.
Algorithms for the assignment and transportation problems
James Munkres. 1957 · 1957
Earlier work this paper cites.
PID control
Michael A Johnson and Mohammad H Moradi. 2005 · 2005
Earlier work this paper cites.
Dominant resource fairness: Fair allocation of multiple resource types. In USENIX NSDI
Ali Ghodsi, Matei Zaharia, Benjamin Hindman, Andy Konwinski, Scott Shenker, and Ion Stoica. 2011 · 2011
Earlier work this paper cites.
Apollo: Scalable and Coordinated Scheduling for { \{ Cloud-Scale } \} Computing. In USENIX OSDI
Eric Boutin, Jaliya Ekanayake, Wei Lin, Bing Shi, Jingren Zhou, Zhengping Qian, Ming Wu, and Lidong Zhou. 2014 · 2014
Earlier work this paper cites.
Multi-resource packing for cluster schedulers. In ACM SIGCOMM
Robert Grandl, Ganesh Ananthanarayanan, Srikanth Kandula, Sriram Rao, and Aditya Akella. 2014 · 2014
Earlier work this paper cites.
Very deep convolutional networks for large-scale image recognition. In ICLR
Karen Simonyan and Andrew Zisserman. 2015 · 2015
Earlier work this paper cites.
Large-scale cluster management at Google with Borg. In EuroSys
Abhishek Verma, Luis Pedrosa, Madhukar Korupolu, David Oppenheimer, Eric Tune, and John Wilkes. 2015 · 2015
Earlier work this paper cites.
TensorFlow: a system for Large-Scale machine learning. In USENIX OSDI
Martín Abadi, Paul Barham, Jianmin Chen, Zhifeng Chen, Andy Davis, Jeffrey Dean, Matthieu Devin, Sanjay Ghemawat, Geoffrey Irving, Michael Isard, et al · 2016
Earlier work this paper cites.
Baymax: Qos Awareness and Increased Utilization for Non-preemptive Accelerators in Warehouse Scale Computers
Quan Chen, Hailong Yang, Jason Mars, and Lingjia Tang. 2016 · 2016
Earlier work this paper cites.
Deep neural networks for youtube recommendations. In ACM RecSys
Paul Covington, Jay Adams, and Emre Sargin. 2016 · 2016
Earlier work this paper cites.
Deep residual learning for image recognition. In IEEE CVPR
Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016 · 2016
Earlier work this paper cites.
An overview of gradient descent optimization algorithms
Sebastian Ruder. 2016 · 2016
Earlier work this paper cites.
Rethinking the inception architecture for computer vision. In IEEE CVPR
Christian Szegedy, Vincent Vanhoucke, Sergey Ioffe, Jon Shlens, and Zbigniew Wojna. 2016 · 2016
Earlier work this paper cites.
Prophet: Precise qos prediction on non-preemptive accelerators to improve utilization in warehouse-scale computers. In ACM ASPLOS
Quan Chen, Hailong Yang, Minyi Guo, Ram Srivatsa Kannan, Jason Mars, and Lingjia Tang. 2017 · 2017
Earlier work this paper cites.
Clipper: A Low-Latency Online Prediction Serving System. In USENIX NSDI
Daniel Crankshaw, Xin Wang, Guilio Zhou, Michael J Franklin, Joseph E Gonzalez, and Ion Stoica. 2017 · 2017
Earlier work this paper cites.
Convolutional sequence to sequence learning. In PMLR
Jonas Gehring, Michael Auli, David Grangier, Denis Yarats, and Yann N Dauphin. 2017 · 2017
Earlier work this paper cites.
Densely connected convolutional networks. In IEEE CVPR
Gao Huang, Zhuang Liu, Laurens Van Der Maaten, and Kilian Q Weinberger. 2017 · 2017
Earlier work this paper cites.
Monotasks: Architecting for performance clarity in data analytics frameworks. In ACM SOSP
Kay Ousterhout, Christopher Canel, Sylvia Ratnasamy, and Scott Shenker. 2017 · 2017
Cited alongside, same era.
Attention is all you need. In NIPS
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin. 2017 · 2017
Cited alongside, same era.
GaiaGPU: sharing GPUs in container clouds. In IEEE ISPA/IUCC/BDCloud/SocialCom/SustainCom
Jing Gu, Shengbo Song, Ying Li, and Hanmei Luo. 2018 · 2018
Cited alongside, same era.
Progressive neural architecture search. In ECCV
Chenxi Liu, Barret Zoph, Maxim Neumann, Jonathon Shlens, Wei Hua, Li-Jia Li, Li Fei-Fei, Alan Yuille, Jonathan Huang, and Kevin Murphy. 2018 · 2018
Cited alongside, same era.
Gandiva: Introspective cluster scheduling for deep learning. In USENIX OSDI
Wencong Xiao, Romil Bhardwaj, Ramachandran Ramjee, Muthian Sivathanu, Nipun Kwatra, Zhenhua Han, Pratyush Patel, Xuan Peng, Hanyu Zhao, Quanlu Zhang, Fan Yang, and Lidong Zhou. 2018 · 2018
Cited alongside, same era.
Heterogeneity-aware cluster scheduling policies for deep learning workloads. In USENIX OSDI
Deepak Narayanan, Keshav Santhanam, Fiodar Kazhamiaka, Amar Phanishayee, and Matei Zaharia. 2020 · 2020
Later among the works it cites.
Improved protein structure prediction using potentials from deep learning
Andrew W Senior, Richard Evans, John Jumper, James Kirkpatrick, Laurent Sifre, Tim Green, Chongli Qin, Augustin Žídek, Alexander WR Nelson, Alex Bridgland, et al · 2020
Later among the works it cites.
Borg: the next generation. In EuroSys
Muhammad Tirmazi, Adam Barker, Nan Deng, Md E Haque, Zhijing Gene Qin, Steven Hand, Mor Harchol-Balter, and John Wilkes. 2020 · 2020
Later among the works it cites.
AntMan: Dynamic scaling on GPU clusters for deep learning. In USENIX OSDI
Wencong Xiao, Shiru Ren, Yong Li, Yang Zhang, Pengyang Hou, Zhi Li, Yihui Feng, Wei Lin, and Yangqing Jia. 2020 · 2020
Later among the works it cites.
Retiarii: A deep learning exploratory-training framework. In USENIX OSDI
Quanlu Zhang, Zhenhua Han, Fan Yang, Yuge Zhang, Zhe Liu, Mao Yang, and Lidong Zhou. 2020 · 2020
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Tiresias: A GPU cluster manager for distributed deep learning. In USENIX NSDI
Juncheng Gu, Mosharaf Chowdhury, Kang G Shin, Yibo Zhu, Myeongjae Jeon, Junjie Qian, Hongqiang Liu, and Chuanxiong Guo. 2019 · 2019
Cited alongside, same era.
Analysis of large-scale multi-tenant GPU clusters for DNN training workloads. In USENIX ATC
Myeongjae Jeon, Shivaram Venkataraman, Amar Phanishayee, Junjie Qian, Wencong Xiao, and Fan Yang. 2019 · 2019
Cited alongside, same era.
Pytorch: An imperative style, high-performance deep learning library. In NIPS
Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, et al · 2019
Cited alongside, same era.
Challenges and opportunities of deep learning models for machinery fault detection and diagnosis: A review
Syahril Ramadhan Saufi, Zair Asrar Bin Ahmad, Mohd Salman Leong, and Meng Hee Lim. 2019 · 2019
Cited alongside, same era.
Nexus: A GPU cluster engine for accelerating DNN-based video analysis. In ACM SOSP
Haichen Shen, Lequn Chen, Yuchen Jin, Liangyu Zhao, Bingyu Kong, Matthai Philipose, Arvind Krishnamurthy, and Ravi Sundaram. 2019 · 2019
Cited alongside, same era.
Mnasnet: Platform-aware neural architecture search for mobile. In CVPR
Mingxing Tan, Bo Chen, Ruoming Pang, Vijay Vasudevan, Mark Sandler, Andrew Howard, and Quoc V Le. 2019 · 2019
Cited alongside, same era.
Pipelined data-parallel CPU/GPU scheduling for multi-DNN real-time inference. In IEEE RTSS
Yecheng Xiang and Hyoseung Kim. 2019 · 2019
Cited alongside, same era.
Learning An End-to-End Structure for Retrieval in Large-Scale Recommendations. In ACM CIKM
Weihao Gao, Xiangjun Fan, Chong Wang, Jiankai Sun, Kai Jia, Wenzi Xiao, Ruofan Ding, Xingyan Bin, Hui Yang, and Xiaobing Liu. 2021 · 2021
Later among the works it cites.
Elastic resource sharing for distributed deep learning. In USENIX NSDI
Changho Hwang, Taehyun Kim, Sunghyun Kim, Jinwoo Shin, and KyoungSoo Park. 2021 · 2021
Later among the works it cites.
Zico: Efficient GPU memory sharing for concurrent DNN training. In USENIX ATC
Gangmuk Lim, Jeongseob Ahn, Wencong Xiao, Youngjin Kwon, and Myeongjae Jeon. 2021 · 2021
Later among the works it cites.
Pollux: Co-adaptive cluster scheduling for goodput-optimized deep learning. In USENIX OSDI
Aurick Qiao, Willie Neiswanger, Qirong Ho, Hao Zhang, Gregory R Ganger, and Eric P Xing. 2021 · 2021
Later among the works it cites.
INFaaS: Automated Model-less Inference Serving. In USENIX ATC
Francisco Romero, Qian Li, Neeraja J Yadwadkar, and Christos Kozyrakis. 2021 · 2021
Later among the works it cites.
Wavelet: Efficient DNN training with tick-tock scheduling. In MLSys
Guanhua Wang, Kehan Wang, Kenan Jiang, Xiangjun Li, and Ion Stoica. 2021 · 2021
Later among the works it cites.
Kubernetes
2022 · 2022
Later among the works it cites.
NVDIA MPS
2022 · 2022
Later among the works it cites.
NVIDIA MIG
2022 · 2022
Later among the works it cites.
Microsecond-scale Preemption for Concurrent GPU-accelerated DNN Inferences. In USENIX OSDI
Mingcong Han, Hanze Zhang, Rong Chen, and Haibo Chen. 2022 · 2022
Later among the works it cites.
Looking beyond GPUs for DNN scheduling on multi-tenant clusters. In USENIX OSDI
Jayashree Mohan, Amar Phanishayee, Janardhan Kulkarni, and Vijay Chidambaram. 2022 · 2022
Later among the works it cites.
Efficient Strong Scaling Through Burst Parallel Training
Seo Jin Park, Joshua Fried, Sunghyun Kim, Mohammad Alizadeh, and Adam Belay. 2022 · 2022
Later among the works it cites.
MLaaS in the wild: Workload analysis and scheduling in large-scale heterogeneous GPU clusters. In USENIX NSDI
Qizhen Weng, Wencong Xiao, Yinghao Yu, Wei Wang, Cheng Wang, Jian He, Yong Li, Liping Zhang, Wei Lin, and Yu Ding. 2022 · 2022
Later among the works it cites.
Multi-resource interleaving for deep learning training. In ACM SIGCOMM
Yihao Zhao, Yuanqiang Liu, Yanghua Peng, Yibo Zhu, Xuanzhe Liu, and Xin Jin. 2022 · 2022
Later among the works it cites.