Fetching the paper…
Reading the bibliography…
Inversion-based image editing is rapidly gaining momentum while suffering from significant computation overhead, hindering its application in real-time interactive scenarios.
High-resolution image synthesis and semantic manipulation with conditional gans, 2018
Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu, Andrew Tao, Jan Kautz, and Bryan Catanzaro · 2018
Earlier work this paper cites.
Denoising diffusion probabilistic models
Jonathan Ho, Ajay Jain, and Pieter Abbeel · 2020
Earlier work this paper cites.
Flashattention: Fast and memory-efficient exact attention with io-awareness, 2022
Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra, and Christopher Ré · 2022
Earlier work this paper cites.
Prompt-to-prompt image editing with cross attention control
A. Hertz, R. Mokady, J. Tenenbaum, K. Aberman, Y. Pritch, and D. Cohen-Or · 2022
Earlier work this paper cites.
Flow straight and fast: Learning to generate and transfer data with rectified flow, 2022
Xingchao Liu, Chengyue Gong, and Qiang Liu · 2022
Earlier work this paper cites.
Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps, 2022
Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, and Jun Zhu · 2022
Earlier work this paper cites.
Visual knowledge graph for human action reasoning in videos
Yue Ma, Yali Wang, Yue Wu, Ziyu Lyu, Siran Chen, Xiu Li, and Yu Qiao · 2022
Earlier work this paper cites.
Null-text inversion for editing real images using guided diffusion models
R. Mokady, A. Hertz, K. Aberman, Y. Pritch, and D. Cohen-Or · 2022
Earlier work this paper cites.
High-resolution image synthesis with latent diffusion models
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer · 2022
Earlier work this paper cites.
Denoising diffusion implicit models
J. Song, C. Meng, and S. Ermon · 2022
Earlier work this paper cites.
Cliptexture: Text-driven texture synthesis
Yiren Song · 2022
Earlier work this paper cites.
Clipfont: Text guided vector wordart generation
Yiren Song and Yuxuan Zhang · 2022
Earlier work this paper cites.
Dccf: Deep comprehensible color filter learning framework for high-resolution image harmonization, 2022
Ben Xue, Shenghui Ran, Quan Chen, Rongfei Jia, Binqiang Zhao, and Xing Tang · 2022
Earlier work this paper cites.
Token merging for fast stable diffusion
Daniel Bolya and Judy Hoffman · 2023
Earlier work this paper cites.
Token merging: Your vit but faster, 2023
Daniel Bolya, Cheng-Yang Fu, Xiaoliang Dai, Peizhao Zhang, Christoph Feichtenhofer, and Judy Hoffman · 2023
Earlier work this paper cites.
Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing, 2023
Mingdeng Cao, Xintao Wang, Zhongang Qi, Ying Shan, Xiaohu Qie, and Yinqiang Zheng · 2023
Earlier work this paper cites.
Flow matching for generative modeling
Y. Lipman, R.T.Q. Chen, H. Ben-Hamu, M. Nickel, and M. Le · 2023
Earlier work this paper cites.
Effective real image editing with accelerated iterative diffusion inversion
Z. Pan, R. Gherardi, X. Xie, and S. Huang · 2023
Earlier work this paper cites.
Scalable diffusion models with transformers
William Peebles and Saining Xie · 2023
Earlier work this paper cites.
Dragdiffusion: Harnessing diffusion models for interactive point-based image editing
Yujun Shi, Chuhui Xue, Jiachun Pan, Wenqing Zhang, Vincent YF Tan, and Song Bai · 2023
Earlier work this paper cites.
Clipvg: Text-guided image manipulation using differentiable vector graphics
Yiren Song, Xuning Shao, Kang Chen, Weidong Zhang, Zhongliang Jing, and Minzhe Li · 2023
Earlier work this paper cites.
Inversion-free image editing with natural language
S. Xu, Y. Huang, J. Pan, Z. Ma, and J. Chai · 2023
Cited alongside, same era.
Pointnorm: Dual normalization is all you need for point cloud analysis
Shen Zheng, Jinqian Pan, Changjie Lu, and Gaurav Gupta · 2023
Cited alongside, same era.
Follow-your-canvas: Higher-resolution video outpainting with extensive content generation
Qihua Chen, Yue Ma, Hongfa Wang, Junkun Yuan, Wenzhe Zhao, Qi Tian, Hongmei Wang, Shaobo Min, Qifeng Chen, and Wei Liu · 2024
Cited alongside, same era.
Fluxspace: Disentangled semantic editing in rectified flow transformers
Y. Dalva, K. Venkatesh, and P. Yanardag · 2024
Cited alongside, same era.
Scaling rectified flow transformers for high-resolution image synthesis, 2024
Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, Dustin Podell, Tim Dockhorn, Zion English, Kyle Lacey, Alex Goodwin, Yannik Marek, and Robin Rombach · 2024
Cited alongside, same era.
Fastdrag: Manipulate anything in one step
Xuanjia Zhao, Jian Guan, Congyi Fan, Dongli Xu, Youtian Lin, Haiwei Pan, and Pengming Feng · 2024
Later among the works it cites.
Tpsence: Towards artifact-free realistic rain generation for deraining and object detection in rain
Shen Zheng, Changjie Lu, and Srinivasa G Narasimhan · 2024
Later among the works it cites.
Stable diffusion 2.1 base
Stability AI · 2025
Closest in time.
Transanimate: Taming layer diffusion to generate rgba video
Xuewei Chen, Zhimin Chen, and Yiren Song · 2025
Closest in time.
Stable diffusion v1.4
CompVis · 2025
Closest in time.
Dit4edit: Diffusion transformer for image editing
Kunyu Feng, Yue Ma, Bingyuan Wang, Chenyang Qi, Haozhe Chen, Qifeng Chen, and Zeyu Wang · 2025
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Dit4edit: Diffusion transformer for image editing
Kunyu Feng, Yue Ma, Bingyuan Wang, Chenyang Qi, Haozhe Chen, Qifeng Chen, and Zeyu Wang · 2024
Cited alongside, same era.
Dual-prior augmented decoding network for long tail distribution in hoi detection
Jiayi Gao, Kongming Liang, Tao Wei, Wei Chen, Zhanyu Ma, and Jun Guo · 2024
Cited alongside, same era.
Pnp inversion: Boosting diffusion-based editing with 3 lines of code
Xuan Ju, Ailing Zeng, Yuxuan Bian, Shaoteng Liu, and Qiang Xu · 2024
Cited alongside, same era.
Flowedit: Inversion-free text-based editing using pre-trained flow models
Vladimir Kulikov, Matan Kleiner, Inbar Huberman-Spiegelglas, and Tomer Michaeli · 2024
Cited alongside, same era.
Common diffusion noise schedules and sample steps are flawed
S. Lin, B. Liu, J. Li, and X. Yang · 2024
Cited alongside, same era.
Regiondrag: Fast region-based image editing with diffusion models, 2024
Jingyi Lu, Xinghui Li, and Kai Han · 2024
Cited alongside, same era.
Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation
Yue Ma, Hongyu Liu, Hongfa Wang, Heng Pan, Yingqing He, Junkun Yuan, Ailing Zeng, Chengfei Cai, Heung-Yeung Shum, Wei Liu, et al · 2024
Cited alongside, same era.
Relationadapter: Learning and transferring visual relation with diffusion transformers
Yan Gong, Yiren Song, Yicheng Li, Chenglin Li, and Yin Zhang · 2025
Closest in time.
Photodoodle: Learning artistic image editing from few-shot pairwise data
Shijie Huang, Yiren Song, Yuxuan Zhang, Hailong Guo, Xueyin Wang, Mike Zheng Shou, and Jiaming Liu · 2025
Closest in time.
Siqi Hui, Yiren Song, Sanping Zhou, Ye Deng, Wenli Huang, and Jinjun Wang · 2025
Closest in time.
Personalized vision via visual in-context learning
Yuxin Jiang, Yuchao Gu, Yiren Song, Ivor Tsang, and Mike Zheng Shou · 2025
Closest in time.
Flux.1-dev
Black Forest Labs · 2025
Closest in time.
Easytext: Controllable diffusion transformer for multilingual text rendering
Runnan Lu, Yuxuan Zhang, Jiaming Liu, Haofan Wang, and Yiren Song · 2025
Closest in time.
Wordcon: Word-level typography control in scene text rendering
Wenda Shi, Yiren Song, Zihan Rao, Dengming Zhang, Jiaming Liu, and Xingxing Zou · 2025
Closest in time.
Lcm dreamshaper v7
SimianLuo · 2025
Closest in time.
Pie-bench: Prompt-driven image editing benchmark
PIE-Bench Team · 2025
Closest in time.
Regiondrag: Interactive region-based image editing
Visual AI Team · 2025
Closest in time.
Diffdecompose: Layer-wise decomposition of alpha-composited images via diffusion transformers
Zitong Wang, Hang Zhao, Qianyu Zhou, Xuequan Lu, Xiangtai Li, and Yiren Song · 2025
Closest in time.
Dreamrelation: Relation-centric video customization
Yujie Wei, Shiwei Zhang, Hangjie Yuan, Biao Gong, Longxiang Tang, Xiang Wang, Haonan Qiu, Hengjia Li, Shuai Tan, Yingya Zhang, et al · 2025
Closest in time.
Videograin: Modulating space-time attention for multi-grained video editing
Xiangpeng Yang, Linchao Zhu, Hehe Fan, and Yi Yang · 2025
Closest in time.
Kv-edit: Training-free image editing for precise background preservation
Tianrui Zhu, Shiyi Zhang, Jiawei Shao, and Yansong Tang · 2025
Closest in time.