About
This is Ruoyu Feng (冯若愚), working in ByteDance Seedance Team. I received my Ph.D. degree from MOE-Microsoft Key Laboratory of Multimedia Computing and Communication, University of Science and Technology of China (USTC) in June 2025, supervised by Zhibo Chen.
Before that, I spent my undergraduate years in the Automation Department of Southeast University, from 2016 to 2020, and received the National Scholarship in 2019.
I was a research intern at Intelligent Multimedia Group of MSRA from March 2023 to September 2024 under the supervision of Chong Luo.
My research interests mainly focus on diffusion models, image/video generation, and AIGC.
Work Experience
Algorithm Engineer | ByteDance
Seedance Team
Jun. 2026 - Present
Researcher | ByteDance
Douyin Content Group
Jun. 2025 - Jun. 2026
Research Intern | Microsoft Research Asia (MSRA)
Intelligent Multimedia Group
Mar. 2023 - Sep. 2024
Education
Ph.D. | University of Science and Technology of China (USTC)
Information and Communication Engineering
Sep. 2020 - Jun. 2025
B.E. | Southeast University (SEU)
Automation
Sep. 2016 - Jun. 2020
News
Selected Publications
View All →SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
Ruoyu Feng, Jinming Liu, Yuqi Wang, Xin Cheng, Boyuan Liu, Shanglin Li, Hanshen Zhu, Wenfeng Lin, Mingyu Guo, Xin Jin
arXiv preprint arXiv:2606.22568 (2026)
A text-to-image foundation model built on semantic-first diffusion, achieving strong performance with highly efficient training.
Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
Yueming Pan†, Ruoyu Feng†, Qi Dai, Yuqi Wang, Wenfeng Lin, Mingyu Guo, Chong Luo, Nanning Zheng
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2026)
Harmonizing semantic and texture modeling with asynchronous latent diffusion, accepted by CVPR 2026.
Generation Navigator: A State-Aware Agentic Framework for Image Generation
Jinming Liu, Ruoyu Feng, Yuqi Wang, Wenjun Zeng, Xin Jin
arXiv preprint arXiv:2605.17969 (2026)
A state-aware multi-turn agent framework for dynamically steering text-to-image generation.
Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior
Ruoyu Feng, Yunpeng Qi, Jinming Liu, Yixin Gao, Xin Li, Xin Jin, Zhibo Chen
The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS) (2025)
Harmonizing machine and human vision in image compression using generative priors from diffusion models.
CCEdit: Creative and Controllable Video Editing via Diffusion Models
Ruoyu Feng, Wenming Weng, Yanhui Wang, Yuhui Yuan, Jianmin Bao, Chong Luo, Zhibo Chen, Baining Guo
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024)
Creative and controllable video editing framework using diffusion models.
MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation
Yanhui Wang, Jianmin Bao, Wenming Weng, Ruoyu Feng, Dacheng Yin, Tao Yang, Jingxu Zhang, Qi Dai, Zhiyuan Zhao, Chunyu Wang, Kai Qiu, Yuhui Yuan, Xiaoyan Sun, Chong Luo, Baining Guo
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR Highlight) (2024)
Divide-and-conquer approach for text-to-video generation, accepted as CVPR Highlight.
ART·V: Auto-Regressive Text-to-Video Generation with Diffusion Models
Wenming Weng, Ruoyu Feng, Yanhui Wang, Qi Dai, Chunyu Wang, Dacheng Yin, Zhiyuan Zhao, Kai Qiu, Jianmin Bao, Yuhui Yuan, Chong Luo, Yueyi Zhang, Zhiwei Xiong
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024)
Auto-regressive text-to-video generation framework with diffusion models.
