👨🎓 About Me
I am a third-year Ph.D. student at Peking University, advised by Prof. Xuejun Yang and Prof. Wenjing Yang. I earned my B.E. degree at China University of Geosciences in 2023. Prior to that, I served for two years in the People’s Liberation Army as an assault rifleman and a sniper.
My primary research interest focus on Foundation Models for Multimodal Learning. I am also interested in Causal Inference and Reinforcement Learning. My overarching research goal is to build reliable and generalizable multimodal intelligence, with a focus on developing principled methods that integrate vision, language, and structured reasoning under real-world conditions.
Currently I am working on Efficient Pre-training of Multimodal Large Language Models.
I am actively seeking research discussions and collaboration opportunities, so feel free to contact me (frankyang1517@gmail.com)! 😄
✨ News
- [2026.07] 🎉 Two papers are accepted by ACM MM 2026.
- [2026.06] 🎉 Two papers are accepted by ECCV 2026.
- [2026.05] 🎉 Six papers are accepted by ICML 2026.
- [2026.04] 🎉 One paper is accepted by ACL 2026.
- [2026.02] 🎉 Four papers are accepted by CVPR 2026, including one Highlight.
- [2026.01] 🎉 Six papers are accepted by ICLR 2026.
- [2025.11] 🎉 One paper is accepted by AAAI 2026.
- [2025.09] 🎉 One paper is accepted by NeurIPS 2025.
- [2025.07] 🎉 Two papers are accepted by ACM MM 2025.
- [2025.05] 🎉 One paper is accepted by ICML 2025.
- [2025.02] 🚀 I join the Kling Team at Kuaishou Technology as a research intern.
📝 Publications
* Equal Contribution, † Corresponding Author, ‡ Project Leader, # Core Contributor
🤖 Models & Training
- ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships
Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo - Human-Centric Image Captioning with Subject-Centered Spatial Understanding [ACM MM 2026]
Bozhou Li, Jiahang Zhang, Yue Ding, Yushuo Guan, Bohan Zeng, Yiyan Ji, Xinlong Chen, Yang Shi, Yifan Dai, Yuran Wang, Chengzhuo Tong, Pengfei Wan, Yuanxing Zhang, Wentao Zhang - DOPD: Dual On-policy Distillation
Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan - LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu, Bozhou Li, Yuran Wang, Chengzhuo Tong, Hao Liang, Xiaochen Ma, Junbo Niu, Tianyu Guo, Yang Shi, Yue Ding, Yiyan Ji, Bingyin Mei, Yushuo Guan, Yuanxing Zhang, Pengfei Wan, Fangcheng Fu, Wentao Zhang - Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
Xuanyu Zhu*, Yan Bai*, Yang Shi‡, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou† - OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models [ICML 2026]
Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xinlong Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, Yuanxing Zhang, Jiaheng Liu, Qiang Liu, Pengfei Wan, Liang Wang - DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models [ECCV 2026]
Xinlong Chen, Weihong Lin, Jingyun Hua, Linli Yao, Yue Ding, Bozhou Li, Bohan Zeng, Yang Shi, Qiang Liu, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan - CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation [ICML 2026]
Chengzhuo Tong, Mingkun Chang, Shenglong Zhang, Yuran Wang, Cheng Liang, Zhizheng Zhao, Ruichuan An, Bohan Zeng, Yang Shi, Yifan Dai, Ziming Zhao, Guanbin Li, Pengfei Wan, Yuanxing Zhang, Wentao Zhang - GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models [ECCV 2026]
Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang - Hybrid Attribution Priors for Explainable and Robust Model Training
Zhuoran Zhang, Feng Zhang, Shangyuan Li, Yang Shi, Yuanxing Zhang, Wei Chen, Tengjiao Wang, Kam-Fai Wong - Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling [CVPR 2026 Highlight]
Yuran Wang*, Bohan Zeng*, Chengzhuo Tong, Wenxuan Liu, Yang Shi, Xiaochen Ma, Hao Liang, Yuanxing Zhang, Wentao Zhang† - Monet: Reasoning in Latent Visual Space Beyond Images and Language [CVPR 2026]
Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying†, Yisen Wang† - AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration [ICLR 2026]
Xinlong Chen, Yue Ding, Weihong Lin, Jingyun Hua, Linli Yao, Yang Shi, Bozhou Li, Yuanxing Zhang, Qiang Liu†, Pengfei Wan, Liang Wang, Tieniu Tan - BaseReward: A Strong Baseline for Multimodal Reward Model [ICLR 2026]
Yi-Fan Zhang*, Haihua Yang*‡, Huanyu Zhang, Yang Shi, Zezhou Chen, Haochen Tian, Chaoyou Fu†, Kai Wu, Bo Cui, Xu Wang, Jianfei Pan, Haotian Wang, Zhang Zhang†, Liang Wang - VersaVid-R1: A Versatile Video Understanding and Reasoning Model from Question Answering to Captioning Tasks [ICLR 2026]
Xinlong Chen, Yuanxing Zhang, Yushuo Guan, Bohan Zeng, Yang Shi, Sihan Yang, Pengfei Wan, Qiang Liu†, Liang Wang, Tieniu Tan - Mavors: Multi-granularity Video Representation for Multimodal Large Language Model [ACM MM 2025]
Yang Shi*, Jiaheng Liu*, Yushuo Guan*, Zhenhua Wu, Yuanxing Zhang†, Zihao Wang, Weihong Lin, Jingyun Hua, Zekun Wang, Xinlong Chen, Bohan Zeng, Wentao Zhang, Fuzheng Zhang, Wenjing Yang, Di Zhang - MM-RLHF: The Next Step Forward in Multimodal LLM Alignment [ICML 2025]
Yi-Fan Zhang‡, Tao Yu, Haochen Tian, Chaoyou Fu†, Peiyan Li, Jianshu Zeng, Wulin Xie, Yang Shi, Huanyu Zhang, Junkang Wu, Xue Wang, Yibo Hu, Bin Wen†, Fan Yang, Zhang Zhang†, Tingting Gao, Di Zhang, Liang Wang, Rong Jin, Tieniu Tan - Debiasing Multimodal Large Language Models via Penalization of Language Priors [ACM MM 2025]
Yi-Fan Zhang*, Yang Shi*, Weichen Yu, Qingsong Wen†, Xue Wang, Wenjing Yang, Zhang Zhang, Liang Wang, Rong Jin
💡 Theory & Generalization
- The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss [ICLR 2026]
Bozhou Li, Xinda Xue, Sihan Yang, Yang Shi, Xinlong Chen, Yushuo Guan, Yuanxing Zhang, Wentao Zhang - Unveiling Prior-Data Fitted Networks on Causal Effect Estimation: Pre-Training or Fine-Tuning? [ICML 2026]
Haotian_Wang, Xinpeng Lv, Hao Zou, Yanghao Xiao, Shanzhi Gu, Yang Shi, Yunxin Mao, Yuanxing Zhang, Mingyang Geng, Shaowu Yang, Haoxuan Li, Wenjing Yang, Peng Cui, Zhouchen Lin - Detecting Unobserved Confounders: A Kernelized Regression Approach [AAAI 2026]
Yikai Chen, Yunxin Mao, Hao Zou, Chunyuan Zheng, Shanzhi Gu, Haotian Wang, Shixuan Liu, Yang Shi, Kun Kuang, Wenjing Yang - When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs [ICML 2026]
Zhuoran Zhang, Tengyue Wang, Xilin Gong, Yang Shi, Haotian Wang, Di Wang, Lijie Hu - Transformers with Endogenous In-Context Learning: Bias Characterization and Mitigation [ICLR 2026]
Haotian Wang, Haoxuan Li, Hao Zou, Haoang Chi, Yang Shi, Yuanxing Zhang, Wenjing Yang, Xinwang Liu, Zhouchen Lin - Identifying Outcome-Oriented Root Causes via Cross Regression
Haotian Wang, Hao Zou, Haoxuan Li, Yang Shi, Yuanxing Zhang, Kun Kuang, Wenjing Yang, Xinwang Liu, Peng Cui - Beyond Rational Illusion: Behaviorally Realistic Strategic Classification [ICML 2026]
Xinpeng Lv, Haotian Wang, Renzhe Xu, Yunxin Mao, Yang Shi, Siyang Gao, Xinwang Liu, Wenjing Yang - A Unified and Data-Efficient Framework for Out-of-Distribution and Generalization
Zhaohui Hu, Hongli Xiao, Yonglin Li, Chuan Li, Yang Shi, Mengzhu Wang, Haotian Wang, Long Lan
📊 Benchmarks & Evaluation
- KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi†, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang - MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi†, Jialu Chen, Yuanxing Zhang, Huaxiong Li - LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
Tengfei Liu, Yang Shi†, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Haotian Wang†, Yuanxing Zhang‡, Pengfei Wan, Leye Wang† - Video* Bench: Benchmarking Fine-grained Video Perception with ‘‘Think with Videos’’ [ACM MM 2026]
Ruizhe Chen, Zhiting Fan, Yang Shi, Enxin Song, Wenhao Chai, Tongkun Guan, Songtao Jiang, Ruilin Luo, Yuanxing Zhang, Shuai Bai, Sibo Song, Zhibo Yang, Zuozhu Liu - CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales
Xinlong Chen, Jiafu Tang, Yue Ding, Yizhuo Jia, Bozhou Li, Bohan Zeng, Yang Shi, Shihao Li, Yiyan Ji, Qiang Liu, Weihong Lin, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan - MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation
Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan - Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
Yuqi Tang*, Yang Shi*‡, Zhuoran Zhang*, Qixun Wang*, Xuehai Bai, Yue Ding, Ruizhe Chen, Bohan Zeng, Xinlong Chen, Xuanyu Zhu, Bozhou Li, Yuran Wang, Yifan Dai, Chengzhuo Tong, Xinyu Liu, Yiyan Ji, Yujie Wei, Yuhao Dong, Shilin Yan, Fengxiang Wang, Yi-Fan Zhang†, Haotian Wang†, Yuanxing Zhang†, Pengfei Wan - Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
Xuehai Bai*, Yang Shi*, YiFan Zhang*‡, Xuanyu Zhu, Yuran Wang, Yifan Dai, Xinyu Liu, Yiyan Ji, Xiaoling Gu†, Yuanxing Zhang† - Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
Video-MME Team (Acknowledgement: Yang Shi) - Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang - VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining
Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, Yi-Fan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou - BrowseComp-V^3: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents
Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Dan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui - MorphoBench: A Benchmark with Difficulty Adaptive to Model Reasoning [ACL 2026]
Xukai Wang*, Xuanbo Liu*, Mingrui Chen*, Haitian Zhong*, Xuanlin Yang*, Bohan Zeng*, Jinbo Hu*, Hao Liang, Junbo Niu, Xuchen Li, Ruitao Wu, Ruichuan An, Yang Shi, Liu Liu, Xu-Yao Zhang, Qiang Liu, Zhouchen Lin, Wentao Zhang†, Bin Dong† - RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark [CVPR 2026]
Yang Shi#, Yuhao Dong#‡, Yue Ding#, Yuran Wang#, Xuanyu Zhu#, Sheng Zhou#, Wenting Liu#, Haochen Tian#, Rundong Wang#, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Chaoyou Fu, Qiang Liu, Haotian Wang†, Wenjing Yang, Yuanxing Zhang†, Pengfei Wan, Yi-Fan Zhang†, Ziwei Liu† - MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios [NeurIPS 2025]
Yang Shi#, Huanqian Wang#, Wulin Xie#, Huanyao Zhang#, Lijie Zhao#, Yi-Fan Zhang#†, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yuanxing Zhang‡, Pengfei Wan, Haotian Wang†, Wenjing Yang† - MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models [ICLR 2026]
Wulin Xie*, Yi-Fan Zhang*‡, Chaoyou Fu, Yang Shi, Bingyan Nie, Hongkai Chen, Zhang Zhang, Liang Wang, Tieniu Tan - EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents [CVPR 2026 Workshop]
Zhili Cheng‡, Yuge Tu#, Ran Li#, Shiqi Dai#, Jinyi Hu#‡, Shengding Hu, Jiahao Li, Yang Shi, Tianyu Yu, Weize Chen, Lei Shi, Maosong Sun†
🗃️ Datasets & Open Source
- OpenWorldLib: A Unified Codebase and Definition of Advanced World Models
DataFlow Team (Contributor: Yang Shi) - OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing [ICML 2026]
Zhihong Chen*, Xuehai Bai*, Yang Shi*, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang†, Pengfei Wan, Yi-Fan Zhang†‡
📚 Surveys & Perspectives
- Research on World Models Is Not Merely Injecting World Knowledge into Specific Tasks
Bohan Zeng, Kaixin Zhu, Daili Hua, Bozhou Li, Chengzhuo Tong, Yuran Wang, Xinyi Huang, Yifan Dai, Zixiang Zhang, Yifan Yang, Zhou Liu, Hao Liang, Xiaochen Ma, Ruichuan An, Tianyi Bai, Hongcheng Gao, Junbo Niu, Yang Shi, Xinlong Chen, Yue Ding, Minglei Shi, Kai Zeng, Yiwen Tang, Yuanxing Zhang, Pengfei Wan, Xintao Wang, Wentao Zhang - Towards Efficient Multimodal Large Language Models: A Survey on Token Compression
Linli Yao*, Long Xing*, Yang Shi*, Sida Li, Yuanxin Liu, Yuhao Dong, Yi-Fan Zhang, Lei Li, Qingxiu Dong, Xiaoyi Dong, Qidong Huang, Haotian Wang, Feng Wu, Yuanxing Zhang, Pengfei Wan, Zhouchen Lin†, Xu Sun† - A Survey of Unified Multimodal Understanding and Generation: Advances and Challenges
Yan Yang*, Haochen Tian*, Yang Shi*, Wulin Xie*, Yi-Fan Zhang†, Yuhao Dong, Yibo Hu, Liang Wang, Ran He, Caifeng Shan, Chaoyou Fu†, Tieniu Tan
👨💻 Work Experience
- Research Intern at Kling AI, Kuaishou Technology, 2025.02 - Present
- In collaboration with Dr. Yuanxing Zhang
- Visiting Student at THUNLP, Tsinghua University, 2023.11 - 2025.02
- In collaboration with Prof. Zhiyuan Liu
- Visiting Student at Intelligent Game and Decision Lab, Academy of Military Sciences, 2023.09 - Present
- In collaboration with Prof. Shixuan Liu
- Visiting Student at State Key Laboratory of High Performance Computing, National University of Defense Technology, 2023.09 - Present
- In collaboration with Prof. Haotian Wang and Prof. Haoang Chi
📖 Education
- Ph.D. School of Computer Science, Peking University, 2023 - Present
- B.E. School of Computer Science, China University of Geosciences, 2019 - 2023
🎖 Honors and Awards
- Ruiming Alumni Scholarship, 1‰ , 2021
- China National Scholarship, 0.2% , 2020
- Outstanding Soldier Award, 2019
- Outstanding Soldier Award, 2018