|
Zhen Li 「李 祯」
I am currently a research intern at Alaya Lab, Shanda AI Research, working closely with Dr. Kaipeng Zhang.
Prior to that, I obtained my Master's degree from Beijing Institute of Technology, advised by
Prof. Yuwei Wu and Prof. Yunde Jia; and my
Bachelor's degree from Beijing Institute of Technology in 2023.
My research interests lie in (1) interactive world models, and (2) the intersection of
vision-and-language and compositional generalization.
Email /
Google Scholar /
Github
|
|
Selected Publications
* indicates equal contribution. 📧 indicates corresponding
author.
|
|
From Pixels to States: Rethinking Interactive World Models as Game
Engines
Zhen Li, Zian Meng, Shuwei Shi, Mingliang Zhai, Jiaming Tan, Chuanhao Li📧, Kaipeng Zhang📧
Arxiv, 2026.07
[Paper]
|
|
Interactive Panoramic World Exploration via Camera Control
Jiaming Tan, Zhen Li, Shuwei Shi, Minggui Teng, Siqi Yang, Bo Zheng, Yuwei Wu📧, Kaipeng Zhang📧, Chuanhao
Li📧
SIGGRAPH Asia, 2026
|
|
AlayaWorld: Long-Horizon and Playable Video World Generation
AlayaWorld Team (as a contributor)
Arxiv, 2026.07
[Project Page] /
[Intro Paper] /
[Technical Report] /
[Code]
|
|
WildWorld: A Large-Scale Dataset for Dynamic World Modeling
with Actions and Explicit State toward Generative ARPG
Zhen Li, Zian Meng, Shuwei Shi, Wenshuo Peng, Bo Zheng, Yunde Jia, Yuwei Wu📧, Chuanhao Li📧,
Kaipeng Zhang📧
ECCV, 2026
[Project Page] /
[Paper] /
[Code]
|
|
Surprise Forcing: What to Remember, When to Skip in
Long Video Generation
Shuwei Shi, Zhen Li, Muyao Niu, Chuanhao Li, Bo Zheng, Kaipeng Zhang📧, Yinqiang Zheng📧
ECCV, 2026
[Paper]
|
|
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video
Generation Model
Maomao Li, Zhen Li, Kaipeng Zhang, Guosheng Yin, Zhifeng Li, Dong Xu
Arxiv, 2026.02
[Project Page] /
[Paper] /
[Code]
|
|
Yume1.5: A Text-Controlled Interactive World Generation Model
Xiaofeng Mao, Zhen Li, Chuanhao Li, Xiaojie Xu, Kaining Ying, Tong He,
Jiangmiao Pang, Yu Qiao, Kaipeng Zhang📧
CVPR, 2026
[Project Page] /
[Paper] /
[Code]
|
|
Composition-Incremental Learning for Compositional Generalization
Zhen Li, Yuwei Wu, Chenchen Jing, Che Sun📧,
Chuanhao Li📧, Yunde Jia
AAAI, 2026
[Paper] /
[Code]
|
|
Sekai: A Video Dataset towards World Exploration
Zhen Li, Chuanhao Li📧, Xiaofeng Mao, Shaoheng
Lin, Ming Li, Shitian Zhao,
Zhaopan Xu, Xinyue Li, Yukang Feng, Jianwen Sun, Zizhen Li, Fanrui Zhang, Jiaxin Ai, Zhixiang Wang,
Yuwei Wu📧, Tong He, Jiangmiao Pang, Yu Qiao, Yunde Jia, Kaipeng
Zhang📧
NeurIPS, 2025
[Project Page] /
[Paper] /
[Code]
|
|
Consistency of Compositional Generalization Across Multiple Levels
Chuanhao Li*, Zhen Li*, Chenchen Jing📧,
Xiaomeng Fan, Wenbo Ye, Yuwei Wu📧, Yunde Jia
AAAI, 2025
[Paper] /
[Code]
|
|
Multi-Sourced Compositional Generalization in Visual Question
Answering
Chuanhao Li*, Wenbo Ye*, Zhen Li, Yuwei Wu📧,
Yunde Jia
IJCAI, 2025
[Paper] /
[Code]
|
|
Compositional Substitutivity of Visual Reasoning for Visual Question
Answering
Chuanhao Li*, Zhen Li*, Chenchen Jing📧, Yuwei
Wu📧, Mingliang Zhai, Yunde Jia
ECCV, 2024
[Paper] /
[Code]
|
|
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language
Models by Searching Up-to-Date Internet Knowledge
Chuanhao Li, Zhen Li, Chenchen Jing, Shuo Liu, Wenqi Shao, Yuwei Wu📧, Ping Luo, Yu Qiao, Kaipeng Zhang📧
NeurIPS, 2024
[Project Page] /
[Paper] /
[Code]
|
|
In-Context Compositional Generalization for Large Vision-Language
Models
Chuanhao Li, Chenchen Jing, Zhen Li, Mingliang Zhai, Yuwei Wu📧, Yunde Jia
EMNLP, 2024
[Paper]
|
|
Exploring the Effect of Primitives for Compositional Generalization in
Vision-and-Language
Chuanhao Li, Zhen Li, Chenchen Jing📧, Yuwei
Wu📧, Yunde Jia
CVPR, 2023
[Paper] /
[Code]
|
|