I am an undergraduate student majoring in Artificial Intelligence at Xi'an Jiaotong University.
My research interests include World Models, Embodied AI, Diffusion Models, Vision-Language-Action Models, and Robotics Reinforcement Learning.
I am currently working on generative world models for autonomous driving and robotic manipulation, with a focus on long-horizon prediction, cross-view consistency, closed-loop learning, and robot-centric video generation.
- World Models for Embodied AI
- Diffusion Models and Flow Matching
- Vision-Language-Action Models
- Robotic Manipulation and Reinforcement Learning
- Autonomous Driving Simulation and Planning
- Video Prediction and Multi-step Visual Reasoning
Xi'an Jiaotong University
B.E. in Artificial Intelligence, 2023 - Present
GPA: 93.59 / 100, Rank: 2 / 66
CVPR Workshop 2026
First Author
World-Action reinforcement learning for robotics.
We jointly optimize the actor and world model with reconstruction rewards and online video SFT, improving long-horizon manipulation performance on LIBERO and RLBench.
NeurIPS 2026 Under Review
First Author
Egocentric 4D world model for robotic manipulation.
We propose a geometry-constrained wrist-view generation framework that improves temporal and cross-view consistency for robot-centric interaction.
NeurIPS 2026 Under Review
First Author
Video reasoning with hierarchical diffusion.
We design a tree-structured latent hierarchy for coarse-to-fine visual reasoning, improving long-horizon logical consistency while preserving streaming efficiency.
ICME 2026 Spotlight
First Author
Cross-domain world modeling for autonomous driving.
We disentangle geometry and city style to improve cross-city generalization in generative driving simulation.
ACM MM Under Review
Co-first Author
On-policy reinforcement learning for flow-matching planners.
We introduce relational reward shaping and advantage-weighted updates to reduce long-tail safety failures in autonomous driving planning.
ACM MM Under Review
Co-first Author
Closed-loop generative world model for autonomous driving.
We integrate reward guidance into diffusion-based video generation to reduce trajectory drift and improve long-horizon temporal consistency.
ICRA 2025 Poster
Third Author
Generative world model for autonomous driving.
We propose a dual-branch diffusion framework with semantic fusion to improve high-fidelity multi-view video generation.
-
Beijing Humanoid Innovation Center, Research Intern
Working on world model acceleration, causal closed-loop generation, and Vision-Action RL for real-world humanoid deployment. -
HMI Lab, Peking University, Research Intern
Working with Prof. Shanghang Zhang on large-scale world models, wrist-view generation, and embodied AI. -
Cytoderm, Research Intern
Developed video-prediction-policy variants and RL-based control modules for desktop robotic manipulation. -
IAIR, Xi'an Jiaotong University, Research Intern
Worked on diffusion-based world models and simulation engines for autonomous driving.
- Programming Languages: Python, C++
- Deep Learning Frameworks: PyTorch, TensorFlow
- Large-Scale Training: DeepSpeed, FSDP, multi-node distributed training
- Robotics and Simulation: ROS, LeRobot
- Research Topics: Diffusion Models, World Models, VLA, Reinforcement Learning, Embodied AI
- National Scholarship
- National First Prize, RoboMaster Mech Master Super Competition, 2024
- Gold Medal, ICPC Shaanxi Provincial Contest, 2024
- Provincial First Prize, CUMCM, 2024
- Email: zezhongqian@stu.xjtu.edu.cn
- GitHub: XuWuLingYu


