Thinking Beyond Videos:
Unifying Video Reasoning and Deep Research for Open-World Video Agents

Wenqi Liu1,*, Shijie Ma2,*, Yunxiao Wang1,*, Meng Liu1, Qile Su3, Han Liu4,
Bohan Hou5, Zeyu Wang1, Xuanyu Zheng6, Changyi Liu6, Tianke Zhang6, Haonan Fan6,
Kaiyu Jiang6, Yingxin Li6, Jiankang Chen6, Xu Wang6, Hongyi Fu6, Jianxiong Wang6,
Bin Wen6,‡, Tingting Gao6, Han Li6, Jianhua Yin1, Yinwei Wei1,†, Xuemeng Song7,†

*Equal contribution, Corresponding author, Project Leader.
1Shandong University, 2Institute of Automation, Chinese Academy of Sciences, 3Beihang University, 4City University of Hong Kong, 5Nanyang Technological University, 6Kuaishou Technology, 7Southern University of Science and Technology

Coming Soon

More experimental analyses, training code, data, and benchmarks will be released soon.

Interactive Case Study

1 / 2

BibTeX

@article{liu2026thinking,
  title={Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents},
  author={Liu, Wenqi and Ma, Shijie and Wang, Yunxiao and Liu, Meng and Su, Qile and Liu, Han and Hou, Bohan and Wang, Zeyu and Zheng, Xuanyu and Liu, Changyi and Zhang, Tianke and Fan, Haonan and Jiang, Kaiyu and Li, Yingxin and Chen, Jiankang and Wang, Xu and Fu, Hongyi and Wang, Jianxiong and Wen, Bin and Gao, Tingting and Li, Han and Yin, Jianhua and Wei, Yinwei and Song, Xuemeng},
  journal={arXiv preprint arXiv:2608.23329},
  year={2026}
}