2026

2025

SituLM overview

ICME 2025 · Oral

SituLM: Leveraging Visual Instruction Tuning and an Augmented SWiG Dataset for Enhanced Grounded Situation Recognition

Yuran Wang, Zhi-Qi Cheng

In IEEE International Conference on Multimedia and Expo (ICME), Oral presentation, 2025

PaperCode

Foundation Models & Reasoning · Embodied AI & World Models

2024

Human-aware vision-and-language navigation

Human-Aware Vision-and-Language Navigation

Heng Li, Minghan Li, Zhi-Qi Cheng, Yifei Dong, Yuxuan Zhou, Jun-Yan He, Qi Dai, Teruko Mitamura, Alexander Hauptmann

In Advances in Neural Information Processing Systems (NeurIPS), Spotlight presentation, 2024

V2 CodeV1 CodeWebsite

Foundation Models & Reasoning · Embodied AI & World Models

DTIC record preview for the CMU CHRONOS-KAIROS final systems description

CMU CHRONOS-KAIROS Final Systems Description

Teruko Mitamura, David R. Mortensen, Alex Hauptmann, Yiming Yang, Graham Neubig, Anatole Gersham, Alan W. Black, Zhi-Qi Cheng, Susan Holm, Yukari Yamakawa

DARPA KAIROS Final Research Report, 2024

Paper

Foundation Models & Reasoning · Mobility & Public Safety

Prioritize Alignment in Dataset Distillation overview

arXiv 2024

Prioritize Alignment in Dataset Distillation

Zekai Li, Ziyao Guo, Wangbo Zhao, Tianle Zhang, Zhi-Qi Cheng, Samir Khaki, Kaipeng Zhang, Ahmad Sajedi, Konstantinos N. Plataniotis, Kai Wang, et al.

arXiv preprint, 2024

PaperCode

Foundation Models & Reasoning

2023

TrackGPT tracking with human-intent reasoning teaser

arXiv 2023

Tracking with Human-Intent Reasoning

Jiawen Zhu, Zhi-Qi Cheng, Jun-Yan He, Chenyang Li, Bin Luo, Huchuan Lu, Yifeng Geng, Xuansong Xie

arXiv preprint, 2023

Paper

Foundation Models & Reasoning · Embodied AI & World Models · Mobility & Public Safety

≤ 2022

Video eCommerce online video advertising overview

ACM MM 2017 · Oral

Video eCommerce: Towards Online Video Advertising

Zhi-Qi Cheng, Yang Liu, Xiao Wu, Xian-Sheng Hua

In Proceedings of the ACM International Conference on Multimedia (ACM Multimedia), Oral presentation; ACM-SCF Best Student Paper, 2017

Paper

Foundation Models & Reasoning

Multi-view image generation from a single view

ACM MM 2018 · Oral

Multi-View Image Generation from a Single View

Bo Zhao, Xiao Wu, Zhi-Qi Cheng, Hao Liu, Zequn Jie, Jiashi Feng

In Proceedings of the ACM International Conference on Multimedia (ACM Multimedia), Oral presentation, 2018

PaperarXiv

Foundation Models & Reasoning · Embodied AI & World Models

Patents