About Me

I am a researcher at the UI-Venus Team, Ant Group. I received my Ph.D. in Computer Science from Shanghai Jiao Tong University in 2022, advised by Professor Liqing Zhang. Prior to that, I obtained my B.Sc. in Mathematics from SJTU in 2016.

My research benefits from collaboration with esteemed colleagues including Mr. Haoxing Chen, and Mr. Zhuoer Xu.

Research Interest

My current focus is GUI/CLI agents and multimodal LLaDA models:

GUI/CLI Agents

Building agents for mobile-use and computer-use scenarios, covering GUI grounding, navigation, and automation with multimodal large models.

Multimodal LLaDA

Studying multimodal LLaDA models and their applications in agent and vision-language tasks.

Experiences

Researcher | UI-Venus Team, Ant Group

2022 – Present

Ph.D. in Computer Science | Shanghai Jiao Tong University

2016 – 2022. Advisor: Prof. Liqing Zhang

B.Sc. in Mathematics | Shanghai Jiao Tong University

2012 – 2016

Selected Publications Google Scholar

2026

UI-Venus-1.5 Technical Report
Venus-Team: Changlong Gao*, Zhangxuan Gu*, Yulin Liu*, Xinyu Qiu*, Shuheng Shen*, Yue Wen*, Tianyu Xia*, Zhenyu Xu*, Zhengwen Zeng*, Beitong Zhou*, Xingran Zhou*, Weizhi Chen, Sunhao Dai, Jingya Dou, Yichen Gong, Yuan Guo, Zhenlin Guo, Feng Li, Qian Li, Jinzhen Lin, Yuqi Zhou, Linchao Zhu, Liang Chen, Zhenyu Guo, Changhua Meng, Weiqiang Wang
Arxiv, 2026
VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics
Yichen Gong*, Zhuohan Cai*, Sunhao Dai*, Yuqi Zhou*, Zhangxuan Gu*, Changhua Meng, Shuheng Shen
ICML 2026 CCF-A Oral
GUI-SAGE: Enhancing GUI Automation with Self-Explanatory Learning
Fei Tang, Zhangxuan Gu, Zhengxi Lu, Shangzhan Zhang, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Yueting Zhuang
CVPR 2026 CCF-A

2025

VenusBench-GD: A Comprehensive Multi-Platform GUI Benchmark for Diverse Grounding Tasks
Beitong Zhou*, Zhexiao Huang*, Yuan Guo*, Zhangxuan Gu*, Tianyu Xia, Zichen Luo, Fei Tang, Dehan Kong, Yanyi Shang, Suling Ou, Zhenlin Guo, Changhua Meng, Shuheng Shen
Arxiv, 2025
GUI-G2: Gaussian Reward Modeling for GUI Grounding
Fei Tang, Zhangxuan Gu, Zhengxi Lu, Xuyang Liu, Shuheng Shen, Changhua Meng, Wen Wang, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang
AAAI 2025 CCF-A
UI-Venus Technical Report: Building High-performance UI Agents with RFT
Zhangxuan Gu*, Zhengwen Zeng*, Zhenyu Xu*, Xingran Zhou*, Shuheng Shen*^, Yunfei Liu*, Beitong Zhou*, Changhua Meng, Tianyu Xia, Weizhi Chen, Yue Wen, Jingya Dou, Fei Tang, Jinzhen Lin, Yulin Liu, Zhenlin Guo, Yichen Gong, Heng Jia, Changlong Gao, Yuan Guo, Yong Deng, Zhenyu Guo, Liang Chen, Weiqiang Wang
Arxiv, 2025
Conditional Prototype Rectification Prompt Learning
Haoxing Chen, Yaohui Li, Zizheng Huang, Yan Hong, Zhuoer Xu, Zhangxuan Gu^, Jun Lan, Huijia Zhu, Weiqiang Wang
TCSVT, 2025 CCF-B
Efficient Transfer Learning for Video-Language Foundation Models
Haoxing Chen, Zizheng Huang, Yan Hong, Yanshuo Wang, Zhongcai Lyu, Zhuoer Xu, Jun Lan, Zhangxuan Gu^
CVPR 2025 CCF-A

2024

PC2: Pseudo-Classification Based Pseudo-Captioning for Noisy Correspondence Learning in Cross-Modal Retrieval
Yue Duan, Zhangxuan Gu, Zhenzhe Ying, Lei Qi, Changhua Meng, Yinghuan Shi
ACM MM 2024 CCF-A
DiffusionInst: Diffusion Model for Instance Segmentation
Zhangxuan Gu, Haoxing Chen, Zhuoer Xu, Jun Lan, Changhua Meng, Weiqiang Wang
ICASSP 2024 CCF-B Oral
Segment Anything Model Meets Image Harmonization
Haoxing Chen, Yaohui Li, Zhangxuan Gu, Zhuoer Xu, Jun Lan, Huaxiong Li
ICASSP 2024 CCF-B
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
Haoxing Chen, Yan Hong, Zizheng Huang, Zhuoer Xu, Zhangxuan Gu^, Yaohui Li, Jun Lan, Huijia Zhu, Jianfu Zhang, Weiqiang Wang, Huaxiong Li
Arxiv, 2024

2023

Mobile User Interface Element Detection Via Adaptively Prompt Tuning
Zhangxuan Gu, Zhuoer Xu, Haoxing Chen, Jun Lan, Changhua Meng, Weiqiang Wang
CVPR 2023 CCF-A
DiffUTE: Universal Text Editing Diffusion Model
Haoxing Chen, Zhuoer Xu, Zhangxuan Gu^, Jun Lan, Xing Zheng, Yaohui Li, Changhua Meng, Huijia Zhu, Weiqiang Wang
NeurIPS 2023 CCF-A
Hierarchical Dynamic Image Harmonization
Haoxing Chen, Zhangxuan Gu, Yaohui Li, Jun Lan, Changhua Meng, Weiqiang Wang, Huaxiong Li
ACM MM 2023 CCF-A Oral
Boosting Audio-Visual Zero-Shot Learning with Large Language Models
Haoxing Chen, Yaohui Li, Yan Hong, Zizheng Huang, Zhuoer Xu, Zhangxuan Gu, Jun Lan, Huijia Zhu, Weiqiang Wang
Arxiv, 2023
Backpropagation Path Search on Adversarial Transferability
Zhuoer Xu, Zhangxuan Gu, Jianping Zhang, Shiwen Cui, Changhua Meng, Weiqiang Wang
ICCV 2023 CCF-A

2022

Context-aware Feature Generation for Zero-shot Semantic Segmentation
Zhangxuan Gu, Siyuan Zhou, Li Niu, Zihan Zhao, Liqing Zhang
ACM MM 2022 CCF-A
XYLayoutLM: Towards Layout-Aware Multimodal Networks For Visually-Rich Document Understanding
Zhangxuan Gu, Changhua Meng, Ke Wang, Jun Lan, Weiqiang Wang, Ming Gu, Liqing Zhang
CVPR 2022 CCF-A
From Pixel to Patch: Synthesize Context-aware Features for Zero-shot Semantic Segmentation
Zhangxuan Gu, Siyuan Zhou, Li Niu, Zihan Zhao, Liqing Zhang
TNNLS, 2022 CCF-B
STC: Spatio-Temporal Contrastive Learning for Video Instance Segmentation
Zhengkai Jiang*, Zhangxuan Gu*, Jinlong Peng, Hang Zhou, Liang Liu, Yabiao Wang, Ying Tai, Chengjie Wang, Liqing Zhang
ECCV 2022 CCF-B

2020

Hard Pixel Mining for Depth Privileged Semantic Segmentation
Zhangxuan Gu, Li Niu, Haohua Zhao, Liqing Zhang
TMM, 2020 CCF-A