Ax Zhouhao Sun, Xuan Zhang, Xiao Ding, Bibo Cai, Li Du, Kai Xiong, Xinran Dai, Fei Zhang, weidi tang, Zhiyuan Kan, Yang Zhao, Bing Qin, Ting Liu 5/6/2026

GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models

Benchmark for evaluating process reward models across diverse reasoning tasks beyond mathematics, enabling detection of intermediate reasoning errors.

Ax Haowen Hu, Pengzhou Cheng, Zheng Wu, Lingzhong Dong, Gongshen Liu, Zhuosheng Zhang 5/6/2026

Faithful Mobile GUI Agents with Guided Advantage Estimator

Framework improving faithfulness in vision-language GUI agents by grounding actions in screen evidence and user instructions via guided advantage estimation.

Ax Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li 5/6/2026

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

Policy optimization method aligning RL credit assignment with natural reasoning steps in multi-modal tasks at segment granularity rather than token or sequence level.

Ax Qisong Zhang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Wenzhuo Wu (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Zhuangzhuang Jia (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Yunhao Yang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Huayu Zhang (Institute of Artificial Intelligence), Xianghao Zang (Institute of Artificial Intelligence), Zhixiang He (Institute of Artificial Intelligence), Zhongjiang He (Institute of Artificial Intelligence), Kongming Liang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Zhanyu Ma (School of Artificial Intelligence, Beijing University of Posts and Telecommunications) 5/6/2026

DataEvolver: Let Your Data Build and Improve Itself via Goal-Driven Loop Agents

DataEvolver: closed-loop visual data generation system using goal-driven agents for iterative dataset creation and improvement.

Ax George Fatouros, Georgios Makridis, John Soldatos, Dimosthenis Kyriazis, Pedro Malo, George Kousiouris, Giannis Ledakis, Louiza Kachrimani, Panagiotis Rizomiliotis, Bruno Almeida, Despina Tomkou, Kostas Metaxas, Konstantinos Ilias, Christos Gkizelis, Ernstjan de Gooyert, Amin Babazadeh, Kostis Mavrogiorgos, Pepi Paraskevoulakou, Christos Xenakis, Giannis Chouchoulis, Konstantina Tripodi 5/6/2026

CyberAId: AI-Driven Cybersecurity for Financial Service Providers

AI-driven cybersecurity system for financial institutions using LLMs to enhance SOC reasoning capacity and alert investigation.

Ax Alexander Smola 5/6/2026

Submodular Benchmark Selection

arXiv paper formalizing efficient benchmark selection for LLM evaluation as submodular maximization problem.