Ax Han Li, Yifan Yao, Letian Zhu, Rili Feng, Hongyi Ye, Jiaming Wang, Yancheng He, Pengyu Zou, Lehan Zhang, Xinping Lei, Haoyang Huang, Ken Deng, Ming Sun, Zhaoxiang Zhang, He Ye, Jiaheng Liu 4/16/2026

CodeTracer: Towards Traceable Agent States

CodeTracer framework for debugging and tracing AI agent state transitions, error propagation, and tool orchestration in code agents.

Ax Hevish Cowlessur, Chandra Thapa, Tansu Alpcan, Seyit Camtepe 4/16/2026

Parameter-efficient Quantum Multi-task Learning

Parameter-efficient quantum multi-task learning with shared backbone and task-specific heads for quantum neural networks.

Ax Xiaohua Wang, Muzhao Tian, Yuqi Zeng, Zisu Huang, Jiakang Yuan, Bowen Chen, Jingwen Xu, Mingbo Zhou, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang 4/16/2026

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

Analyzes reward hacking vulnerabilities in RLHF and alignment approaches for LLMs, examining mechanisms and emergent misalignment issues.

Ax Aram Ebtekar, Michael K. Cohen 4/16/2026

Golden Handcuffs make safer AI agents

Bayesian mitigation strategy for safer AI agents using expanded subjective reward range to prevent reward hacking via risk aversion.

Ax Thomas Bartz-Beielstein 4/16/2026

Optimization with SpotOptim

Python package for surrogate-model-based optimization using Kriging, Expected Improvement, and multi-objective extensions for expensive functions.

Ax Youling Huang, Guanqiao Chen, Junchi Yao, Lu Wang, Fangkai Yang, Chao Du, ChenZhuo Zhao, Pu Zhao, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang 4/16/2026

Beyond State Consistency: Behavior Consistency in Text-Based World Models

arXiv paper on behavior consistency in text-based world models for evaluating agent planning and offline evaluation beyond single-step metrics.