Ax Shripad Vilasrao Deshmukh, Will Schwarzer, Scott Niekum 3/23/2026

Evaluation-Aware Reinforcement Learning

EvA-RL framework optimizing policy evaluation accuracy during training for safer RL deployment. Addresses variance and bias in policy evaluation.

Ax Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu 3/23/2026

RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark

Benchmark evaluating unified multimodal models for vision understanding and generation. Comprehensive evaluation of architectural synergies.

Ax Sunipa Dev, Vinodkumar Prabhakaran, Rutledge Chin Feman, Aida Davani, Remi Denton, Charu Kalia, Piyawat Lertvittayakumjorn, Madhurima Maji, Rida Qadri, Negar Rostamzadeh, Renee Shelby, Romina Stella, Hayk Stepanyan, Erin van Liemt, Aishwarya Verma, Oscar Wahltinez, Edem Wornyo, Andrew Zaldivar, Sa\v{s}ka Mojsilovi\'c 3/23/2026

A Unified Framework to Quantify Cultural Intelligence of AI

Unified framework for assessing cultural intelligence and competence of generative AI systems across different cultural contexts.

Ax Diego Calvanese, Angelo Casciani, Giuseppe De Giacomo, Marlon Dumas, Fabiana Fournier, Timotheus Kampik, Emanuele La Malfa, Lior Limonad, Andrea Marrella, Andreas Metzger, Marco Montali, Daniel Amyot, Peter Fettke, Artem Polyvyanyy, Stefanie Rinderle-Ma, Sebastian Sardi\~na, Niek Tax, Barbara Weber 3/23/2026

Agentic Business Process Management: A Research Manifesto

Manifesto establishing conceptual foundations for Agentic Business Process Management (APM), extending BPM with autonomous agent governance for organizational processes.

Ax Le Ma, Ran Zhang, Yikun Han, Shirui Yu, Zaitian Wang, Zhiyuan Ning, Jinghan Zhang, Ping Xu, Pengjiang Li, Wei Ju, Chong Chen, Dongjie Wang, Kunpeng Liu, Pengyang Wang, Pengfei Wang, Yanjie Fu, Chunjiang Liu, Yuanchun Zhou, Chang-Tien Lu 3/23/2026

A Comprehensive Survey on Vector Database: Storage and Retrieval Technique, Challenge

Comprehensive survey on vector database technologies, storage methods, and retrieval techniques integrated with LLMs for modern AI systems.

Ax Benjamin A. T. Grahama, Lauren Brown, Georgios Chochlakis, Morteza Dehghani, Raquel Delerme, Brittany Friedman, Ellie Graeden, Preni Golazizian, Rajat Hebbar, Parsa Hejabi, Aditya Kommineni, Mayag\"uez Salinas, Michael Sierra-Ar\'evalo, Jackson Trager, Nicholas Weller, Shrikanth Narayanan 3/23/2026

Community-Informed AI Models for Police Accountability

AI models for analyzing police-public interactions from bodycam footage to improve government transparency and accountability in law enforcement.

Ax Abhimanyu Rajeshkumar Bambhaniya, Hanjiang Wu, Suvinay Subramanian, Sudarshan Srinivasan, Souvik Kundu, Amir Yazdanbakhsh, Midhilesh Elavazhagan, Madhu Kumar, Tushar Krishna 3/23/2026

Understanding and Optimizing Multi-Stage AI Inference Pipelines

Analysis and optimization of multi-stage LLM inference pipelines including RAG, KV cache retrieval, dynamic routing, and multi-step reasoning with diverse computational demands.

Ax Wei Cao, Marcel Hallgarten, Tianyu Li, Daniel Dauner, Xunjiang Gu, Caojun Wang, Yakov Miron, Marco Aiello, Hongyang Li, Igor Gilitschenski, Boris Ivanovic, Marco Pavone, Andreas Geiger, Kashyap Chitta 3/23/2026

Pseudo-Simulation for Autonomous Driving

Pseudo-simulation evaluation paradigm for autonomous vehicles combining efficiency of open-loop evaluation with realism of closed-loop simulation.

Ax George Pu, Michael S. Lee, Udari Madhushani Sehwag, David J. Lee, Bryan Zhu, Yash Maurya, Mohit Raghavendra, Yuan Xue, Samuel Marc Denton 3/23/2026

LHAW: Controllable Underspecification for Long-Horizon Tasks

Framework for curating and measuring ambiguity in long-horizon AI agents to improve their ability to seek clarification during extended task execution.

Ax Bryan Shan, Alysa Ziying Tan, Han Yu 3/23/2026

Federated Learning Playground

Browser-based interactive platform for teaching federated learning concepts. Developer tool and educational resource.

Ax {\L}ukasz Borchmann, Jordy Van Landeghem, Micha{\l} Turski, Shreyansh Padarha, Ryan Othniel Kearns, Adam Mahdi, Niels Rogge, Cl\'ementine Fourrier, Siwei Han, Huaxiu Yao, Artemis Llabr\'es, Yiming Xu, Dimosthenis Karatzas, Hao Zhang, Anupam Datta 3/23/2026

Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections

MADQA benchmark evaluates whether multimodal agents use strategic reasoning or stochastic search on document collections. Agent reasoning research.

Ax Charles Ye, Jasmine Cui, Dylan Hadfield-Menell 3/23/2026

Prompt Injection as Role Confusion

Research on prompt injection attacks via role confusion. Analysis of how LLMs infer authority from text structure. Security for LLM applications.

Ax Yihao Zhang, Zeming Wei, Xiaokun Luan, Chengcan Wu, Zhixin Zhang, Jiangrong Wu, Haolin Wu, Huanran Chen, Jun Sun, Meng Sun 3/23/2026

ClawWorm: Self-Propagating Attacks Across LLM Agent Ecosystems

ClawWorm demonstrates self-propagating attacks across LLM agent ecosystems via OpenClaw platform. Security research on multi-agent systems.

Ax Xavier Cadet, Aditya Vikram Singh, Harsh Mamania, Edward Koh, Alex Fitts, Dirk Van Bruggen, Simona Boboila, Peter Chin, Alina Oprea 3/23/2026

Retrieval-Augmented LLMs for Security Incident Analysis

RAG-based system using LLMs for automated cybersecurity incident analysis from multiple log sources. LLM application for security workflows.