Ax Majid Ghasemi, Mark Crowley 3/17/2026

Learning When to Trust in Contextual Bandits

Analysis of contextual bias in reinforcement learning feedback sources; proposes methods addressing selective truthfulness in evaluators.

Ax Son Nguyen, Xinyuan Liu, Ransalu Senanayake 3/17/2026

LLM Routing as Reasoning: A MaxSAT View

Constraint-based approach formulating LLM routing as MaxSAT problem to match queries with appropriate models based on natural language preferences.

Ax Vishnu Narayanan Anilkumar, Abhijith Sreesylesh Babu, Trieu Hai Vo, Mohankrishna Kolla, Alexander Cuneo 3/17/2026

Relationship-Aware Safety Unlearning for Multimodal LLMs

Framework for relationship-aware safety unlearning in multimodal LLMs, addressing relational safety failures without collateral damage.

Ax Shengda Fan, Xuyan Ye, Yupeng Huo, Zhi-Yuan Chen, Yiju Guo, Shenzhi Yang, Wenkai Yang, Shuqi Ye, Jingwen Chen, Haotian Chen, Xin Cong, Yankai Lin 3/17/2026

AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents

Benchmark for evaluating step-level process quality in tool-using LLM agents, addressing brittleness in long-horizon interactions with irreversible side effects.