Ax Haomiaomiao Wang, Tom\'as E Ward, Lili Zhang 3/10/2026

Rigidity in LLM Bandits with Implications for Human-AI Dyads

Studies decision biases in LLMs via 20k bandit trials across decoding configurations. Shows positional order bias and rigid exploitation patterns independent of temperature/top-p.

Ax Jiateng Liu, Zhenhailong Wang, Rushi Wang, Bingxuan Li, Jeonghwan Kim, Aditi Tiwari, Pengfei Yu, Denghui Zhang, Heng Ji 3/10/2026

OSExpert: Computer-Use Agents Learning Professional Skills via Exploration

OSExpert introduces computer-use agents learning professional skills via exploration, with benchmark showing limitations in efficiency and transfer to unseen UIs.

Ax Jiaxuan Lu, Kong Wang, Yemin Wang, Qingmei Tang, Hongwei Zeng, Xiang Chen, Jiahao Pi, Shujian Deng, Lingzhi Chen, Yi Fu, Kehua Yang, Xiao Sun 3/10/2026

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

FinToolBench benchmark evaluating LLM agents on real-world financial tool use tasks, addressing compliance and data volatility challenges.

Ax Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu 3/10/2026

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

Code-based chain-of-thought approach for text-to-image generation with precise spatial and structural control.

Ax Krista Opsahl-Ong, Arnav Singhvi, Jasmine Collins, Ivan Zhou, Cindy Wang, Ashutosh Baheti, Owen Oertell, Jacob Portes, Sam Havens, Erich Elsen, Michael Bendersky, Matei Zaharia, Xing Chen 3/10/2026

OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning

Benchmark for evaluating AI agents on multi-document reasoning using 100 years of U.S. Treasury data.

Ax Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang, Furong Huang 3/10/2026

Agentic Critical Training

Training approach for LLM agents that uses contrastive learning to develop action quality awareness beyond imitation.

Ax Wallyson Lemes de Oliveira, Mekhron Bobokhonov, Matteo Caorsi, Aldo Podest\`a, Gabriele Beltramo, Luca Crosato, Matteo Bonotto, Federica Cecchetto, Hadrien Espic, Dan Titus Salajan, Stefan Taga, Luca Pana, Joe Carthy 3/10/2026

ARC-AGI-2 Technical Report

Transformer-based system for ARC reasoning combining neural inference with structure-aware priors and online adaptation for few-shot generalization.

Ax Jiajun Xu, Jiageng Mao, Ang Qi, Weiduo Yuan, Alexander Romanus, Helen Xia, Vitor Campagnolo Guizilini, Yue Wang 3/10/2026

FuzzingRL: Reinforcement Fuzz-Testing for Revealing VLM Failures

FuzzingRL uses reinforcement learning and fuzz testing to automatically generate adversarial queries that reveal VLM failures and vulnerabilities.