Ax Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu 3/19/2026

Tree Search for LLM Agent Reinforcement Learning

Tree-based group relative policy optimization for LLM agent reinforcement learning addressing sparse supervision in long-horizon multi-turn tasks.

Ax Andy Dimnaku, Abdullah Yusuf Kavranoglu, Yaser Abu-Mostafa 3/19/2026

Generative Hints

Generative hints training methodology enforcing functional invariances in vision models beyond empirical training data.

Ax Nathan Breslow, Aayush Mishra, Mahler Revsine, Michael C. Schatz, Anqi Liu, Daniel Khashabi 3/19/2026

Genomic Next-Token Predictors are In-Context Learners

Research showing genomic sequence models exhibit in-context learning similar to LLMs, demonstrating ICL emerges across sequence domains.

Ax Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang, Zhifeng Chen, Afshin Dehghan 3/19/2026

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

Benchmark for evaluating multimodal LLMs on schema-grounded visual information extraction and reasoning tasks in agentic settings.

Ax Vedant Shah, Johan Obando-Ceron, Vineet Jain, Brian Bartoldson, Bhavya Kailkhura, Sarthak Mittal, Glen Berseth, Pablo Samuel Castro, Yoshua Bengio, Nikolay Malkin, Moksh Jain, Siddarth Venkatraman, Aaron Courville 3/19/2026

A Comedy of Estimators: On KL Regularization in RL Training of LLMs

Analysis of KL divergence estimators used in RL training of LLMs, evaluating different approximation methods for reverse KL regularization.

Ax Abhi Kottamasu, Chirag Mahapatra, Sam Lee, Ben Pan, Aakash Barthwal, Akul Datta, Ajay Arun, Silas Alberti, Adarsh Hiremath, Brendan Foody, Bertie Vidgen 3/19/2026

APEX-SWE

Benchmark for evaluating frontier AI models on real-world software engineering tasks including integration and end-to-end system construction.

Ax Xiaoxuan Liu, Jiaxiang Yu, Jongseok Park, Ion Stoica, Alvin Cheung 3/19/2026

Speculative Decoding: Performance or Illusion?

Systematic evaluation of speculative decoding acceleration techniques on production-grade vLLM inference engine, assessing real-world effectiveness.