Ax Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang 5/12/2026

GRIT: Teaching MLLMs to Think with Images

Method enabling multimodal LLMs to integrate visual reasoning with image information using reinforcement learning.

Ax Qiyang Li, Zhiyuan Zhou, Sergey Levine 5/12/2026

Reinforcement Learning with Action Chunking

Q-chunking algorithm for improving reinforcement learning on long-horizon sparse-reward tasks in offline-to-online settings.

Ax Hoang Nguyen, Sidharth Surapaneni, Akshay Kalkunte, Jash Mehta, Aman Tiwari, Oluwanifemi Bamgbose, Khyati Mahajan, Jash Shah, Shruthan Radhakrishna, Sathwik Tejaswi Madhusudhan, Vikas Yadav, Sai Rajeswar 5/12/2026

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs

AU-Harness open-source toolkit for standardized evaluation of audio language models with multi-turn dialogue support.

Ax Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa 5/12/2026

RL Fine-Tuning Heals OOD Forgetting in SFT

Analysis of why SFT+RL post-training works: SFT peaks on OOD early then declines; RL recovers generalization.

Ax Katarzyna Kobalczyk, Zhiyuan Jerry Lin, Benjamin Letham, Zhuokai Zhao, Maximilian Balandat, Eytan Bakshy 5/12/2026

LILO: Bayesian Optimization with Natural Language Feedback

LILO framework uses LLMs to translate natural language feedback into structured preference signals for Bayesian optimization.

Ax Lukas Helff, Ruben H\"arle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia W\"ust, Hikaru Shindo, Patrick Schramowski, Kristian Kersting 5/12/2026

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning framework enables systematic logical reasoning in LLM latent spaces using sparse autoencoders for interpretability.