Ax Jiazheng Zhang, Ziche Fu, Junrui Shen, Yunbin Zhao, Yunke Zhang, Zhiheng Xi, Long Ma, Chenxin An, Zhihao Zhang, Shichun Liu, Dingwei Zhu, Shihan Dou, Shaofan Liu, Han Li, Wiggin Zhou, Aiden Adams, Tao Gui, Fei Huang, Qi Zhang, Xuanjing Huang 5/15/2026

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control

Theoretical framework of entropy mechanics in LLM reinforcement learning with verifiable rewards analyzing token-level policy updates.

Ax Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri 5/15/2026

Learning, Fast and Slow: Towards LLMs That Adapt Continually

Continual learning method combining parameter updates and in-context learning for LLMs to adapt without catastrophic forgetting.

Ax Mingyu Zhang, Lifeng Zhuo, Tianxi Tan, Guocan Xie, Xian Nie, Yan Li, Renjie Zhao, Zizhu He, Ziyu Wang, Jiting Cai, Yong-Lu Li 5/15/2026

IPR-1: Interactive Physical Reasoner

Interactive physical reasoning agent learning human-like causal understanding from game interaction with visual domain gaps.

Ax Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick 5/15/2026

Conformal Thinking: Risk Control for Reasoning on a Compute Budget

Conformal prediction framework for adaptive reasoning in LLMs, controlling risk-accuracy tradeoff when allocating compute budget for inference.

Ax Lin Zheng, Xinyu Li, Qian Liu, Xiachong Feng, Lingpeng Kong 5/15/2026

Proxy Compression for Language Modeling

Proxy compression training scheme for language models preserving efficiency of tokenization while enabling raw-byte inference interface.

Ax Tom Kempton, Julia Rozanova, Parameswaran Kamalaruban, Maeve Madigan, Karolina Wresilo, Yoann L. Launay, David Sutton, Stuart Burrell 5/15/2026

DMAP: A Distribution Map for Text

Framework extracting distribution maps from LLM next-token probabilities for better statistical text analysis beyond perplexity metrics.

Ax Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang 5/15/2026

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

Scalable reward modeling framework for robotics using trajectory comparisons to handle failed and suboptimal trajectories.

Ax Fei Bai, Huatong Song, Shuang Sun, Daixuan Cheng, Yike Yang, Chuan Hao, Renyuan Li, Feng Chang, Yuan Wei, Ran Tao, Bryan Dai, Jian Yang, Wayne Xin Zhao, Ji-Rong Wen 5/15/2026

ClawGym: A Scalable Framework for Building Effective Claw Agents

Scalable framework for training and evaluating agents in claw-style environments with file systems, tools, and persistent workspace.

Ax Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Yukai Wu, Weizheng Wang, Hongzhang Huang, Wei Zhou, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu 5/15/2026

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Large-scale benchmark for evaluating AI agents on workspace tasks with file dependencies, testing real-world file system operations.

Ax Zongmin Yu, Liu Yang 5/15/2026

Evolutionary Ensemble of Agents

Decentralized framework organizing coding agents in co-evolving populations for algorithmic discovery and skill evolution.