Ax Florin Gogianu, Adrian Catalin Lutu, Razvan Pascanu 5/11/2026

Revisiting Adam for Streaming Reinforcement Learning

Adam optimizer revisited for streaming reinforcement learning without replay buffers, enabling online policy updates from continuous interactions.

Ax Naihe Feng, Yi Sui, Shiyi Hou, Ga Wu, Jesse C. Cresswell 5/11/2026

Conformal Agent Error Attribution

Error attribution framework for multi-agent LLM systems using conformal prediction with distribution-free coverage guarantees.

Ax Eshed Gal, Uri Ascher, Eldad Haber 5/11/2026

Target-Aware Data Augmentation for SAT Prediction

Target-aware data augmentation for SAT prediction reduces labeling costs by improving learning-based solvers for NP-hard Boolean satisfiability problems.

Ax Giansalvo Cirrincione, Adriano Fagiolini 5/11/2026

Learned Lyapunov Shielding for Adaptive Control

Learned Lyapunov shielding augments adaptive control with learned quadratic Lyapunov functions and physics-informed neural networks for safety filtering.

Ax Chenhui Xu, Ziyue Bai, Fuxun Yu, Heng Huang, Jinjun Xiong 5/11/2026

Rollback-Free Stable Brick Structures Generation

RL-based approach for generating physically stable brick structures without external simulators, using learned constraint satisfaction during generation.

Ax Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang 5/11/2026

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

PACEevolve++: Reinforcement learning framework enabling test-time policy adaptation for LLM-driven evolutionary search agents.

Ax Rui Cai, Weijie Jacky Mo, Xiaofei Wen, Qiyao Ma, Wenhui Zhu, Xiwen Chen, Muhao Chen, Zhe Zhao 5/11/2026

ModelLens: Finding the Best for Your Task from Myriads of Models

Framework for selecting best pretrained model for new tasks from thousands of open-source models using transferability estimation without expensive evaluation.

Ax Majid Molaei, Gabor Paczolay, Matteo Papini, Alberto Maria Metelli, Marcello Restelli 5/11/2026

Actor-Critic with Active Importance Sampling

Actor-critic algorithm optimizing behavior policy via importance sampling to reduce variance in policy gradient estimation.

Ax Lucas Monteiro Paes, Natalie Mackraz, Barry-John Theobald, Federico Danieli 5/11/2026

Theoretical Limits of Language Model Alignment

Theoretical analysis of fundamental limits on reward improvement for LLM alignment via RL and best-of-N selection methods.