Ax Zhuoran Li, Xun Wang, Hai Zhong, Qingxin Xia, Lihua Zhang, Longbo Huang 3/2/2026

OM2P: Offline Multi-Agent Mean-Flow Policy

Offline multi-agent reinforcement learning using efficient flow-based policies for time-sensitive deployment.

Ax Haining Pan, James V. Roggeveen, Erez Berg, Juan Carrasquilla, Debanjan Chowdhury, Surya Ganguli, Federico Ghimenti, Juraj Hasik, Henry Hunt, Hong-Chen Jiang, Mason Kamb, Ying-Jer Kao, Ehsan Khatami, Michael J. Lawler, Di Luo, Titus Neupert, Xiaoliang Qi, Michael P. Brenner, Eun-Ah Kim 3/2/2026

CMT-Benchmark: A Benchmark for Condensed Matter Theory Built by Expert Researchers

Benchmark dataset of 50 condensed matter theory problems for evaluating LLMs on advanced research-level physics problem-solving.

Ax Nicolas Menet, Aleksandar Terzi\'c, Michael Hersche, Andreas Krause, Abbas Rahimi 3/2/2026

Thompson Sampling via Fine-Tuning of LLMs

ToSFiT: Thompson sampling via LLM fine-tuning for Bayesian optimization in large discrete spaces without acquisition function maximization.

Ax Vaibhav Singh, Oleksiy Ostapenko, Pierre-Andr\'e No\"el, Eugene Belilovsky, Torsten Scholak 3/2/2026

DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone

DiffuMamba: diffusion language model with Mamba backbone for efficient masked sequence modeling, achieving linear-time complexity vs Transformer quadratic overhead.

Ax Timoth\'ee Chauvin, Erwan Le Merrer, Fran\c{c}ois Ta\"iani, Gilles Tredan 3/2/2026

Log Probability Tracking of LLM APIs

Method for monitoring LLM API consistency over time by tracking log probability changes to detect undisclosed model updates.

Ax Sajad Ashkezari 3/2/2026

Robust Online Learning

Online learning framework for training robust classifiers under adversarially chosen clean data and labels.

Ax Daniel Romero-Alvarado, Fernando Mart\'inez-Plumed, Lorenzo Pacchiardi, Hugo Save, Siddhesh Milind Pawar, Behzad Mehrbakhsh, Pablo Antonio Moreno Casares, Ben Slater, Paolo Bova, Peter Romero, Zachary R. Tyler, Jonathan Prunty, Luning Sun, Jose Hernandez-Orallo 3/2/2026

Capabilities Ain't All You Need: Measuring Propensities in AI

Framework for measuring propensities (behavioral tendencies) in AI models beyond capability assessment using Item Response Theory.