Ax Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao 5/15/2026

Flow-OPD: On-Policy Distillation for Flow Matching Models

Research paper on Flow-OPD: on-policy distillation technique for multi-task text-to-image flow matching models addressing reward sparsity and gradient interference.

Ax Zongmin Yu, Liu Yang 5/15/2026

Evolutionary Ensemble of Agents

Decentralized framework organizing coding agents into co-evolving system for algorithmic discovery, evolving agent behaviors through cumulative guidance.

Ax Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir 5/15/2026

Pretraining large language models with MXFP4 on Native FP4 Hardware

Study of FP4 quantization in transformer training, progressively enabling low-precision arithmetic across forward/backward passes for Llama 3.1 pretraining.

Ax Liang Luo, Yinbin Ma, Quanyu Zhu, Vasiliy Kuznetsov, Yuxin Chen, Jian Jiao, Jiecao Yu, Buyun Zhang, Tongyi Tang, Xiaohan Wei, Yanli Zhao, Zeliang Chen, Yuchen Hao, Venkatesh Ranganathan, Sandeep Parab, Yantao Yao, Maxim Naumov, Chunzhi Yang, Shen Li, Ellie Wen, Wenlin Chen, Santanu Kolay, Chunqiang Tang 5/15/2026

LoKA: Low-precision Kernel Applications for Recommendation Models At Scale

Research on applying FP8 low-precision arithmetic to large recommendation models, addressing numerical sensitivity challenges in GPU training.

Ax Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri 5/15/2026

Learning, Fast and Slow: Towards LLMs That Adapt Continually

Proposes dual-learning approach combining parameter updates and in-context learning to enable LLMs to adapt continually while retaining plasticity.

Ax Zeyu Huang, Adhiguna Kuncoro, Qixuan Feng, Jiajun Shen, Lucio Dery, Arthur Szlam, Marc'Aurelio Ranzato 5/15/2026

Context Training with Active Information Seeking

Equips LLMs with active information-seeking during context training to adapt to tasks requiring newly produced or niche domain knowledge without weight updates.

Ax Guoxiong Gao, Zeming Sun, Jiedong Jiang, Yutong Wang, Jingda Xu, Peihao Wu, Bryan Dai, Bin Dong 5/15/2026

LeanSearch v2: Global Premise Retrieval for Lean 4 Theorem Proving

LeanSearch v2 retrieves relevant library lemmas globally for Lean 4 theorem proving, addressing gap between semantic search and step-by-step premise selection.

Ax William Lehn-Schi{\o}ler, Magnus Ruud Kj{\ae}r, Rahul Thapa, Magnus Guldberg Pedersen, Anton Storgaard Mosquera, Nick Williams, Radu Gatej, Tue Lehn-Schi{\o}ler, S\'andor Beniczky, Sadasivan Puthusserypady, James Zou, Lars Kai Hansen 5/15/2026

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

Applies sparse autoencoders to interpret internal computations of EEG foundation models for clinical applications.

Ax L\'eo Grinsztajn (Liam), Klemens Fl\"oge (Liam), Oscar Key (Liam), Felix Birkel (Liam), Philipp Jund (Liam), Brendan Roof (Liam), Mihir Manium (Liam), Shi Bin (Liam), Hoo, Magnus B\"uhler, Anurag Garg, Dominik Safaric, Jake Robertson, Benjamin J\"ager, Simone Alessi, Adrian Hayler, Vladyslav Moroshan, Lennart Purucker, Philipp Singer, Alan Arazi, Julien Siems, Jan Hendrik Metzen, Georg Grab, Nick Erickson, Siyuan Guo, Eliott Kalfon, Simon Bing, David Salinas, Clara Cornu, Lilly Charlotte Wehrhahn, Diana Kriuchkova, Kursat Kaya, Lydia Sidhoum, Marie Salmon, Jerry Chen, Madelon Hulsebos, Yann LeCun, Samuel M\"uller, Bernhard Sch\"olkopf, Sauraj Gambhir, Noah Hollmann, Frank Hutter 5/15/2026

TabPFN-3: Technical Report

TabPFN-3 foundation model for tabular data scaled to 1M rows with improved training/inference speed and synthetic pretraining.

Ax Adrian M\"uller, Antoine Gonon, Zebang Shen, Ya-Ping Hsieh, Niao He 5/15/2026

Support Before Frequency in Discrete Diffusion

Analysis of discrete diffusion models showing hierarchy between support and frequency information in denoising objectives.

Ax Gergely Szilvasy (Meta FAIR), Manuel Faysse (Meta FAIR, MICS, CentraleSup\'elec), Maria Lomeli (Meta FAIR), Matthijs Douze (Meta FAIR), Pierre-Emmanuel Mazar\'e (Meta FAIR), Lo\"ic Cabannes (Meta FAIR), Wen-tau Yih (Meta FAIR), Herv\'e J\'egou (Meta FAIR) 5/15/2026

Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

Self-Pruned Key-Value Attention mechanism reduces KV cache size in transformers by predicting future utility for efficient long-sequence generation.