Ax Timo Klein, Thomas Lang, Andrii Shkabrii, Alexander Sturm, Kevin Sidak, Lukas Miklautz, Claudia Plant, Yllka Velaj, Sebastian Tschiatschek 3/9/2026

Understanding and Improving Hyperbolic Deep Reinforcement Learning

Analysis of optimization challenges in hyperbolic deep RL identifying gradient factors affecting training success for hierarchical state embeddings.

Ax Chenghua Zhu, Siyan Wu, Xiangkang Zeng, Zishan Xu, Zhaolu Kang, Yifu Guo, Yuquan Lu, Junduan Huang, Guojing Zhou 3/9/2026

EDIS: Diagnosing LLM Reasoning via Entropy Dynamics

EDIS analyzes token-level entropy trajectories during LLM generation to diagnose reasoning quality beyond aggregate confidence statistics.

Ax Tony Feng, Trieu H. Trinh, Garrett Bingham, Dawsen Hwang, Yuri Chervonyi, Junehyuk Jung, Joonkyung Lee, Carlo Pagano, Sang-hyun Kim, Federico Pasqualotto, Sergei Gukov, Jonathan N. Lee, Junsu Kim, Kaiying Hou, Golnaz Ghiasi, Yi Tay, YaGuang Li, Chenkai Kuang, Yuan Liu, Hanzhao Lin, Evan Zheran Liu, Nigamaa Nayakanti, Xiaomeng Yang, Heng-Tze Cheng, Demis Hassabis, Koray Kavukcuoglu, Quoc V. Le, Thang Luong 3/9/2026

Towards Autonomous Mathematics Research

Aletheia agent iteratively generates, verifies and revises mathematical proofs using LLMs, advancing autonomous research capabilities.

Ax Steffen Eger, Yong Cao, Jennifer D'Souza, Andreas Geiger, Christian Greisinger, Stephanie Gross, Yufang Hou, Brigitte Krenn, Anne Lauscher, Yizhi Li, Chenghua Lin, Nafise Sadat Moosavi, Wei Zhao, Tristan Miller 3/9/2026

Transforming Science with Large Language Models: A Survey on AI-assisted Scientific Discovery, Experimentation, Content Generation, and Evaluation

Survey on LLMs transforming scientific research covering literature search, hypothesis generation, experimentation, content generation, and peer review assistance.

Ax Xiusi Chen, Gaotang Li, Ziqi Wang, Bowen Jin, Cheng Qian, Yu Wang, Hongru Wang, Yu Zhang, Denghui Zhang, Tong Zhang, Hanghang Tong, Heng Ji 3/9/2026

RM-R1: Reward Modeling as Reasoning

Research paper proposing reward modeling with chain-of-thought reasoning for improved LLM alignment with human preferences via reinforcement learning.

Ax Robert Graham, Edward Stevinson, Leo Richter, Alexander Chia, Joseph Miller, Joseph Isaac Bloom 3/9/2026

ContextBench: Modifying Contexts for Targeted Latent Activation

ContextBench: benchmark for generating targeted linguistically fluent inputs that activate specific latent features in language models for safety analysis.

Ax Martine Hjelkrem-Tan, Marius Aasan, Gabriel Y. Arteaga, Ad\'in Ram\'irez Rivera 3/9/2026

SPoT: Subpixel Placement of Tokens in Vision Transformers

SPoT: tokenization strategy for Vision Transformers enabling continuous subpixel token placement instead of grid-based constraints for sparse regime exploitation.

Ax Andrew Campbell, Valentin De Bortoli, Jiaxin Shi, Arnaud Doucet 3/9/2026

Self-Speculative Masked Diffusions

Self-speculative masked diffusions: discrete data generative models reducing function evaluations through speculative sampling without factorization approximations.

Ax Jiarui Li, Zixiang Yin, Zhengming Ding, Samuel J. Landry, Ramgopal R. Mettu 3/9/2026

TCR-EML: Explainable Model Layers for TCR-pMHC Prediction

TCR-EML: explainable machine learning model layers for predicting T cell receptor-peptide MHC binding with interpretability for immunotherapy applications.

Ax Gregory Yauney, Shahzaib Saqib Warraich, Swabha Swayamdipta 3/9/2026

How Reliable is Language Model Micro-Benchmarking?

Meta-evaluation study analyzing reliability of micro-benchmarks for ranking LLMs, comparing against full benchmarks and random sampling approaches.

Ax Mario Markov (INSAIT, Sofia University "St. Kliment Ohridski"), Stefan Maria Ailuro (INSAIT, Sofia University "St. Kliment Ohridski"), Luc Van Gool (INSAIT, Sofia University "St. Kliment Ohridski"), Konrad Schindler (ETH Zurich), Danda Pani Paudel (INSAIT, Sofia University "St. Kliment Ohridski") 3/9/2026

FireScope: Wildfire Risk Prediction with a Chain-of-Thought Oracle

FireScope-Bench: dataset and benchmark for wildfire risk prediction using satellite imagery, climate data, and chain-of-thought reasoning with multimodal integration.

Ax Dashti A. Ali, Aras T. Asaad, Jacob J. Peoples, Mohammad Hamghalam, Natalie Gangai, Richard K. G. Do, Alice C. Wei, Amber L. Simpson 3/9/2026

A Novel Patch-Based TDA Approach for Computed Tomography Imaging

Applies topological data analysis to CT imaging for improved feature extraction in medical imaging ML models.

Ax Ravi Raju, Mengmeng Ji, Shubhangi Upasani, Bo Li, Urmish Thakker 3/9/2026

The Limits of Long-Context Reasoning in Automated Bug Fixing

Evaluates whether LLMs can reliably perform long-context code debugging and patch generation, testing limits of agentic workflows on software engineering tasks.