Ax Dikshya Mohanty, Mohammad Saqib Hasan, Syed Mostofa Monsur, Size Zheng, Benjamin Hsiao, Niranjan Balasubramanian 5/15/2026

Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks

PolyBench dataset and training approach teaches LLMs polymer design reasoning via domain-specific knowledge to overcome capability gaps in chemistry-related tasks.

Ax Jingkun Liu, Yisong Yue, Max Welling, Yue Song 5/15/2026

Krause Synchronization Transformers

Attention mechanism addressing representation collapse and attention sink phenomena through bounded confidence dynamics.

Ax Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang 5/15/2026

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

Scalable reward modeling framework for robots using trajectory comparisons instead of absolute progress labels.

Ax Ben Chen, Siyuan Wang, Yufei Ma, Zihan Liang, Xuxin Zhang, Yue Lv, Ying Yang, Huangyu Dai, Lingtao Mao, Tong Zhao, Zhipeng Qian, Xinyu Sun, Zhixin Zhai, Yang Zhao, Bochao Liu, Jingshan Lv, Xiao Liang, Hui Kong, Jing Chen, Han Li, Chenyi Lei, Wenwu Ou, Kun Gai 5/15/2026

OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework

OneSearch-V2 generative retrieval framework using latent reasoning and self-distillation for improved complex query understanding in industrial search systems.

Ax Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei 5/15/2026

LLMs Should Express Uncertainty Explicitly

Studies post-training methods to make LLMs explicitly signal uncertainty in their responses, reducing confident yet incorrect outputs in real-world applications.

Ax Feng Jiang, Yang Chen, Kyle Xu, Yuchen Liu, Haifeng Wang, Zhenhao Shen, Jasper Lu, Shengze Huang, Yuanfei Wang, Chen Xie, Ruihai Wu 5/15/2026

RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation

RoboWM-Bench evaluates world models for robotic manipulation, testing both visual realism and physical consistency of generated interactions for robot learning.

Ax Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut 5/15/2026

Image Generators are Generalist Vision Learners

Shows image generators develop zero-shot visual understanding capabilities similar to LLM emergent abilities, with evidence of strong generalist vision learning.

Ax Yixian Xu, Yusong Wang, Shengjie Luo, Kaiyuan Gao, Tianyu He, Di He, Chang Liu 5/15/2026

Quotient-Space Diffusion Models

Quotient-space diffusion models exploit symmetries in generative tasks like 3D molecular structure generation for improved learning efficiency.

Ax Jinming Yang, Zheng Hu, Chuxian Qiu, Zhenyu Deng, Xinshan Jiao, Tao Zhou 5/15/2026

Quantifying and Mitigating Self-Preference Bias of LLM Judges

Quantifies and mitigates Self-Preference Bias in LLM-based evaluation systems, addressing systematic favoritism toward models' own outputs in automated assessment.

Ax Fei Bai, Huatong Song, Shuang Sun, Daixuan Cheng, Yike Yang, Chuan Hao, Renyuan Li, Feng Chang, Yuan Wei, Ran Tao, Bryan Dai, Jian Yang, Wayne Xin Zhao, Ji-Rong Wen 5/15/2026

ClawGym: A Scalable Framework for Building Effective Claw Agents

ClawGym framework for building and training AI agents that interact with file systems, tools, and persistent workspaces. Includes systematic data synthesis and diagnostic evaluation.

Ax Jing Xu, Yuexiao Ma, Xuzhe Zheng, Xing Wang, Shiwei Liu, Chenqian Yan, Xiawu Zheng, Rongrong Ji, Fei Chao, Songwei Liu 5/15/2026

Motion-Aware Caching for Efficient Autoregressive Video Generation

Motion-aware caching strategy for autoregressive video generation that skips redundant denoising steps through fine-grained pixel-level optimization.