Ax Zhuoxuan Zhang (Yang), Kangqi Ni (Yang), Yuhang Chen (Yang), Mingfu Liang (Yang), Xiaohan Wei (Yang), Yunchen Pu (Yang), Fei Tian (Yang), Chonglin Sun (Yang), Frank Shyu (Yang), Adam (Yang), Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu 7/2/2026

Diffusion-GR2: Diffusion Generative Reasoning Re-ranker

Uses diffusion language models instead of autoregressive decoding to speed up generative reasoning re-rankers for recommendation systems.

Ax Chih-Han Yang, Dai-Jie Wu, Yun-Ping Huang, Ping-Chun Hsieh, Kenneth Marino, Shao-Hua Sun 7/2/2026

Language-Critique Imitation Learning from Suboptimal Demonstrations

Imitation learning framework using natural language critiques instead of scalar signals to learn from suboptimal demonstrations, enabling explicit reasoning about failures.

Ax Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue 7/2/2026

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench evaluation testbed for multimodal coding agents combining complex codebase navigation with manipulation of visual game assets.

Ax Tianyu Xie, Jinfa Huang, Yuexiao Ma, Rongfang Luo, Yan Yang, Wang Chen, Yuhui Zeng, Yixuan Zou, Qingchuan Ma, Zhiqiang Lu, Ruize Fang, Xiawu Zheng, Jiebo Luo, Rongrong Ji 7/2/2026

SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models

SocialOmni benchmark for evaluating audio-visual social interactivity in omni-modal language models beyond static accuracy-centric tasks.

Ax Xinyu Zhu, Yuzhu Cai, Zexi Liu, Cheng Wang, Fengyang Li, Wenkai Jin, Wanxu Liu, Zehao Bing, Bingyang Zheng, Jingyi Chai, Shuo Tang, Rui Ye, Yuwen Du, Xianghe Pang, Yaxin Du, Tingjia Miao, Yuzhi Zhang, Ruoxue Liao, Zhaohan Ding, Linfeng Zhang, Yanfeng Wang, Weinan E, Siheng Chen 7/2/2026

EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale

EvoMaster foundational evolving agent framework for scientific discovery enabling iterative learning from trial and error at scale.

Ax Teddy Ferdinan, Bart{\l}omiej Koptyra, Miko{\l}aj Langner, Tomasz Adamczyk, {\L}ukasz Radli\'nski, Maciej Markiewicz, Aleksander Szcz\k{e}sny, Stanis{\l}aw Wo\'zniak, Tymoteusz Romanowicz, Dzmitry Pihulski, Mateusz Zbrocki, Mateusz \'Smigielski, Micha{\l} Rajkowski, Mateusz Biedka, Konrad Kie{\l}czy\'nski, Konrad Wojtasik, Jacek Duszenko, Jan Eliasz, Piotr Matys, Maria Bellaniar Ismiati, Latius Hermawan, Wiktoria Mieleszczenko-Kowszewicz, Anna Kubicka-Sowi\'nska, Grzegorz Chodak, Karol Postawa, Pawe{\l} Zyblewski, Tomasz Szanda{\l}a, {\L}ukasz Sterczewski, Adrian Chajec, Pawe{\l} Niewiadomski, Piotr Gruber, Marcin Wdowikowski, S{\l}awomir Czarnecki, Bart{\l}omiej Kryszak, Dominik Drabik, Tomasz Kajdanowicz, Kamil Mamak, Pawe{\l} Pre\'s, Katarzyna Paczkowska, Joachim Sobczuk, Tomasz Zi\k{e}ba, Jan Koco\'n, Maciej Piasecki, Przemys{\l}aw Kazienko 7/2/2026

Reasoning4Sciences: Bridging Reasoning Language Models to All Scientific Branches

Survey analyzing reasoning language model adoption across 28 scientific disciplines to identify adoption gaps outside hard sciences.

Ax Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani, Huy M. Le, Muhammad Umer Sheikh, Numan Saeed, Muhammad Haris Khan, Salman Khan 7/2/2026

TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?

TerraBench benchmark evaluating whether agents can reason over heterogeneous Earth-system data including gridded, satellite, and geospatial inputs.

Ax Wenjia Jiang, Zongyuan Cai, Yuanhang Shao, Chenru Wang, Boyan Han, Zhixue Song, Keyu Chen, Shengwei An, Xu Yang, Zhou Yang 7/2/2026

ManimAgent: Self-Evolving Multimodal Agents for Visual Education

ManimAgent demonstrates self-evolving multimodal agents with multi-round reflection that persist learning across tasks, generating Manim animations from scientific papers.

Ax Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou 7/2/2026

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 technical report on GUI agents using vision-language models for end-to-end task completion in real applications through interface interactions.

Ax Woosung Koh, Juyoung Suk, Sungjun Han, Se-Young Yun, Jamin Shin 7/2/2026

Predicting LLM Reasoning Performance with Small Proxy Model

rBridge demonstrates that small proxy models (≤1B parameters) can predict reasoning performance of larger LLMs, enabling efficient dataset optimization before costly pre-training.

Ax Matan Levi, Daniel Ohayon, Ariel Blobstein, Ravid Sagi, Ian Molloy, Yair Allouche 7/2/2026

Toward Cybersecurity-Expert Small Language Models

CyberPal 2.0: domain-specific small language models (4B-20B) for cybersecurity with enriched chain-of-thought instruction datasets to address deployment gaps in security applications.

Ax Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar 7/2/2026

Reasoning Up the Instruction Ladder for Controllable Language Models

Research on enforcing instruction hierarchies in LLMs to handle competing directives, framing it as a reasoning task for improved control and reliability in high-stakes applications.