Ax Jie Gao, Kaiser Sun, Jen-tse Huang, Katherine Van Koevering, Sijie Ji, Heyuan Huang, Weiyan Shi, Zhuoran Lu, Ziang Xiao, Daniel Khashabi, Mark Dredze 5/14/2026

How to Interpret Agent Behavior

Methods for interpreting autonomous agent behavior by analyzing reasoning trajectories and execution traces from long-running agents like Claude Code.

Ax Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo 5/14/2026

Harnessing Agentic Evolution

Framework combining iterative candidate generation, evaluation, and feedback for agentic evolution, balancing modularity and flexibility in long-horizon search.

Ax Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang 5/14/2026

3D Primitives are a Spatial Language for VLMs

Study showing 3D geometric primitives as intermediate representation improve VLM spatial reasoning and 3D scene reconstruction from code.

Ax Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu, Ruowang Zhang, Haixin Wang, Yinyi Luo, Chen Henry Wu, Gaurav Mittal, Matt Fredrikson, Yu Hu 5/14/2026

Multi-Rollout On-Policy Distillation via Peer Successes and Failures

On-policy distillation method for LLM training that leverages peer rollout successes and failures to provide dense token-level supervision.

Ax Yichen Feng, Yuetai Li, Chunjiang Liu, Yuanyuan Chen, Fengqing Jiang, Yue Huang, Hang Hua, Zhengqing Yuan, Kaiyuan Zheng, Luyao Niu, Bhaskar Ramasubramanian, Basel Alomair, Xiangliang Zhang, Misha Sra, Zichen Chen, Radha Poovendran, Zhangchen Xu 5/14/2026

Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?

Benchmark evaluating whether multimodal LLMs can make accurate aesthetic judgments compared to human expert annotators on image ranking tasks.

Ax Weitai Kang, Xiaohang Zhan, Yizhou Wang, Mang Tik Chiu, Jason Kuen, Kangning Liu, Yan Yan 5/14/2026

Inline Critic Steers Image Editing

Image editing refinement technique using inline critic signals within forward passes to improve heterogeneous editing difficulty across regions.

Ax Yujia Zheng, Fan Feng, Yuke Li, Shaoan Xie, Kevin Murphy, Kun Zhang 5/14/2026

From Generalist to Specialist Representation

Nonparametric study of learning task-relevant specialist representations from generalist models with identifiability guarantees.

Ax Nirav Diwan, Han Wang, Berkcan Kapusuzoglu, Ramin Moradi, Supriyo Chakraborty, Giri Iyengar, Sambit Sahu, Huan Zhang, Gang Wang 5/14/2026

CoT-Guard: Small Models for Strong Monitoring

Small monitoring models for detecting covert misbehavior in LLM chain-of-thought reasoning, reducing cost vs. large model monitors.