Ax Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He, Ruyi Ji, Xiaoming Ren, Yanhao Zhang, Haonan Lu, Jing Liu 3/16/2026

Thinking in Streaming Video

ThinkStream framework enabling real-time streaming video understanding for multimodal agents without batch processing delays, addressing latency in interactive applications.

Ax Dayuan Fu, Shenyu Wu, Yunze Wu, Zerui Peng, Yaxing Huang, Jie Sun, Ji Zeng, Mohan Jiang, Lin Zhang, Yukun Li, Jiarui Hu, Liming Liu, Jinlong Hou, Pengfei Liu 3/16/2026

daVinci-Env: Open SWE Environment Synthesis at Scale

daVinci-Env: large-scale open-source environment for training software engineering agents with executable repositories and dynamic feedback.

Ax Donghoon Shin, Alice Gao, Rock Yuren Pang, Jaewook Lee, Katharina Reinecke, Emily Tseng 3/16/2026

Interrogating Design Homogenization in Web Vibe Coding

Analysis of design homogenization in LLM-generated web designs through vibe-coding, examining how generative AI limits design diversity.

Ax Ephrem Tibebe Mekonnen, Luca Longo, Lucas Rizzo, Pierpaolo Dondio 3/16/2026

L2GTX: From Local to Global Time Series Explanations

L2GTX: method for explaining time series classification decisions by providing local and global explanations respecting temporal dependencies.

Ax Arne Vanhoyweghen, Vincent Holst, Melika Mobini, Lukas Van de Voorde, Tibo Vanleke, Bert Verbruggen, Brecht Verbeken, Andres Algaba, Sam Verboven, Marie-Anne Guerry, Filip Van Droogenbroeck, Vincent Ginis 3/16/2026

Human-in-the-Loop LLM Grading for Handwritten Mathematics Assessments

Workflow for LLM-assisted grading of handwritten student assessments combining OCR, LLM processing, and human review for mathematics.

Ax J. de Curt\`o, I. de Zarz\`a 3/16/2026

LLM Constitutional Multi-Agent Governance

Constitutional Multi-Agent Governance framework constrains LLM policy generation in multi-agent systems. Ensures cooperation emerges from alignment rather than autonomy erosion.

Ax Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang 3/16/2026

Visual-ERM: Reward Modeling for Visual Equivalence

Reward modeling framework for vision-to-code tasks using LVLMs. Addresses RL training challenges in converting visual inputs to structured code with reinforcement learning.

Ax Yangsong Zhang, Anujith Muraleedharan, Rikhat Akizhanov, Abdul Ahad Butt, G\"ul Varol, Pascal Fua, Fabio Pizzati, Ivan Laptev 3/16/2026

PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization

Diffusion models for text-conditioned humanoid motion generation with physics-based controllers for robot animation. Focuses on motion synthesis rather than AI agents or LLM applications.

Ax Yueheng Li, Guangming Xie, Zongqing Lu 3/16/2026

Multi-Agent Guided Policy Optimization

Proposes MAGPO framework for multi-agent reinforcement learning leveraging centralized training with decentralized execution.

Ax Songqin Nong, Xiaoxuan Tang, Jingxuan Xu, Sheng Zhou, Jianfeng Chen, Tao Jiang, Wenhao Xu 3/16/2026

CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks

Introduces CRAFT-GUI, curriculum-reinforced agent using RL for GUI task execution with difficulty-aware training.

Ax Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li, Bingran You, Haotian Shen, Jiankai Sun, Shuyi Wang, Binxu Li, Qunhong Zeng, Di Wang, Xuandong Zhao, Yuanli Wang, Roey Ben Chaim, Zonglin Di, Yipeng Gao, Junwei He, Yizhuo He, Liqiang Jing, Luyang Kong, Xin Lan, Jiachen Li, Songlin Li, Yijiang Li, Yueqian Lin, Xinyi Liu, Xuanqing Liu, Haoran Lyu, Ze Ma, Bowei Wang, Runhui Wang, Tianyu Wang, Wengao Ye, Yue Zhang, Hanwen Xing, Yiqi Xue, Steven Dillmann, Han-chung Lee 3/16/2026

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

Introduces SkillsBench, benchmark of 86 tasks evaluating whether structured procedural knowledge packages improve LLM agent performance.

Ax Hongwei Li, Zhun Wang, Qinrun Dai, Yuzhou Nie, Jinjun Peng, Ruitong Liu, Jingyang Zhang, Kaijie Zhu, Jingxuan He, Lun Wang, Yangruibo Ding, Yueqi Chen, Wenbo Guo, Dawn Song 3/16/2026

OpenSage: Self-programming Agent Generation Engine

Proposes OpenSage, first agent development kit enabling automated design of agent topology, tools, and memory components.

Ax Linus Folkerts, Will Payne, Simon Inman, Philippos Giavridis, Joe Skinner, Sam Deverett, James Aung, Ekin Zorer, Michael Schmatz, Mahmoud Ghanem, John Wilkinson, Alan Steer, Vy Hong, Jessica Wang 3/16/2026

Measuring AI Agents' Progress on Multi-Step Cyber Attack Scenarios

Evaluates autonomous cyber-attack capabilities of frontier AI models on multi-step attack scenarios, comparing seven models over 18 months at varying compute budgets.