Ax Xingyuan Hua, Sheng Yue, Xinyi Li, Yizhe Zhao, Jinrui Zhang, Ju Ren 5/12/2026

Context Learning for Multi-Agent Discussion

M2CL framework improves multi-agent discussion by learning context representations that align individual LLM instances toward coherent solutions.

Ax Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan Xue, Sam Denton 5/12/2026

VeRO: An Evaluation Harness for Agents to Optimize Agents

VeRO evaluation harness systematically measures coding agent performance on agent optimization through iterative edit-execute-evaluate cycles.

Ax Elron Bandel, Asaf Yehudai, Lilach Eden, Yehoshua Sagron, Yotam Perlitz, Elad Venezian, Natalia Razinkov, Natan Ergas, Shlomit Shachor Ifergan, Segev Shlomov, Michal Jacovi, Leshem Choshen, Liat Ein-Dor, Yoav Katz, Michal Shmueli-Scheuer 5/12/2026

General Agent Evaluation

First systematic comparison of agent architectures (tool-calling, MCP, code-generation, CLI) across heterogeneous environments and benchmarks.

Ax Baoqing Yue, Zihan Zhu, Yutong Han, Qian Sun, Jichen Feng, Hufei Yang, Yifan Zhang, Mengdi Wang 5/12/2026

Interactive Benchmarks

Interactive Benchmarks evaluation paradigm assesses model reasoning through active information acquisition rather than fixed tasks.

Ax Maria Chang, Ronny Luss, Miao Liu, Keerthiram Murugesan, Karthikeyan Ramamurthy, Djallel Bouneffouf 5/12/2026

Mitigating Misalignment Contagion by Steering with Implicit Traits

Study of misalignment contagion where misaligned behavior spreads between multiple LMs in multi-agent settings, with steering techniques to mitigate.

Ax Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu 5/12/2026

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Benchmark for evaluating AI agents on workspace tasks with real-world file dependencies, addressing gap in current agent evaluation methods.

Ax Joseph Breda, Fadi Yousif, Beszel Hawkins, Marinela Cotoi, Miao Liu, Ray Luo, Po-Hsuan Cameron Chen, Mike Schaekermann, Samuel Schmidgall, Xin Liu, Girish Narayanswamy, Samuel Solomon, Maxwell A. Xu, Xiaoran Fan, Longfei Shangguan, Anran Wang, Bhavna Daryani, Buddy Herkenham, Cara Tan, Mark Malhotra, Shwetak Patel, John B. Hernandez, Quang Duong, Yun Liu, Zach Wasson, Dimitrios Antos, Bob Lou, Matthew Thompson, Jonathan Richina, Anupam Pathak, Nichole Young-Lin, Jake Sunshine, Daniel McDuff 5/12/2026

SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment

Conversational AI agents for patient symptom assessment, evaluated on realistic everyday medical scenarios rather than curated case studies.

Ax Tianyu Liu, Wangjie Zheng, Rui Yang, Benny Kai Guo Loo, Hui Zhang, Jeffries Lauran, Jianlei Gu, Botao Yu, Weihao Xuan, Kexin Huang, Nan Liu, James Zou, Yonghui Jiang, Hua Xu, Hongyu Zhao 5/12/2026

A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization

Hygieia: multi-modal AI agent integrating phenotypic, genetic, and clinical data for rare disease diagnosis and gene prioritization.