Ax Angelika Romanou, Mark Ibrahim, Candace Ross, Chantal Shaib, Kerem Okta, Sam Bell, Elia Ovalle, Jesse Dodge, Antoine Bosselut, Koustuv Sinha, Adina Williams 3/17/2026

Brittlebench: Quantifying LLM robustness via prompt sensitivity

Brittlebench introduces evaluation framework measuring LLM robustness to prompt variations, typos, and real-world input noise.

Ax Valerie B\"urger, Marlie Besouw, Jana Fehr, Riana Minocher, Emma Moorhead, Isabel Velarde, Louis Agha-Mir-Salim, Julia Amann, Alexandra Bannach-Brown, David B. Blumenthal, Kaitlyn Hair, Bert Heinrichs, Moritz Herrmann, Elizabeth Hofvenschi\"old, Sune Holm, Anne A. H. de Hond, Sara Kijewski, Stuart McLennan, Timo Minssen, Marco S. Nobile, Nico Pfeifer, Jessica L. Rohmann, Tony Ross-Hellauer, Marija Slavkovik, Karin Tafur, Eleonora Vigan\`o, Magnus Westerlund, Tracey Weissgerber, Vince I. Madai 3/17/2026

How Meta-research Can Pave the Road Towards Trustworthy AI In Healthcare: Catalogue of Ideas and Roadmap for Future Research

Meta-research examines trustworthy AI in healthcare through interdisciplinary collaboration on transparency, robustness, and evidence standards.

Ax Xinrun Xu, Pi Bu, Ye Wang, B\"orje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Shuo Zhang, Zhiming Ding, Bo Zheng 3/17/2026

ICPRL: Acquiring Physical Intuition from Interactive Control

ICPRL framework enabling VLMs to acquire physical intuition through interactive pixel-based reinforcement learning in dynamic environments. arXiv paper.

Ax Nirmalendu Prakash, Narmeen Oozeer, Michael Lan, Luka Samkharadze, Phillip Howard, Roy Ka-Wei Lee, Dhruv Nathawani, Shivam Raval, Amirali Abdullah 3/17/2026

DreamReader: An Interpretability Toolkit for Text-to-Image Models

DreamReader: unified interpretability toolkit for text-to-image diffusion models enabling activation extraction, causal patching, ablations, and steering. arXiv research.

Ax Fan Wu, Tsai-Ning Wang, Nicolas Zumarraga, Ning Wang, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Oliver Aalami, Paul Schmiedmayer, Robert Jakob, Patrick Langer 3/17/2026

Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings

Multimodal QA framework aligning auscultation recordings with frozen LLM embeddings via gated cross-attention. Applies audio-language models to physiological signal interpretation.

Ax Yu Miao, Zequn Yang, Yake Wei, Ziheng Chen, Haotian Ni, Haodong Duan, Kai Chen, Di Hu 3/17/2026

MIBench: Evaluating LMMs on Multimodal Interaction

MIBench comprehensive benchmark for evaluating multimodal language models on various interaction patterns across modalities.

Ax Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang 3/17/2026

EvoClaw: Evaluating AI Agents on Continuous Software Evolution

EvoClaw benchmark evaluating AI agents on continuous software evolution tasks with temporal dependencies and technical debt.

Ax Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim 3/17/2026

Spatially Grounded Long-Horizon Task Planning in the Wild

Benchmark for assessing whether vision-language models can generate spatially executable robot manipulation plans from task instructions.

Ax Wei Zhuo, Siqiang Luo 3/17/2026

Modality-free Graph In-context Alignment

In-context learning method for graph foundation models enabling cross-domain alignment without modality-specific encoders.