Ax Priyadarshini Tamilselvan, Gregory Bramble, Sola Shirai, Ken C. L. Wong, Faisal Chowdhury, Horst Samulowitz 3/12/2026

Agentic Control Center for Data Product Optimization

System automating data product improvement using specialized AI agents to generate supporting assets and example queries without manual expertise.

Ax Sibo Zhu, Wenyi Wu, Kun Zhou, Stephen Wang, Biwei Huang 3/12/2026

Hybrid Self-evolving Structured Memory for GUI Agents

Structured memory system for GUI agents combining trajectory-based and learned memory to handle long-horizon workflows and interface diversity.

Ax Wenjing Zhang, Jiangze Yan, Jieyun Huang, Yi Shen, Shuming Shi, Ping Chen, Ning Wang, Zhaoxiang Liu, Kai Wang, Shiguo Lian 3/12/2026

HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation

HEAL method for distilling reasoning from large reasoning models into smaller models using hindsight entropy to overcome teacher ceiling limitations.

Ax Chuan Guo (Michael Pokorny), Juan Felipe Ceron Uribe (Michael Pokorny), Sicheng Zhu (Michael Pokorny), Christopher A. Choquette-Choo (Michael Pokorny), Steph Lin (Michael Pokorny), Nikhil Kandpal (Michael Pokorny), Milad Nasr (Michael Pokorny), Rai (Michael Pokorny), Sam Toyer, Miles Wang, Yaodong Yu, Alex Beutel, Kai Xiao 3/12/2026

IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs

Training dataset addressing instruction hierarchy in frontier LLMs to defend against jailbreaks, prompt injections, and agentic attacks.

Ax Ryma Boumazouza, Raya Elsaleh, Melanie Ducoffe, Shahaf Bassan, Guy Katz 3/12/2026

FAME: Formal Abstract Minimal Explanation for Neural Networks

FAME proposes formal abstract minimal explanations for neural networks using abstract interpretation, scaling to large models with reduced explanation size.

Ax Ruiyang Ren, Yuhao Wang, Yunsen Liang, Lan Luo, Jing Liu, Haifeng Wang, Cong Feng, Yinan Zhang, Chunyan Miao, Ji-Rong Wen, Wayne Xin Zhao 3/12/2026

Emulating Clinician Cognition via Self-Evolving Deep Clinical Research

DxEvolve is a self-evolving diagnostic agent mimicking clinician cognition through interactive deep clinical research with auditable improvement mechanisms.

Ax Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang 3/12/2026

Explainable LLM Unlearning Through Reasoning

Research on LLM unlearning through reasoning to remove undesirable knowledge while mitigating safety, copyright, and privacy issues.

Ax Jon Chun, Hannah Sussman, Adrian Mangine, Murathan Kocaman, Kirill Sidorko, Abhigya Koirala, Andre McCloud, Gwen Eisenbeis, Wisdom Akanwe, Moustapha Gassama, Eliezer Gonzalez Chirinos, Anne-Duncan Enright, Peter Dunson, Tiffanie Ng, Anna von Rosenstiel, Godwin Idowu 3/12/2026

CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models

CEI benchmark with 300 validated scenarios for evaluating pragmatic reasoning and contextual inference in LLMs.

Ax Ninareh Mehrabi, Vitor Albiero, Maya Pavlova, Joanna Bitton 3/12/2026

FERRET: Framework for Expansion Reliant Red Teaming

Automated red teaming framework for generating multi-modal adversarial conversations to test LLM robustness with expansion techniques.

Ax Jack FitzGerald, Dylan Bates, Aristotelis Lazaridis, Aman Sharma, Vincent Lu, Brian King, Yousif Azami, Sean Bailey, Jeremy Cao, Peter Damianov, Kevin de Haan, Joseph Madigan, Jeremy McLaurin, Luke Kerbs, Jonathan Tainer, Dave Anderson, Jonathan Beck, Jamie Cuticello, Colton Malkerson, Tyler Saltsman 3/12/2026

Measuring and Eliminating Refusals in Military Large Language Models

Research on measuring and reducing safety refusals in military LLMs to enable accurate information provision in combat scenarios.