Ax Jamison Meindl, Yunsheng Tian, Tony Cui, Veronika Thost, Zhang-Wei Hong, Jie Chen, Wojciech Matusik, Mina Konakovi\'c Lukovi\'c 5/18/2026

SemanticOpt: Towards LLM-Based Semantic Black-Box Optimization

SemanticOpt uses LLMs to optimize expensive black-box problems by incorporating domain knowledge, expert heuristics, and scientific papers beyond traditional Bayesian optimization.

Ax Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh 5/18/2026

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

Reinforcement learning with evolving rubrics for training deep research agents on long-form attributed answers without verifiable rewards.

Ax Hanjun Luo, Chiming Ni, Jiaheng Wen, Zhimu Huang, Yiran Wang, Bingduo Liao, Sylvia Chung, Yingbin Jin, Xinfeng Li, Wenyuan Xu, XiaoFeng Wang, Hanan Salam 5/18/2026

HAI-Eval: Measuring Human-AI Synergy in Collaborative Coding

Evaluation framework for measuring human-AI collaboration in coding, beyond traditional benchmarks to capture collaborative problem-solving.

Ax Francesca Rossi, Veronica Centorrino, Francesco Bullo, Giovanni Russo 5/18/2026

Neural Policy Composition from Free Energy Minimization

Theoretical framework for composing learned policies from free energy minimization principles, modeling context-dependent gating mechanisms.

Ax Yixuan Even Xu, John Kirchenbauer, Yash Savani, Asher Trockman, Alexander Robey, Tom Goldstein, Fei Fang, J. Zico Kolter 5/18/2026

Antidistillation Fingerprinting

Fingerprinting technique to detect when student LLMs are trained on teacher model outputs, balancing detection strength with generation quality.

Ax Changyue Wang, Weihang Su, Qingyao Ai, Yiqun Liu 5/18/2026

Improve Large Language Model Systems with User Logs

Method for improving LLMs through continual learning from user interaction logs and deployment feedback instead of just scaling data/parameters.

Ax Zigeng Chen, Gongfan Fang, Xinyin Ma, Ruonan Yu, Xinchao Wang 5/18/2026

DMax: Aggressive Parallel Decoding for dLLMs

DMax paradigm enables aggressive parallel decoding in diffusion language models through progressive self-refinement from mask to token embeddings.

Ax Andrey Bocharnikov, Ivan Ermakov, Denis Kuznedelev, Vyacheslav Zhdanovskiy, Yegor Yershov 5/18/2026

KV Cache Offloading for Context-Intensive Tasks

Technique for offloading key-value cache to reduce memory footprint and inference latency in long-context LLM applications.

Ax Zhaokun Wang, Jinyu Guo, Jingwen Pu, Hongli Pu, Meng Yang, Xunlei Chen, Jie Ou, Wenyi Li, Guangchun Luo, Wenhong Tian 5/18/2026

CAP: Controllable Alignment Prompting for Unlearning in LLMs

Method for selective knowledge unlearning in LLMs using controllable alignment prompting without modifying model weights.

Ax Debeshee Das, Julien Piet, Darya Kaviani, Luca Beurer-Kellner, Florian Tram\`er, David Wagner 5/18/2026

Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration

Demonstrates Trojan Hippo attack enabling data exfiltration from LLM agents via dormant payloads planted in long-term memory through single untrusted tool call.

Ax Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari 5/18/2026

AIPO: Learning to Reason from Active Interaction

Proposes AIPO method enabling LLMs to learn reasoning through active interaction with environments, extending exploration beyond policy model capability boundaries.

Ax Jerem\'ias Figueiredo Paschmann, Juan Kaplan, Francisco Nattero, Santiago Barron, Juan Wisznia, Luciano del Corro 5/18/2026

Active Learners as Efficient PRP Rerankers

Reframing pairwise ranking prompting reranking as active learning problem to improve top-K ranking under noisy and intransitive LLM judgments.

Ax Xiang Shen, Yuhang Zhou, Yifan Wu, Zhuokai Zhao, Siyu Lin, Lei Huang, Qianqian Zhong, Lizhu Zhang, Benyu Zhang, Xiangjun Fan, Hong Yan 5/18/2026

Agentic Recommender System with Hierarchical Belief-State Memory

MARS framework for memory-augmented LLM agents in recommendation, using hierarchical belief-state memory instead of flat representations.

Ax Zheng Yan, Jingxiang Weng, Charles Chen, Dengyun Peng, Ethan Qin, Jiannan Guan, Jinhao Liu, Qiming Yu, Yixin Yuan, Fanqing Meng, Carl Che, Mengkang Hu 5/18/2026

Do Coding Agents Understand Least-Privilege Authorization?

Study evaluating whether coding agents understand least-privilege authorization principles, introducing permission-boundary inference task.