Ax Yashar Talebirad, Ali Parsaee, Csongor Y. Szepesvari, Amirhossein Nadiri, Osmar Zaiane 3/24/2026

Toward a Theory of Hierarchical Memory for Language Agents

Theoretical framework for hierarchical memory in language agents, unifying design choices for multi-level compression and retrieval under token budgets.

Ax Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang 3/24/2026

Rethinking Token Reduction for Large Vision-Language Models

Method for efficient token reduction in vision-language models for multi-turn QA, addressing practical inference cost challenges.

Ax Jesper B. Christensen, Ciaran Bench, Spencer A. Thomas, H\"usn\"u Aslan, David Balslev-Harder, Nadia A. S. Smith, Alessandra Manzin 3/24/2026

Ctrl-A: Control-Driven Online Data Augmentation

Ctrl-A automated data augmentation algorithm using control theory for dynamic adjustment of augmentation strength during training.

Ax Antonio Purificato, Maria Sofia Bucarelli, Andrea Bacciu, Amin Mantrach, Fabrizio Silvestri 3/24/2026

Select, Label, Evaluate: Active Testing in NLP

Active Testing framework reduces annotation costs in NLP by selecting informative test samples instead of annotating entire test sets.

Ax Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang 3/24/2026

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

Manifold-aware exploration for GRPO in video generation, mitigating noise injection from ODE-to-SDE conversion to stabilize post-training alignment.

Ax Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun 3/24/2026

P^2O: Joint Policy and Prompt Optimization

P²O jointly optimizes policy and prompts for reinforcement learning with verifiable rewards, improving exploration on hard samples in LLMs.