Ax Ole-Christoffer Granmo, Youmna Abdelwahab, Per-Arne Andersen, Karl Audun K. Borgersen, Paul F. A. Clarke, Kunal Dumbre, Ylva Gr{\o}nnings{\ae}ter, Vojtech Halenka, Runar Helin, Lei Jiao, Ahmed Khalid, Rebekka Omslandseter, Rupsa Saha, Mayur Shende, Xuan Zhang 5/7/2026

The Tsetlin Machine Goes Deep: Logical Learning and Reasoning With Graphs

Graph Tsetlin Machine extending interpretable logical learning to graph-structured inputs for pattern recognition.

Ax Nicklas Werge, Yi-Shan Wu, Manuel Haussmann, Bahareh Tasdighi, Melih Kandemir 5/7/2026

Adaptive Ensemble Aggregation for Actor-Critics

Adaptive ensemble aggregation algorithm for actor-critic reinforcement learning that dynamically balances bias and variance.

Ax Dingwei Zhu, Zhiheng Xi, Shihan Dou, Yuhui Wang, Sixian Li, Junjie Ye, Honglin Guo, Shichun Liu, Chenhao Huang, Yajie Yang, Junlin Shang, Senjie Jin, Ming Zhang, Jiazheng Zhang, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui 5/7/2026

DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training

DVPO algorithm for stable LLM post-training via distributional value modeling, handling noisy supervision in RL settings.

Ax Leon G\"otz, Lars Frederik Peiss, Erik Sauer, Andreas Udo Sass, Thorsten Bagdonat, Stephan G\"unnemann, Leo Schwinn 5/7/2026

A Scalable Multi-Task Model for Virtual Sensors

Multi-task learning approach for virtual sensors using time series foundation models to predict signals from available measurements.

Ax Mingda Liu, Zhenghan Zhu, Ze'an Miao, Katsuki Fujisawa 5/7/2026

Norm Anchors Make Model Edits Last

Identifies norm-feedback loops causing sequential model edits to fail, proposes norm anchors to stabilize edit composition.

Ax Dingwei Zhu, Zhiheng Xi, Shihan Dou, Jiahan Li, Chenhao Huang, Junjie Ye, Sixian Li, Mingxu Chai, Yuhui Wang, Yajie Yang, Ming Zhang, Jiazheng Zhang, Shichun Liu, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang 5/7/2026

DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training

DFPO: distributional flow method for robust LLM post-training via distributional RL, improving OOD generalization with fine-grained value modeling.

Ax Zhaokun Wang, Jinyu Guo, Jingwen Pu, Hongli Pu, Meng Yang, Xunlei Chen, Jie Ou, Wenyi Li, Guangchun Luo, Wenhong Tian 5/7/2026

CAP: Controllable Alignment Prompting for Unlearning in LLMs

CAP: Controllable Alignment Prompting for unlearning sensitive information from LLMs without parameter access, enabling regulatory compliance.

Ax Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan 5/7/2026

AI Alignment via Incentives and Correction

AI Alignment via Incentives and Correction: Framework applying law-and-economics deterrence models to prevent misconduct in agentic AI systems.