Ax Ruiying Li, Yunlang Zhou, YuYao Zhu, Kylin Chen, Jingyuan Wang, Sukai Wang, Kongtao Hu, Minhui Yu, Bowen Jiang, Zhan Su, Jiayao Ma, Xin He, Yongjian Shen, Yangyang, Guanghui Ren, Maoqing Yao, Wenhao Wang, Yao Mu 3/13/2026

RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks

RoboClaw: agentic framework for long-horizon robotic tasks unifying vision-language-action systems with data collection and policy learning.

Ax Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li 3/13/2026

Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats

Security analysis of autonomous LLM agents (OpenClaw), identifying attack surfaces across five-layer lifecycle and proposing mitigations.

Ax Aleksei Petrenko, Ben Lipkin, Kevin Chen, Erik Wijmans, Marco Cusumano-Towner, Raja Giryes, Philipp Kr\"ahenb\"uhl 3/13/2026

Entropy-Preserving Reinforcement Learning

Policy gradient algorithm improvement preserving entropy and trajectory diversity during language model reasoning training.

Ax Aleksander Jarz\k{e}bowicz, Adam Przyby{\l}ek, Jacinto Estima, Yen Ying Ng, Jakub Swacha, Beata Zielosko, Lech Madeyski, Noel Carroll, Kai-Kristian Kemell, Bartosz Marcinkowski, Alberto Rodrigues da Silva, Viktoria Stray, Netta Iivari, Anh Nguyen-Duc, Jorge Melegati, Boris Deliba\v{s}i\'c, Emilio Insfran 3/13/2026

The Landscape of Generative AI in Information Systems: A Synthesis of Secondary Reviews and Research Agendas

Systematic review synthesizing 28 secondary studies on generative AI adoption in organizations, identifying technical and organizational challenges.

Ax Lu Wang (The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China), Zhuoran Jin (The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China), Yupu Hao (The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China), Yubo Chen (The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China), Kang Liu (The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China), Yulong Ao (Beijing Academy of Artificial Intelligence), Jun Zhao (The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China) 3/13/2026

Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models

Online streaming segment-level memory system for multi-turn video reasoning in multimodal LLMs enabling concurrent perception and generation.

Ax Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang 3/13/2026

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench evaluates whether LLMs can generate efficient compute kernels for mobile devices, introducing benchmark dataset for systematic investigation.

Ax Maximilian Schmidt, Swantje Plambeck, Markus Knitt, Hendrik Rose, Goerschwin Fey, Jan Christian Wieck, Stephan Balduin 3/13/2026

Flowcean - Model Learning for Cyber-Physical Systems

Flowcean: automated data-driven model generation framework for cyber-physical systems focusing on modularity and usability.

Ax Dimitri Staufer, Kirsten Morehouse, David Hartmann, Bettina Berendt 3/13/2026

Human-Centred LLM Privacy Audits: Findings and Frictions

LMP2: browser-based self-audit tool for inspecting LLM associations with individuals, with user study findings on privacy and model behavior.

Ax William Brach, Tomas Bedej, Jacob Nielsen, Jacob Pichna, Juraj Bedej, Eemeli Saarensilta, Julie Dupouy, Gianluca Barmina, Andrea Blasi N\'u\~nez, Peter Schneider-Kamp, Kristian Ko\v{s}\v{t}\'al, Michal Ries, Lukas Galke Poech 3/13/2026

SommBench: Assessing Sommelier Expertise of Language Models

SommBench: multilingual benchmark assessing LLM capabilities in sommelier expertise, evaluating cultural knowledge beyond linguistic encoding.

Ax Zhoujun Cheng, Yutao Xie, Yuxiao Qu, Amrith Setlur, Shibo Hao, Varad Pimpalkhute, Tongtong Liang, Feng Yao, Zhengzhong Liu, Eric Xing, Virginia Smith, Ruslan Salakhutdinov, Zhiting Hu, Taylor Killian, Aviral Kumar 3/13/2026

IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL

IsoCompute Playbook: scaling laws for optimal compute allocation in LLM reinforcement learning post-training across rollouts, batches, and update steps.

Ax {\L}ukasz Borchmann, Jordy Van Landeghem, Micha{\l} Turski, Shreyansh Padarha, Ryan Othniel Kearns, Adam Mahdi, Niels Rogge, Cl\'ementine Fourrier, Siwei Han, Huaxiu Yao, Artemis Llabr\'es, Yiming Xu, Dimosthenis Karatzas, Hao Zhang, Anupam Datta 3/13/2026

Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections

MADQA: benchmark with 2,250 questions over 800 PDFs evaluating whether multimodal agents use strategic reasoning or stochastic search in document-intensive workflows.