Ax Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis 23d ago

Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents

arXiv paper introducing PROBE benchmark for measuring proactive problem-solving in LLM agents across longer time horizons and multiple information sources.

Ax Claire Yang, Claire Jie Zhang, Maya Cakmak, Max Kleiman-Weiner 23d ago

When Assisting One Disempowers Another

arXiv paper formalizing bystander disempowerment: how AI agents optimizing for one user unintentionally erode bystanders' agency in shared environments.

Ax Zeyu Xia, Jinzhe Ma, Congjie Zheng, Zhongyao Wang, Shufei Zhang, Yuqiang Li, Hang Su, P. Hu, Changshui Zhang, Xingao Gong, Wanli Ouyang, Lei Bai, Dongzhan Zhou, Mao Su 23d ago

VASP Agent: An Agentic Framework for Autonomous First-principles Calculations

arXiv paper presenting VASP Agent, LLM-based coding agent for autonomous first-principles materials computation with workspace-state management.

Ax Wouter W. L. Nuijten, Mykola Lukashchuk, Thijs van de Laar, Bert de Vries 23d ago

What Type of Inference is Active Inference?

arXiv paper proving active inference can be rewritten as VFE minimization with entropy-correction terms, unifying goal-directed and information-seeking behavior.

Ax Pu Li, Zhigang Lin, Qiang Wu, Yongxuan Lv, Fei Wang, Shan You 23d ago

Reward as An Agent for Embodied World Models

Framework using reward functions as agents to enable broader exploration in embodied world models beyond conservative training distributions.

Ax Akhiad Bercovich, Talor Abramovich, Daniel Afrimi, Shay Aharon, Nir Ailon, Vladimir Anisimov, Omer Ullman Argov, Maor Ashkenazi, Tomer Asida, Nave Assaf, Tomer Bar Natan, Alexander Bukharin, Grzegorz Chlebus, Marcin Chochowski, Eric Chung, Mohammad Dabbah, Carlo del Mundo, Ewa Dobrowolska, Ido Galil, Yaniv Galron, Amnon Geifman, Yonatan Geifman, Izik Golan, Alex Gronskiy, Tomasz Grzegorzek, Netanel Haber, Lior Kadoch, Grzegorz Karch, Tomer Keren, Abhinav Khattar, Amir Klein, Tugrul Konuk, Roi Koren, Daniel Korzekwa, Shaun Kotek, Konstantinos Krommydas, Itay Levy, Ofri Masad, Yoav Miron, Pavlo Molchanov, Shahar Mor, Zach Moshe, Saurav Muralidharan, Najeeb Nabwani, Besmira Nushi, Mostofa Patwary, Omri Puny, Johannes Rausch, Tomer Ronen, Sepehr Sameni, Itamar Schen, Elad Segal, Daniel Serebrenik, Ido Shahaf, Soumye Singhal, Daniil Sorokin, Sharath Turuvekere Sreenivas, Marta Stepniewska-Dziubinska, Ali Taghibakhshi, Nima Tajbakhsh, Oren Tropp, Dor Tzur, Anna Warno, Yi-Fu Wu, Michal Zawalski, Jiaqi Zeng, Yian Zhang, Ran Zilberstein, Amit Zuker, Ran El-Yaniv 23d ago

Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs

Nemotron-Labs-3-Puzzle-75B-A9B: compressed hybrid MoE LLM variant optimized for interactive deployment with 2x throughput improvement.

Ax Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini 23d ago

LLM-as-a-Verifier: A General-Purpose Verification Framework

LLM-as-a-Verifier: framework for verification as a scaling axis, providing fine-grained feedback for agentic tasks without ground truth.

Ax Christiaan Meijer, E. G. Patrick Bos 23d ago

Explainable embeddings with Distance Explainer

Distance Explainer: novel post-hoc method for interpreting embeddings by explaining distances between data points using saliency-based attribution.

Ax Lorenzo Steccanella, Joshua B. Evans, \"Ozg\"ur \c{S}im\c{s}ek, Anders Jonsson 23d ago

Learning The Minimum Action Distance

Framework learning minimum action distance from state trajectories for environment structure representation in MDPs.

Ax Gang Liao, Hongsen Qin, Ying Wang, Alicia Golden, Michael Kuchnik, Yavuz Yetim, Jia Jiunn Ang, Chunli Fu, Yihan He, Samuel Hsia, Zewei Jiang, Dianshi Li, Uladzimir Pashkevich, Varna Puvvada, Feng Shi, Matt Steiner, Ruichao Xiao, Liyuan Li, Nathan Yan, Xiayu Yu, Zhou Fang, Roman Levenstein, Kunming Ho, Haishan Zhu, Alec Hammond, Richard Li, Ajit Mathews, Kaustubh Gondkar, Abdul Zainul-Abedin, Ketan Singh, Hongtao Yu, Wenyuan Chi, Barney Huang, Sean Zhang, Noah Weller, Zach Marine, Wyatt Cook, Carole-Jean Wu, Gaoxiang Liu 23d ago

KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta

KernelEvolve: Agentic framework for automated kernel coding targeting heterogeneous AI accelerators at scale for DLRM.

Ax Gloria Felicia (University of Virginia), Zitha Sasindran (Indian Institute of Science Bangalore), Jinfeng He (Cornell University), Michael Eniolade (University of the Cumberlands), Hemant Kumar (University of Arizona), Milan Hussain Angati (California State University Northridge) 23d ago

StepShield: When, Not Whether to Intervene on Rogue Agents

StepShield: First agent safety benchmark measuring detection timeliness for rogue agents via Early Intervention Rate metric.

Ax Stefano Woerner, Seong Joon Oh, Christian F. Baumgartner 23d ago

Universal Algorithm-Implicit Learning

Theoretical framework for universal meta-learning with formal definitions of practical universality across task distributions.

Ax Rahul Marchand, Art O Cathain, Jerome Wynne, Philippos Maximos Giavridis, Sam Deverett, John Wilkinson, Jason Gwartz, Harry Coppock 23d ago

Quantifying Frontier LLM Capabilities for Container Sandbox Escape

SandboxEscapeBench: Open benchmark measuring LLM agent capabilities to escape container sandbox environments, addressing agentic AI security risks.

Ax Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q. Knight, Joseph Brandifino, Max Fenkell 23d ago

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

ROK-FORTRESS bilingual benchmark measuring LLM safety risks across geopolitical and cultural contexts for national security scenarios.