Ax Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye 29d ago

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

Addresses failure of on-policy self-distillation on long chain-of-thought reasoning, proposing method to maintain model thinking capability.

Ax Kuo-Chung Peng, Jiun-Cheng Jiang, Chun-Hua Lin, Yifeng Peng, Junghoon Justin Park, Huan-Hsin Tseng, Hsin-Yi Lin, Kuan-Cheng Chen, Chen-Yu Liu, Shinjae Yoo, Samuel Yen-Chi Chen 29d ago

Stable Self-Modulating Quantum Fast-Weight Programmers with Bounded Memory Gates

Proposes quantum sequence modeling using variational circuits with self-modulating gates and bounded memory for stable long-sequence processing.

Ax Jakob Geusen, Ender Konukoglu 29d ago

Object-centric LeJEPA

arXiv paper on object-centric LeJEPA for more data-efficient self-supervised image representation learning.

Ax Juanwu Lu, Junyu Zhu, Ziran Wang 29d ago

Controllable Sim Agents with Behavior Latents

CNeVA framework for controllable simulated traffic agents with interpretable behavior latents enabling edge case testing and variable isolation.

Ax Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick 29d ago

Online Safety Monitoring for LLMs

Real-time safety monitoring framework for LLMs using external verifiers with risk-calibrated thresholds to detect unsafe outputs at deployment.

Ax Shivam Singhal, Priyadarsi Mishra, Eran Malach, Tomer Galanti 29d ago

LLM Priors for ERM over Programs

Method using LLM priors to enable efficient program learning through empirical risk minimization with fewer samples and less computation.

Ax Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji 29d ago

Locality-Aware Continual Unlearning for Diffusion Models

Method for continual unlearning in diffusion models to progressively remove concepts while maintaining generation quality across multiple removal steps.

Ax Lukas Sch\"afer, Pallavi Choudhury, Abdelhak Lemkhenter, Chris Lovett, Somjit Nath, Luis Fran\c{c}a, Matheus Ribeiro Furtado de Mendon\c{c}a, Alex Lamb, Riashat Islam, Siddhartha Sen, John Langford, Katja Hofmann, Sergio Valcarcel Macua 29d ago

When Does Predictive Inverse Dynamics Outperform Behavior Cloning?

Theoretical analysis comparing predictive inverse dynamics models to behavior cloning for offline imitation learning with limited demonstrations.

Ax Chenxiao Yang, Nathan Srebro, Zhiyuan Li 29d ago

Recursive Models for Long-Horizon Reasoning

Framework enabling language models to overcome context limitations by recursively invoking themselves to solve long-horizon reasoning problems.

Ax Abbas Zeitoun, Lucas Torroba-Hennigen, Yoon Kim 29d ago

Hyperloop Transformers

Parameter-efficient LLM architecture using looped transformers to improve memory efficiency for edge and on-device deployment.

Ax Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang 29d ago

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

Benchmark with 40 tasks across 10 scientific domains for evaluating end-to-end autonomous research capabilities of AI coding agents.

Ax Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi 29d ago

Staleness-Learning Rate Scaling Laws for Asynchronous RLHF

Analysis of learning rate scaling laws for asynchronous RLHF with stale rollouts in high-throughput LLM training.

Ax Raj Ghugare, Roger Creus Castanyer, Catherine Ji, Kathryn Wantlin, Jin Schofield, Karthik Narasimhan, Benjamin Eysenbach 29d ago

BuilderBench: The Building Blocks of Intelligent Agents

BuilderBench evaluates AI agents on acquiring skills through interaction and exploration rather than mimicry, measuring scalable learning mechanisms for novel problem-solving.