Ax Jiacheng Miao, Jonathan K Pritchard, James Zou 29d ago

The Agentic Garden of Forking Paths

Study showing AI agents capture analytical variation among human researchers; different personas enable agents to report divergent conclusions from identical datasets.

Ax Oskar J. Hollinsworth, Ann-Kathrin Dombrowski, Sam Adam-Day, Adam Gleave, Chris Cundy 29d ago

Scaling Trends for Lie Detector Oversight in Preference Learning

Scaling analysis of SOLiD, a lie detector-based oversight method for identifying deceptive LLM responses, showing improved scaling with larger models in preference learning.

Ax Xingyuan Dai, Yue Liu, Xiaoyan Gong, Qinghai Miao, Junyou Shang, Yutong Wang, Chao Guo, Yonglin Tian, Yizhang Chai, Chao Xiang, Yisheng Lv, Fei-Yue Wang 29d ago

Autonomous discovery of traffic laws with AI traffic scientists

Autonomous AI system discovers universal traffic laws from observational data to identify recurrent congestion patterns across cities.

Ax Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen 29d ago

Distributionally Robust Listwise Preference Optimization

Distributionally robust listwise preference optimization for LLM alignment under ranking-label uncertainty from annotator inconsistency and noise.

Ax Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, L\'aszl\'o A. Jeni 29d ago

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds enables LLM agents to generate dynamic 4D scenes with physics simulation from text, supporting liquids, particles, and articulated motion.

Ax Maximo Rulli (Sapienza University of Rome), Thomas Fontanari (Sapienza University of Rome), Simone Petruzzi (Sapienza University of Rome), Federico Alvetreti (Sapienza University of Rome), Giorgio Strano (Sapienza University of Rome), Donato Crisostomi (Sapienza University of Rome), Giorgos Nikolaou (EPFL), Tommaso Mencattini (EPFL), Andrea Santilli (Independent researcher), Emanuele Rodol\`a (Sapienza University of Rome), Simone Scardapane (Sapienza University of Rome), Alessio Devoto (Independent researcher) 29d ago

Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

Studies latent time representations in Diffusion Language Models, showing they internally encode denoising progress information without explicit timestep conditioning.

Ax Joshua Adrian Cahyono 29d ago

Safety Targeted Embedding Exploit via Refinement

STEER identifies safety gaps in LLM multilingual and code-switching inputs, revealing models generate harmful responses outside English safety training distribution.

Ax Jiankai Jin, Xiangzheng Zhang, Zhao Liu, Wenzhuo Xu, Dongdong Yang, Deyue Zhang, Quanchen Zou 29d ago

ElephantAgent: Contextual State Continuity in Agentic Systems

ElephantAgent: framework for maintaining verifiable contextual state continuity in agentic systems under tool and memory poisoning attacks.

Ax Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig 29d ago

PACE: A Proxy for Agentic Capability Evaluation

PACE shows that cheap non-agentic LLM benchmark performance can accurately predict expensive agentic benchmark results, enabling cost-effective agent capability evaluation.

Ax Ya Gao, Pekka Marttinen 29d ago

Evidence-State Rewards for Long-Context Reasoning

Maven is an RL framework with editable evidence memory for long-context reasoning, defining evidence-state value and reward functions for intermediate reasoning steps.

Ax Misha Sulpovar (PromptOwl, LLC), Benn R. Konsynski (Goizueta Business School, Emory University), Qaish Kanchwala (IBM Research), Gabe Goodhart (IBM Research) 29d ago

ContextNest: Verifiable Context Governance for Autonomous AI Agent

ContextNest formalizes context governance for autonomous AI agents, providing open spec for knowledge vaults with provenance, versioning, integrity, and traceability.