Ax Yusen Feng, Bingchen Han, Jiangran Lyu, Kai Liu, Yixin Zheng, Yuxuan Wan, Weiheng Liu, Sun Han, Ruiqin Li, Yulong Zhang, Fangfu Liu, Xuesong Shi, Libin Liu, Yizhou Wang, Zhizheng Zhang, He Wang 22d ago

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time

WAM-TTT: test-time training framework for adapting robot foundation models using human video demonstrations.

Ax Marcus Williams, Hannah Sheahan, Cameron Raymond, Tomek Korbak, Deng Pan, Peilin Yang, Leon Maksin, Ningyi Xie, Phillip Guo, Ian Kivlichan, Micah Carroll 22d ago

Predicting LLM Safety Before Release by Simulating Deployment

arXiv paper on pre-deployment safety evaluation of LLMs by simulating realistic deployment with de-identified conversations.

Ax Xufeng Zhao, Fuzhi Yang, Jianhui Chen, Li Gao, Zhang Meng, Jie Gao, Yao Zheng, Wenyu Liu, Menglin Yang, Minqi Gu, Yaru Zhao, Honglin Han, Shihui Su, Zixiao Tang, Liu Liu, Mu Xu, Yang Cai, Wenbin Tang 22d ago

Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report

Technical report on motion controllers for quadruped robots trained from motion-capture data to bridge semantic reasoning and physical execution.

Ax Bojie Li, Noah Shi 22d ago

RLVP: Penalize the Path, Reward the Outcome

RL framework for training agents in costly real-world interactions that penalizes constraint violations during paths while rewarding final outcomes.