Ax Kathan Shah 23d ago

Token Geometry

Ember optimizer exploits embedding table geometry to improve LLM fine-tuning, RL, and pretraining with minimal optimizer state.

Ax Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Haoran Lu, Weijie Wan, Baijun Chen, Songling Liu, Haowen Yan, Honghao Su, Zhiyang Dou, Kaixuan Wang, Dandan Zhang, Yunze Liu, Yan Qin, Qiwei Liang, Qiwei Wu, Zijian Lin, Wenwei Lin, Yuran Wang, Minghua He, Tianshu Wu, Ruihai Wu, Jingquan Zhou, Kai-Chong Lei, Haibao Yu, Yuanfeng Ji, Weiyang Jin, Guanyu Lin, Xiaofan Li, Qi Xiong, Renjing Xu, Zhongyu Li, Wenhao Chai, Enze Xie, Ziwei Wang, Yao Mu, Hao Dong, Wojciech Matusik, Mingyu Ding, Wenbo Ding, Ping Luo, Masayoshi Tomizuka 23d ago

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

RoboDojo: unified sim-and-real benchmark for evaluating generalist robot manipulation policies across diverse tasks.

Ax Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi 23d ago

Wan-Streamer v0.2: Higher Resolution, Same Latency

Wan-Streamer v0.2: upgraded streaming audio-visual interaction model achieving 640x368 resolution at 200ms latency.

Ax Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping 23d ago

Unified Audio Intelligence Without Regressing on Text Intelligence

Audex: unified audio-text LLM built on Nemotron MoE encoding audio into text embedding space without degrading text performance.

Ax Anthony Hu, V\'aclav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Alyx Liao, Am\'elie Royer, Manu Orsini, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Nor\'en, James Swingos, Jan H\"unermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz B\"ohle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick P\'erez 23d ago

Multiplayer Interactive World Models with Representation Autoencoders

First multiplayer world model for dynamic environments conditioning on multiple agents' action streams with scene coherence.

Ax Pan Li, Kai Chen, Shuai Chang, Shengzhi Zhang, Peizhuo Lv, Jinwen He 23d ago

Differentially Private Natural Gradient Descent

arXiv paper on differentially private natural gradient descent improving optimization efficiency under privacy constraints.

Ax Sahasrajit Sarmasarkar, Anastasia Koloskova, Sanmi Koyejo 23d ago

Auditing of Unlearning Algorithms

arXiv paper proposing practical auditing of unlearning algorithms using membership inference attacks to verify data removal.