Ax Huayang Li, Tianyu Zhao, Deng Cai, Richard Sproat 3/6/2026

RePo: Language Models with Context Re-Positioning

Proposes RePo, a method to improve in-context learning in LLMs by dynamically repositioning context based on Cognitive Load Theory principles.

Ax Tian Xie, Haoming Luo, Haoyu Tang, Yiwen Hu, Jason Klein Liu, Qingnan Ren, Yang Wang, Wayne Xin Zhao, Rui Yan, Bing Su, Chong Luo, Baining Guo 3/6/2026

Controlled LLM Training on Spectral Sphere

Research on optimization strategies for scaling LLMs, introducing Spectral Sphere method to address weight drift limitations in μP and Muon optimizers.

Ax YuanLab. ai, :, Shawn Wu, Jiangang Luo, Darcy Chen, Sean Wang, Louie Li, Allen Wang, Xudong Zhao, Tong Yu, Bach Li, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Daniel Zhao, Penn Zheng, Owen Zhu 3/6/2026

Yuan3.0 Ultra: A Trillion-Parameter Enterprise-Oriented MoE LLM

Open-source trillion-parameter MoE LLM with 68.8B activated parameters using Layer-Adaptive Expert Pruning for enterprise and general-purpose tasks.

Ax Yair Schiff, Omer Belhasin, Roy Uziel, Guanghan Wang, Marianne Arriola, Gilad Turok, Michael Elad, Volodymyr Kuleshov 3/6/2026

Learn from Your Mistakes: Self-Correcting Masked Diffusion Models

Framework enabling masked diffusion models to correct their own tokens iteratively, reducing error accumulation in parallel generation.

Ax Alex Morehead, Miruna Cretu, Antonia Panescu, Rishabh Anand, Maurice Weiler, Tynan Perez, Samuel Blau, Steven Farrell, Wahid Bhimji, Anubhav Jain, Hrushikesh Sahasrabuddhe, Pietro Lio, Tommi Jaakkola, Rafael Gomez-Bombarelli, Rex Ying, N. Benjamin Erichson, Michael W. Mahoney 3/6/2026

Zatom-1: A Multimodal Flow Foundation Model for 3D Molecules and Materials

Zatom-1 open-source foundation model for unified generative and predictive learning on 3D molecules and materials.

Ax Pei Yang, Wanyi Chen, Asuka Yuxi Zheng, Xueqian Li, Xiang Li, Haoqin Tu, Jie Xiao, Yifan Pang, Dongdong Zhang, Fuqiang Li, Alfred Long, Bill Shi, Lynn Ai, Eric Yang 3/6/2026

AOI: Turning Failed Trajectories into Training Signals for Autonomous Cloud Diagnosis

AOI framework for training LLM agents to diagnose cloud infrastructure failures using failed trajectories as learning signals, addressing safety and data constraints.

Ax William Merrill, Hongjian Jiang, Yanhong Li, Anthony Lin, Ashish Sabharwal 3/6/2026

Why Are Linear RNNs More Parallelizable?

Analysis of why linear RNNs achieve transformer-level parallelizability compared to nonlinear RNNs for language modeling.

Ax Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych 3/6/2026

How Quantization Shapes Bias in Large Language Models

Comprehensive evaluation of how weight and activation quantization affects model bias across stereotypes, fairness, toxicity, and sentiment.