Ax Mingzhi Chen, Taiming Lu, Jiachen Zhu, Mingjie Sun, Zhuang Liu 4/1/2026

Stronger Normalization-Free Transformers

Alternative activation functions surpassing Dynamic Tanh for stable training in normalization-free transformer architectures.

Ax Yi-Kai Zhang, Zhiyuan Yao, Hongyan Hao, Yueqing Sun, Qi Gu, Hui Su, Xunliang Cai, De-Chuan Zhan, Han-Jia Ye 4/1/2026

$V_0$: A Generalist Value Model for Any Policy at State Zero

Generalist value model for policy evaluation in LLM training with actor-critic methods, reducing computational cost of critic networks.

Ax Jian Yang, Wei Zhang, Jiajun Wu, Junhang Cheng, Shawn Guo, Haowen Wang, Weicheng Gu, Yaxin Du, Joseph Li, Fanglin Xu, Yizhi Li, Lin Jing, Yuanbo Wang, Yuhan Gao, Ruihao Gong, Chuan Hao, Ran Tao, Aishan Liu, Tuney Zheng, Ganqu Cui, Zhoujun Li, Mingjie Tang, Chenghua Lin, Wayne Xin Zhao, Xianglong Liu, Ming Zhou, Bryan Dai, Weifeng Lv 4/1/2026

InCoder-32B: Code Foundation Model for Industrial Scenarios

InCoder-32B is a 32B code foundation model optimized for industrial scenarios requiring hardware semantics, specialized constructs, and strict resource constraints.

Ax Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Velickovic 4/1/2026

How do LLMs Compute Verbal Confidence

Research investigation into how LLMs internally compute verbal confidence scores and whether they are generated just-in-time or cached during answer generation.

Ax Yuma Ichikawa, Keiji Kimura, Akihiro Yoshida, Yudai Fujimoto, Hiroki Tokura, Yamato Arai, Yoshiyuki Ishii, Yusei Kawakami, Genki Shikada, Achille Jacquemond, Yoshihiko Fujisawa, Katsuki Fujisawa, Takumi Honda, Akira Sakai 4/1/2026

OneComp: One-Line Revolution for Generative AI Model Compression

Framework for post-training compression of generative AI models with single-line implementation, addressing quantization and calibration challenges.