Ax Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong 3/31/2026

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2 improves vision foundation model pretraining using developmental psychology principles and introduces DevCV Toolbox for cognitive evaluation.

Ax Sida Wang 3/31/2026

Measuring all the noises of LLM Evals

Measuring all the noises of LLM Evals defines and quantifies three types of noise in LLM evaluation to improve experimental signal-to-noise ratio.

Ax Hengyu Liu, Tianyi Li, Haoyu Wang, Kristian Torp, Yushuai Li, Tiancheng Zhang, Torben Bach Pedersen, Christian S. Jensen 3/31/2026

CLEAR: A Knowledge-Centric Vessel Trajectory Analysis Platform

Knowledge-centric vessel trajectory analysis platform leveraging LLMs to transform raw maritime AIS data for expert analysis.

Ax G. Ciarfaglia, A. Rosanova, S. Cipolla, J. Bartoli, A. Di Domenico, C. Fioroni, A. Fontana, M. R. Scoleri, M. I. Mone, D. Franchi, M. C. Del Gaudio, A. Leodori, F. Cinti, M. Capozzi, C. Baston, F. Picariello, M. Gabusi, S. Bonura, V. Morreale, I. Bailo 3/31/2026

EngGPT2: Sovereign, Efficient and Open Intelligence

EngGPT2-16B Italian LLM achieving competitive performance on MMLU-Pro, GSM8K, and HumanEval with 5-50% lower inference cost.

Ax Jian Yang, Wei Zhang, Jiajun Wu, Junhang Cheng, Shawn Guo, Haowen Wang, Weicheng Gu, Yaxin Du, Joseph Li, Fanglin Xu, Yizhi Li, Lin Jing, Yuanbo Wang, Yuhan Gao, Ruihao Gong, Chuan Hao, Ran Tao, Aishan Liu, Tuney Zheng, Ganqu Cui, Zhoujun Li, Mingjie Tang, Chenghua Lin, Wayne Xin Zhao, Xianglong Liu, Ming Zhou, Bryan Dai, Weifeng Lv 3/31/2026

InCoder-32B: Code Foundation Model for Industrial Scenarios

InCoder-32B code foundation model optimized for industrial programming tasks with hardware semantics and resource constraints.

Ax Yan Xie, Tiansheng Wen, Tangda Huang, Bo Chen, Chenyu You, Stefanie Jegelka, Yifei Wang 3/31/2026

Scaling Attention via Feature Sparsity

Sparse Feature Attention: Method to reduce transformer self-attention complexity via feature sparsity instead of sequence-level sparsity.

Ax Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury 3/31/2026

Code Review Agent Benchmark

Code Review Agent Benchmark: Dataset for evaluating AI agents on code quality assurance and review tasks.