Ax Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria Khoshtab, Wei-Chieh Sun, Parnian Fazel, Zhi Rui Tam, Thomas Chong, Edisy Kin Wai Chan, Donald Wai Tong Tsang, Chiao-Wei Hsu, Ting Wai Lam, Ho Yin Sam Ng, Chiafeng Chu, Chak-Wing Mak, Keming Wu, Hiu Tung Wong, Yik Chun Ho, Chi Ruan, Zhuofeng Li, I-Sheng Fang, Shih-Ying Yeh, Ho Kei Cheng, Ping Nie, Wenhu Chen 3/31/2026

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

ImagenWorld benchmark with 3.6K condition sets and explainable human evaluation across six image generation and editing tasks.

Ax Koki Maeda (Institute of Science Tokyo, Tokyo, Japan, Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan), Naoaki Okazaki (Institute of Science Tokyo, Tokyo, Japan, Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan) 3/31/2026

JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding

Benchmark for Japanese scene text understanding in vision-language models addressing mixed scripts, vertical writing, and large character inventory.

Ax Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna 3/31/2026

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

Vision-language model pointing mechanism using visual token selection instead of coordinate generation for improved grounding capability.

Ax Quan Zhang, Lianhang Fu, Lvsi Lian, Gwihwan Go, Yujue Wang, Chijin Zhou, Yu Jiang, Geguang Pu 3/31/2026

Evaluating Privilege Usage of Agents on Real-World Tools

Benchmark evaluating privilege usage and security risks of LLM agents equipped with real-world tool access across attack surfaces.

Ax Yufei Xu, Fanxu Meng, Fan Jiang, Yuxuan Wang, Ruijie Zhou, Jiexi Wu, Zhixin Pan, Zhaohui Wang, Xiaojuan Tang, Wenjie Pei, Tongxuan Liu, Di yin, Xing Sun, Muhan Zhang 3/31/2026

HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention

HISA hierarchical indexing method for fine-grained sparse attention reducing O(L²) bottleneck of token-level sparse mechanisms like DeepSeek Sparse Attention.