Ax Zhaoyan Sun, Shan Zhong, Daizhou Wen, Jiaxing Han, Guoliang Li, Ying Yan, Peng Zhang, Yu Su, Xiang Qi, Baolin Sun, Chengyuan Yang, Tao Fang, Huaiyu Ruan 29d ago

AgenticDataBench: A Comprehensive Benchmark for Data Agents

Comprehensive benchmark for LLM-based data agents automating data science workflows. Evaluates agent capabilities on heterogeneous datasets.

Ax Stefano Masini, Cecilia Viscardi, Michela Baccini 29d ago

Full Bayesian Reinforcement Learning via LF-IBIS

Bayesian reinforcement learning method addressing data scarcity through prior knowledge and belief updates in sequential decision-making.

Ax Florian Tambon, Michael Konstantinou, Cedric Richter, Charles Chenouard, Mark Harman, Mike Papadakis 29d ago

Prompt Coverage Adequacy

Proposes prompt coverage adequacy testing framework to guide LLM and autonomous agent testing when prompts replace traditional code.

Ax Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci 29d ago

ESC: Emotional Self-Correction for Reliable Vision-Language Models

Introduces emotional self-correction mechanism for vision-language models to improve reasoning reliability without post-training or engineered feedback.

Ax Nathan Hughes, Ibrahim Habli 29d ago

What Types of Human-AI Teams Exist?

Systematically categorizes 53 human-AI team studies into five clusters using psychological teaming taxonomies to understand collaboration patterns and diversity.

Ax Zhuowei Chen, Liwei Chen, Christian Schunn, Raquel Coelho, Xiang Lorraine Li 29d ago

Neuron-Aware Active Few-Shot Learning for LLMs

Neuron-aware active learning method for LLMs identifies valuable unlabeled samples for annotation reducing human labeling costs in few-shot adaptation.