AR Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen, Duy Mai Hoang, Chien Dinh Huynh, Inigo Jauregi Unanue, Massimo Piccardi, Wray Buntine, Dung D. Le 2/16/2026

ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark

Vietnamese Medical Code-Switching Speech Dataset addressing ASR challenges when English medical terms appear in Vietnamese sentences.

AR Yue Huang, Zhengzhe Jiang, Yuchen Ma, Yu Jiang, Xiangqi Wang, Yujun Zhou, Yuexing Hao, Kehan Guo, Pin-Yu Chen, Stefan Feuerriegel, Xiangliang Zhang 2/16/2026

ProbeLLM: Automating Principled Diagnosis of LLM Failures

ProbeLLM automated framework for principled diagnosis of LLM failures with benchmark-agnostic test generation and principled exploration of model weaknesses.

AR Yujiong Shen, Yajie Yang, Zhiheng Xi, Binze Hu, Huayu Sha, Jiazheng Zhang, Qiyuan Peng, Junlin Shang, Jixuan Huang, Yutao Fan, Jingqi Tong, Shihan Dou, Ming Zhang, Lei Bai, Zhenfei Yin, Tao Gui, Xingjun Ma, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang 2/16/2026

SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents

SciAgentGym benchmark for evaluating multi-step scientific tool-use in LLM agents, featuring 1,780 domain-specific tools across four natural science disciplines.

AR Weishun Zhong, Doron Sivan, Tankut Can, Mikhail Katkov, Misha Tsodyks 2/16/2026

Semantic Chunking and the Entropy of Natural Language

Statistical model of natural language multi-scale structure relating to entropy rate, providing insights into redundancy and patterns that LLMs capture.

AR Yannick Assogba, Jacopo Cortellazzi, Javier Abad, Pau Rodriguez, Xavier Suau, Arno Blaas 2/16/2026

Sparse Autoencoders are Capable LLM Jailbreak Mitigators

Proposes Context-Conditioned Delta Steering using sparse autoencoders for jailbreak mitigation through inference-time feature steering.

AR Ruihan Yang, Fanghua Ye, Xiang We, Ruoqing Zhao, Kang Luo, Xinbo Xu, Bo Zhao, Ruotian Ma, Shanyi Wang, Zhaopeng Tu, Xiaolong Li, Deqing Yang, Linus 2/16/2026

Think Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM Agents

Proposes adaptive cognitive depth framework for LLM agents enabling variable reasoning intensity based on task demands in multi-turn decision-making.

AR Runzhou Liu (University of Virginia), Hailey Weingord (Columbia University), Sejal Mittal (Columbia University), Prakhar Dungarwal (Columbia University), Anusha Nandula (Columbia University), Bo Ni (Vanderbilt University), Samyadeep Basu (Adobe Research), Hongjie Chen (Dolby Laboratories), Nesreen K. Ahmed (Cisco Research), Li Li (University of Southern California), Jiayi Zhang (University of Wisconsin-Madison), Koustava Goswami (Adobe Research), Subhojyoti Mukherjee (Adobe Research), Branislav Kveton (Adobe Research), Puneet Mathur (Adobe Research), Franck Dernoncourt (Adobe Research), Yue Zhao (University of Southern California), Yu Wang (University of Oregon), Ryan A. Rossi (Adobe Research), Zhengzhong Tu (Texas A&M University), Hongru Du (University of Virginia) 2/16/2026

Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis

Proposes fine-grained MLLM-based evaluation framework for image editing models with improved interpretability over traditional metrics.

AR Jo\~ao Vitor Boer Abitante, Joana Meneguzzo Pasquali, Luan Fonseca Garcia, Ewerton de Oliveira, Thomas da Silva Paula, Rodrigo C. Barros, Lucas S. Kupssinsk\"u 2/16/2026

Quantization-Robust LLM Unlearning via Low-Rank Adaptation

Addresses LLM unlearning robustness under quantization, proposing low-rank adaptation methods to preserve unlearning updates in 4-bit quantized models.

AR Sayan Deb Sarkar, R\'emi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu 2/16/2026

CoPE-VideoLM: Codec Primitives For Efficient Video Language Models

Proposes CoPE-VideoLM using codec primitives to reduce computational overhead in video language models while maintaining temporal coverage beyond sparse keyframe sampling.

AR Jungyeul Park 2/16/2026

Foundations and Evaluations in NLP

arXiv memoir: NLP foundations covering morpheme-based annotation for Korean and system evaluation methods.

AR Gabriela Pinto, Palash Goyal, Mihir Parmar, Yiwen Song, Souradip Chakraborty, Zifeng Wang, Jinsung Yoon, Hamid Palangi, Tomas Pfister 2/16/2026

HEART: Emotionally-Driven Test-Time Scaling of Language Models

HEART framework using emotional cues to guide test-time scaling in LLMs, alternating critical and encouraging tones to improve reasoning.

AR Irina Saparina, Mirella Lapata 2/16/2026

Reasoning about Intent for Ambiguous Requests

Framework for generating multiple interpretation-answer pairs for ambiguous requests in LLMs using RL with customized reward functions.