HN duggan 2/16/2026

Cognitive Debt in AI Coding

Analysis of 'cognitive debt' in AI-assisted code where developers lose mental models of AI-generated features, making maintenance harder.

DT Agus Sudarmanto 2/16/2026

Laravel Dev using Claude

Laravel developer workflow example demonstrating Claude Code plugin usage for frontend design and application development.

Ax Ruihan Yang, Fanghua Ye, Xiang We, Ruoqing Zhao, Kang Luo, Xinbo Xu, Bo Zhao, Ruotian Ma, Shanyi Wang, Zhaopeng Tu, Xiaolong Li, Deqing Yang, Linus 2/16/2026

Think Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM Agents

Adaptive cognitive depth framework for LLM agents that varies reasoning depth per step, improving efficiency for multi-turn decision-making tasks with varying cognitive demands.

Ax Xiangyi Li, Wenbo Chen, Yimin Liu, Shenghan Zheng, Xiaokun Chen, Yifeng He, Yubo Li, Bingran You, Haotian Shen, Jiankai Sun, Shuyi Wang, Qunhong Zeng, Di Wang, Xuandong Zhao, Yuanli Wang, Roey Ben Chaim, Zonglin Di, Yipeng Gao, Junwei He, Yizhuo He, Liqiang Jing, Luyang Kong, Xin Lan, Jiachen Li, Songlin Li, Yijiang Li, Yueqian Lin, Xinyi Liu, Xuanqing Liu, Haoran Lyu, Ze Ma, Bowei Wang, Runhui Wang, Tianyu Wang, Wengao Ye, Yue Zhang, Hanwen Xing, Yiqi Xue, Steven Dillmann, Han-chung Lee 2/16/2026

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

Benchmark of 86 tasks across 11 domains evaluating how well agent skills (procedural knowledge packages) improve LLM agent performance under different conditions.

Ax Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Dan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui 2/16/2026

BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents

Visual and verifiable benchmark for multimodal browsing agents evaluating planning, tool-use, and deep search capabilities on web tasks.

Ax Ari Spiesberger, Juan J. Vazquez, Nicky Pochinkov, Tom\'a\v{s} Gaven\v{c}iak, Peli Grietzer, Gavin Leech, Nandi Schoots 2/16/2026

Soft Contamination Means Benchmarks Test Shallow Generalization

Study on soft contamination in LLM training data showing n-gram decontamination filters miss semantic duplicates, biasing benchmark generalization estimates.

Ax Ziqian Zhang, Xingjian Hu, Yue Huang, Kai Zhang, Ruoxi Chen, Yixin Liu, Qingsong Wen, Kaidi Xu, Xiangliang Zhang, Neil Zhenqiang Gong, Lichao Sun 2/16/2026

RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty

Benchmark framework that quantifies question difficulty to better differentiate LLM capabilities in evaluation.