Ax Xianzhou Zeng, Jing Huang, Chunmei Xie, Gongrui Nan, Siye Chen, Mengyu Lu, Weiqi Xiong, Qixuan Zhou, Junhao Zhang, Qiang Zhu, Yadong Li, Xingzhong Xu 5/27/2026

UCPO: Uncertainty-Aware Policy Optimization

UCPO: Uncertainty-aware RL policy optimization addressing advantage bias and overconfidence in LLM training.

Ax Jos\'e Guilherme Marques dos Santos, Ricardo Yang, Rui Humberto Pereira, Alexandre Sousa, Br\'igida M\'onica Faria, Henrique Lopes Cardoso, Jos\'e Duarte, Jos\'e Lu\'is Reis, Lu\'is Paulo Reis, Pedro Pimenta, Jos\'e Paulo Marques dos Santos 5/27/2026

From PDF to RAG-Ready: Evaluating Document Conversion Frameworks for Domain-Specific Question Answering

Systematic evaluation of PDF-to-Markdown conversion frameworks (Docling, MinerU, Marker, DeepSeek OCR) for RAG systems; measures downstream QA accuracy across 21 pipeline configurations.

Ax Zhentao Xu, Shangjin Zhang, Emir Poyraz, Yvonne Li, Ye Jin, Xie Lu, Xiaoyang Gu, Karthik Ramgopal, Praveen Kumar Bodigutla, Xiaofeng Wang 5/27/2026

Hierarchical Long-Term Semantic Memory for LinkedIn's Hiring Agent

Industrial-grade long-term semantic memory system for LinkedIn's LLM hiring agent; extracts signals from behavioral data, stores structured form, supports low-latency retrieval.

Ax Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Br\"andle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, No\'emi \'Eltet\H{o}, Michael Franke, Thomas L. Griffiths, Fritz G\"unther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz 5/27/2026

Post-training makes large language models less human-like

Introduces Psych-201 dataset measuring behavioral alignment of LLMs to humans; finds post-training reduces alignment with human behavior across model families.

Ax Zekun Wu (University College London), Ze Wang (University College London), Seonglae Cho (Holistic AI), Yufei Yang (Imperial College London), Adriano Koshiyama (University College London), Sahan Bulathwela (University College London), Maria Perez-Ortiz (University College London) 5/27/2026

Tool Calling is Linearly Readable and Steerable in Language Models

Shows tool-calling errors in LLM agents are linearly readable in activation space, enabling detection of wrong tool selection before execution; demonstrates steering capability.

Ax Carol Xuan Long, David Simchi-Levi, Feng Zhu, Huangyuan Su, Andre P. Calmon, Flavio P. Calmon 5/27/2026

Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management

Study of autonomous AI agents in supply chains using Beer Game, identifying inference-time levers (model selection, policies, data sharing, prompt engineering) that shape performance; reasoning models exceed human performance and reduce costs 67%.

HN xfax 5/26/2026

DeepSWE Benchmark

DeepSWE: benchmark for long-horizon coding agents on original software engineering tasks, addressing saturation in existing benchmarks like SWE-bench.