HN juggy69 19d ago

Paranoid LLMs

Analysis of overly-cautious code generation patterns in LLMs and their impact on code quality.

Ax Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi 19d ago

Infinity-Parser2 Technical Report

Infinity-Parser2 is a multimodal model using controllable data synthesis and reinforcement learning for document parsing with open-sourced training data.

Ax Seokhoon Jeong, Mijung Kim, Taehwan Kim 19d ago

Agentic Neural Architecture Search

Agentic Neural Architecture Search: Method bridging LLM-driven open-ended architecture design with NAS-driven optimization for automated model search.

Ax Fan Ma, Mauro Giuffr\`e, Donald Wright, Kent McCann, Mark Iscoe, Lingfei Qian, Mingyang Jiang, Chi Wing Ng, Na Hong, Huan He, Cathy Shyr, Qingyu Chen, Lee Schwamm, Lucila Ohno-Machado, Hua Xu 19d ago

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

AegisDx: Safety-oriented framework for AI-assisted medical diagnosis using coordinated LLM components with structured reasoning and verification mechanisms.

Ax Sohrab Namazi Nia, Amogh Dalal, Ning Sa, Peter Ly, Marti Zentmaier, Tomek Strzalkowski, Jay Miller, Rishi Singh, Senjuti Basu Roy 19d ago

ASMR: Agentic Schema Generation for Ship Maintenance Report Writing

ASMR: Multi-agent framework for automatic schema discovery from ship maintenance reports using field extraction and semantic analysis agents.

Ax Sophia Koehler, Antonia W\"ust, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Kristian Kersting 19d ago

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

ZendoWorld: A benchmark environment for testing AI agents on visual concept induction, hypothesis formation, and active experimentation through game observation.

Ax Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abb\'e 19d ago

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

Benchmark exposing blind spots in multimodal models on tasks humans find trivial, evaluating failure modes beyond established benchmarks.

Ax Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Yunfu Cui, Tao Peng, Daolin Ji, Haitao Zhao, Wei Zhang, Xiaojuan Wang, Weijie Ma, Zongren Ding, Jinlong Li, Yuan Ding, Jiajing Zhao, Zhiyu Chen, Chengkun Yang, Ziyue Huang, Jiaqi Liu, Fusheng Liu, Yang Zhou, Xiaojuan Wang, Zhongquan Sun, Shiyun Bao, Xiaojun Wang, Ming Yang, Guangxin Li, Bin Shu, Yong Liao, Hongxuan Li, Yao Tang, Shizhong Yang, Yongyi Zeng, Yufeng Yuan, Yinpeng Dong, Jihui Hao, Jun Zhu, Jiahong Dong 19d ago

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

Clinical-reasoning LLM for hepatocellular carcinoma risk stratification and treatment guidance from EMR narratives.

Ax Jo\~ao Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar 19d ago

The complexities of patient-centred conversational artificial intelligence

Analyzes real patient-chatbot conversations to understand communication patterns and develops patient simulator for evaluating health LLMs.