Ax Kalle Kujanp\"a\"a, Ning Liu, Shahnawaz Alam, Yeshwanth Reddy Sura, Tianyu Yang, Kristina Klinkner, Shervin Malmasi 19d ago

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

Production LLM agents with tool-making pipeline that compiles repeated procedural steps into validated tools to reduce inference latency.

Ax Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han 19d ago

TTHE: Test-Time Harness Evolution

Test-time optimization framework evolving LLM agent harnesses to adapt executable programs for changing distributions.

Ax Thibaud Ardoin, Semira Einsele, Evis Bregu, Gerhard Wunder 19d ago

Prompt Compression via Activation Aggregation

Method for compressing LLM prompts into single activation vectors extracted from intermediate layers and re-injected earlier, reducing token overhead.

Ax Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami, Navid Mazrouei, Matin Irajpour, Yousof Gheisari, Hajar Sirous 19d ago

DrugGen 2: A disease-aware language model for enhancing drug discovery

DrugGen-2: Language model for drug discovery conditioned on disease ontology and target protein sequences, fine-tuned for molecular generation.

Ax Liang Luo, Yinbin Ma, Quanyu Zhu, Vasiliy Kuznetsov, Yuxin Chen, Neng Shi, Jian Jiao, Jiecao Yu, Buyun Zhang, Tongyi Tang, Xiaohan Wei, Yanli Zhao, Zeliang Chen, Yuchen Hao, Venkatesh Ranganathan, Sandeep Parab, Yantao Yao, Maxim Naumov, Chunzhi Yang, Shen Li, Ellie Wen, Wenlin Chen, Santanu Kolay, Chunqiang Tang 19d ago

LoKA: Low-precision Kernel Applications for Recommendation Models At Scale

Research on FP8 low-precision training for large recommendation models, addressing numerical sensitivity challenges.