Ax Aiman Almasoud, Antony Anju, Marco Arazzi, Mert Cihangiroglu, Vignesh Kumar Kembu, Serena Nicolazzo, Antonino Nocera, Vinod P., Saraga Sakthidharan 4/1/2026

Security in LLM-as-a-Judge: A Comprehensive SoK

Systematic study on security and reliability risks of using LLMs as evaluators (LLM-as-a-Judge) paradigm, covering adversarial vulnerabilities.

Ax Juan Rodriguez, Haotian Zhang, Abhay Puri, Tianyang Zhang, Rishav Pramanik, Meng Lin, Xiaoqing Xie, Marco Terral, Darsh Kaushik, Aly Shariff, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli 4/1/2026

VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing

Comprehensive benchmark suite for SVG code generation, sketching, editing and understanding with four tasks including novel Sketch2SVG and editing datasets.

Ax Ryszard Tuora, Mateusz Gali\'nski, Micha{\l} Godziszewski, Micha{\l} Karpowicz, Mateusz Czy\.znikiewicz, Adam Kozakiewicz, Tomasz Zi\k{e}tkiewicz 4/1/2026

UnWeaving the knots of GraphRAG -- turns out VectorRAG is almost enough

Compares GraphRAG to simpler VectorRAG approaches for retrieval-augmented generation, analyzing effectiveness of graph-based relation representation versus vector indexing.