HN xmulot 24d ago

AI Agent using a Burp-style toolkit over MCP

Open-weights LLM agent (GLM-5.2, Gemma, Qwen) performs web penetration testing via headless Chromium. Solved 87% OverTheWire Natas challenges using Burp-style toolkit.

HN magester 24d ago

New Mass GitHub dorking tool

ghscan is a GitHub reconnaissance tool that maps organizational footprint and scans for leaked secrets across employee repos.

Ax Zongmin Yu, Liu Yang 24d ago

Evolutionary Ensemble of Agents

Evolutionary Ensemble (EvE): decentralized framework co-evolving coding agents for algorithmic discovery. Evolves guidance and skills rather than modifying base agent substrate.

Ax Xinle Deng, Ruobin Zhong, Hujin Peng, Xiaoben Lu, Yanzhe Wu, Guang Li, Buqiang Xu, Yunzhi Yao, Jizhan Fang, Haoliang Cao, Junjie Guo, Yuan Yuan, Ziqing Ma, Yuanqiang Yu, Rui Hu, Baohua Dong, Hangcheng Zhu, Ningyu Zhang 24d ago

MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems

MemTrace framework for tracing and attributing errors in LLM memory systems. Debugs how information synthesis, propagation, or corruption occurs in long-horizon reasoning.

Ax Xinyang Lu, Jiabao Pan, Rachael Hwee Ling Sim, See-Kiong Ng, Anthony Kum Hoe Tung, Bryan Kian Hsiang Low 24d ago

De-attribute to Forget for LLM Unlearning

LLM unlearning method using de-attribution to remove inappropriate training data influence while maintaining model utility and avoiding over-forgetting.

Ax Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang 24d ago

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: benchmark for evaluating autonomous AI coding agents on 40 scientific research tasks across 10 domains with real published papers and multimodal evaluation rubrics.