Ax Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev, Youssef Hassan, Mark E. Whiting 22d ago

Trading Human Curation for Synthetic Augmentation in RLVR

Studies substitution of human-curated tasks with synthetic augmentation for reinforcement learning training of agentic language models.

Ax Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou 22d ago

Weak-to-Strong Generalization via Direct On-Policy Distillation

Weak-to-strong generalization via on-policy distillation: train RL on smaller models then transfer to scale stronger models efficiently.

Ax Huixi Technology, :, Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu 22d ago

RhinoVLA Technical Report

RhinoVLA optimizes Vision-Language-Action models for real-time robotic deployment on edge hardware.

HN userbinator 22d ago

Llama 2 LLM on DOS (2025)

Open source project running Llama 2 LLM on vintage DOS machines from 1996-2004 with modern hardware variants using FreeDOS.

HN sosodev 22d ago

I Think I Have LLM Burnout

Developer shares experience of LLM usage fatigue despite moderate adoption; discusses workflow with Claude and Codex for coding tasks.

HN nateb2022 22d ago

Public LLM benchmarks are mostly garbage

Analysis showing public LLM benchmarks are unreliable; Claude Opus/Sonnet performance varies significantly across real workloads compared to rankings.