Economic analysis of labor market effects from agentic AI systems capable of completing full occupational workflows using task exposure framework.
Explores accessibility of explainable AI for blind and low-vision users in autonomous agent systems, addressing trust and interpretability barriers.
Analysis of 138 practitioner conference talks examining how companies adopt AI agent architectures, architectural patterns, and LLM-driven agentic system implementation.
arXiv paper: Diversity-aware RKL divergence improves LLM distillation by focusing on dominant modes in teacher-student training.
MAC-Attention: acceleration technique for long-context LLM decoding by reusing prior attention computations for semantically similar tokens without compression.
REM-CTX: RL-based peer review system using 8B LLM with Group Relative Policy Optimization, incorporating visual figures and scholarly context.
Apprenticeship learning approach for inducing pedagogical policies from imperfect, evolving student demonstrations in e-learning environments.
Systematic evaluation of LLMs for educational essay scoring across holistic and analytic rubrics, analyzing human alignment and bias.
QAsk-Nav benchmark for evaluating embodied agents combining navigation and dialogue-based question-asking for collaborative object finding tasks.
Energy-based models framework for physical system identification with formal stability guarantees, applying to Port-Hamiltonian dynamics.
Research on reducing modality gap in Vision-Language Models like CLIP through geometric analysis to improve cross-modal tasks like captioning and clustering.
VeriAct: agentic system for synthesizing correct and complete formal specifications using LLMs beyond just verifier-passing output.
Asymmetric Actor-Critic method for improving reliability of multi-turn LLM agents in one-shot settings without requiring model retraining.
CASA: conditional decoding strategy for robust multimodal safety in MLLMs against cross-modal attacks.
Prompt-guided image compression for Vision-Language Models optimized for downstream VLM tasks rather than human perception.
Research on vulnerabilities in aligned AI agents with filesystem and email access; introduces ACDC for automated circuit discovery in transformers.
RAGShield: five-layer defense against knowledge base poisoning attacks in RAG systems deployed across federal agencies.
EvolveTool-Bench: diagnostic benchmark for evaluating quality of LLM-generated tool libraries as software artifacts in engineering workflows.
Research on out-of-distribution anomaly where deep models assign higher density to simple OOD data than in-distribution test data.
Privacy attack method using gradient-induced feature drift to infer membership in LLM training data without relying on output probabilities.
Analysis of neuron polysemy in neural networks, decomposing superposition metrics to separate lexical overlap from concept compression.
Method to mitigate object hallucination in Vision-Language Models through visual grounding using logit boosting without retraining.
Study examining how personality traits moderate effectiveness of AI-driven conversational coaching in workplace negotiation scenarios.
Technique to reduce LLM code generation latency by executing code incrementally as tokens are generated, eliminating idle waiting periods.
Vision-Language foundation model for chest X-ray interpretation providing explicit reasoning about visual evidence and diagnostic predictions.
Theoretical analysis of generalization bounds for overparameterized neural networks using distance from initialization as an explanatory factor.
Multimodal LLM approach for e-commerce product understanding that captures fine-grained attributes through reasoning-aware representation learning.
Agentic framework combining Vision-Language Models with iterative reasoning for zero-shot 3D visual grounding from natural language descriptions.
Method for optimizing rubrics used in synthetic data generation for LLM fine-tuning, leveraging influence-guided selection in knowledge-intensive domains.
Multi-agent LLM system for housing consultation decisions, combining reasoning, constraint handling, and factuality guarantees beyond simple ranking.
Unified neural architecture framework studying scaling laws across attention-based, TokenMixer, and factorization-machine recommendation systems.
Method using model cascades to optimize LLM inference costs in semantic SQL queries by routing rows through fast/expensive models based on confidence.
Research on autonomous web agents navigating browser-based websites by leveraging internal APIs instead of DOM inspection, addressing architectural mismatches in agent design.
Reinforcement learning technique adding hints to overcome advantage collapse in group relative policy optimization.
Study of tradeoffs between parametric knowledge in LLM pretraining and non-parametric knowledge from retrieval.
Multi-agent optimization framework addressing non-stationarity through active shared perception of agent policies.
Memory-efficient LLM training via truncated SVD factorization of weight matrices on consumer hardware.
Token pruning framework for vision-language models using attention dual form perspective without retraining.
Security analysis of backdoor attacks on language models using continuous latent reasoning without token output.
LLM pretraining at exascale using Aurora supercomputer with Mula-1B model and Optimus training library.
Bayesian inference framework for multi-dimensional emotion understanding accounting for dependencies among emotions.
Language agents with learnable adaptation policies that optimize test-time learning instead of using fixed hand-crafted policies.
Mixture-of-Experts architecture for actor-level stance detection in geopolitical text classification.
PixelPrune: adaptive visual token reduction for vision-language models using predictive coding for document and GUI tasks.
Dataset and analysis of autonomous coding agents' contributions in real-world projects, examining code quality and team dynamics over time.
Training-free canonical correlation analysis method for improving efficiency of pretrained image encoder representations.
WARP: method for repairing adversarial vulnerabilities in transformer NLP models with provable inner-layer repair guarantees.
Reinforcement learning with flow-based policies and distributional RL for trajectory optimization in multi-solution problems.
Dignified Peer framework addressing evasive and sycophantic behavior in aligned LLMs through anti-sycophancy and empathy.
MyPhoneBench: evaluation framework measuring privacy-compliant behavior in mobile phone-use agents during task execution.