ASRU: method combining activation steering and reinforcement unlearning for multimodal LLMs to remove sensitive information while maintaining generation quality.
α-TCAV: framework addressing statistical instability in Concept Activation Vectors for deep learning explainability and interpretability.
H-Mem: memory mechanism for LLM-based agents that models temporal evolution and retrieval of memory data to improve question-answering performance.
Position paper arguing early-stage quality assurance in annotation pipelines is more cost-effective than late validation.
ML research paper on semi-supervised ECG segmentation using bidirectional fusion guided by cardiac patterns.
DiLA: disentangled latent action world models for learning from unlabeled video by inferring abstract actions between frames.
DecomPose: addresses gradient conflicts in multi-category 6D object pose estimation by disentangling optimization signals across categories.
Brain-inspired hierarchical model for extracting abstract structures from continuous dynamics, inspired by hippocampal-entorhinal circuits.
Analyzes embodiment tax in vision-language-action models and proposes dual-stream architecture to prevent degradation of multimodal competence.
BiomedAP: vision-language model adaptation framework for medical imaging with robust handling of prompt variations and cross-modal fusion.
CompactQE: open-source LLM approach for machine translation quality estimation with interpretability, offering privacy-preserving alternative to proprietary models.
GRASP: 290K QA dataset for training multimodal LLMs to understand social interactions via non-verbal cues in multi-person videos.
Theoretical analysis of Transformer grokking phenomenon as structural inference problem, proposing Bayesian lottery ticket interpretation.
Framework for developing virtual agents with emotional modeling capabilities for sustained companionship using foundation models.
GAP: pre-training method for learning visuomotor policies in robotic manipulation using Vision Foundation Models with improved data efficiency.
RoadmapBench: benchmark for evaluating AI coding agents on long-horizon, multi-file software development tasks across version upgrades at engineering scale.
Research on controlling GenAI access timing in educational settings using reinforcement learning to optimize learning outcomes and prevent over-reliance.
Shapley Neuron Valuation framework quantifying neuron importance in continual learning to mitigate catastrophic forgetting.
Symplectic neural operator architecture preserving Hamiltonian structure for modeling infinite-dimensional systems.
Cross-domain heterogeneous graph prompt learning using structure-conditioned experts for transfer across different graph domains.
RaPD: Diffusion model generating continuous natural images at arbitrary resolutions using semantics-enriched implicit representations.
Block attention improvements for long-context LLMs via automatic segmentation and block distillation for efficient KV cache reuse.
SLIP & ETHICS: Graduated intervention protocol for AI emotional companions balancing safety and rapport through staged interventions.
LoCO: Parameter-efficient fine-tuning method using low-rank orthogonal rotations to preserve geometric structure in foundation models.
Vision-language alignment framework decomposing fine-grained descriptions into concept and attribute tokens for open-vocabulary segmentation.
Theoretical analysis of adversarial training improvements for physics-informed neural networks using neural tangent kernel perspective.
Reinforcement learning fine-tuning for encoder-decoder machine translation models using reference-free rewards without parallel data.
Unified framework for representation learning under competing constraints in temporal, multimodal, and partially observed systems.
CitePrism: Human-in-the-loop AI system for automating manuscript citation auditing and ensuring editorial integrity.
Study of vision language models' adaptive capabilities for personalized mathematics education and learning support.
Multilingual speech-to-speech translation using language priors and compositional methods with speech LLMs.
Research on accountability mechanisms for autonomous AI agents, addressing tracing harmful agents to their deployers and closing accountability gaps.
RecMem: efficient memory consolidation for long-running LLM agents using recurrence. Reduces token consumption via lazy memory extraction.
XSearch improves semantic code search explainability via concept-to-code alignment. Better generalization and interpretability.
Ada-Diffuser models latent dynamics for decision-making with diffusion models. Incorporates hidden state evolution in agent behavior.
VideoSeeker enables precise video understanding through agentic tool invocation. LVLMs with native tool use for spatiotemporal localization.
Foundation models for relational databases combining language models and graph neural networks. Structured data deep learning.
MolCHG: multi-level self-supervised pretraining on hierarchical molecular graphs for property prediction. Chemistry application.
Identifies attention dispersion failure mode in graph transformers under temporal distribution shift. Proposes diagnostic fix.
DebiasRAG reduces social biases in LLMs using retrieval-augmented generation without fine-tuning. Addresses hallucinations and stereotypes.
GenShield detects AI-generated images and corrects artifacts. Applies diffusion models to forensics and content moderation.
SNAC-Pack: Neural architecture search tool optimizing for FPGA hardware costs using surrogate models and multi-dimensional budgets.
Second-order variance correction method addressing modality competition in multimodal models during autoregressive training.
paper.json: Coordination convention adding structured JSON metadata to papers for improved LLM-agent parsing and reproducibility.
Argus: Evidence assembly system for scalable deep research agents combining parallel search and aggregation for information-seeking tasks.
Automated evaluation metrics for design video generation assessing compositional fidelity and motion constraints.
Unified generative AI framework for energy utilities integrating gas distribution, billing, and quantum optimization.
VLA-AD: Distillation framework using vision-language models to compress large robotic manipulation policies into lightweight versions.
Study on how AI-mediated communication in online platforms influences collective opinion formation.
VideoGameBench: Benchmark testing vision-language models on video game completion tasks for perception and spatial reasoning evaluation.