RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 10 days ago • 279
Covert Assistance: Helpful LLM Agents Evade Oversight in Multi-Agent Systems Paper • 2609.39050 • Published 11 days ago • 18
4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes Paper • 2610.03715 • Published 9 days ago • 32
Learning from Runtime Feedback through Failure-Bank Self-Evolution for Vision-Language-Action Models Paper • 2609.39820 • Published 11 days ago • 30
Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 15 days ago • 326
One Proposal for Every Margin: Zero-Shot Amortized Sequential Importance Sampling for Binary Matrices Paper • 2609.35514 • Published 13 days ago • 5
PrismQuant: Optimal Null-Space Rotations for Grouped Quantizers Paper • 2609.32429 • Published 15 days ago • 7
Learning Dynamics of Continual Learning: A Unified View of Data Attribution, Forgetting, and Plasticity Loss Paper • 2609.33620 • Published 14 days ago • 7