On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 14 days ago • 202
Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents Paper • 2609.32536 • Published 16 days ago • 13
Smaller Models, Better Rejects: Preference Distillation Scaling Paper • 2609.38987 • Published 12 days ago • 31
Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing Paper • 2609.37362 • Published 13 days ago • 18