From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 16 days ago • 104
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 5 days ago • 33
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published 5 days ago • 88
SKILL-KD: Contrastive Skill Distillation for LLM Agents Paper • 2607.28048 • Published 7 days ago • 11
GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks Paper • 2608.03764 • Published 7 days ago • 25
Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning Paper • 2608.05139 • Published 6 days ago • 26
OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents Paper • 2608.05013 • Published 7 days ago • 34
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment Paper • 2608.05102 • Published 6 days ago • 64
ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities? Paper • 2608.03874 • Published 7 days ago • 14
ExplainBench: Evaluating Code Explanations from Agents Paper • 2607.26451 • Published 13 days ago • 13
SkillJack: Persistent Skill Backdoors in Self-Evolving Agents Paper • 2608.03509 • Published 7 days ago • 23
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents Paper • 2608.04003 • Published 7 days ago • 33
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations Paper • 2607.28956 • Published 11 days ago • 96
Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures Paper • 2607.28802 • Published 12 days ago • 10
SWE-Touch: Benchmarking Coding Agents When Users Touch the Code Paper • 2608.02499 • Published 8 days ago • 24
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation Paper • 2608.02287 • Published 8 days ago • 31
Progressive Agent Skill Generation via Reinforcement Learning Paper • 2608.01678 • Published 8 days ago • 58
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Paper • 2608.01964 • Published 8 days ago • 165