SPADE: Self-Play in Adaptive Synthetic Executable Environments Paper • 2608.19197 • Published 18 days ago • 52
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 263
TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity Paper • 2608.08119 • Published 29 days ago • 11
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published Jul 30 • 73
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published about 1 month ago • 35
ChronoVision: Temporal Reasoning via Latent State Reconstruction Paper • 2608.05631 • Published about 1 month ago • 40
When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation Paper • 2608.03632 • Published Aug 4 • 24
UniWorld-Design: From Pixel Generation to Layer-Native Design Paper • 2608.03971 • Published Aug 4 • 25