LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks Paper • 2608.23200 • Published 2 days ago • 5
Simple-OPD: Demystifying Warm-up for On-policy Distillation Paper • 2608.06802 • Published 19 days ago • 1
LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks Paper • 2608.23200 • Published 2 days ago • 5
Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA Paper • 2607.26807 • Published 28 days ago
YuE: Scaling Open Foundation Models for Long-Form Music Generation Paper • 2503.08638 • Published Mar 11, 2025 • 73
IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video? Paper • 2509.24709 • Published Sep 29, 2025 • 7
Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures Paper • 2510.14616 • Published Oct 16, 2025 • 13
COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes Paper • 2510.14763 • Published Oct 16, 2025 • 14
Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space Paper • 2512.24617 • Published Dec 31, 2025 • 67
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization Paper • 2602.22675 • Published Feb 26 • 23
LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling Paper • 2606.18023 • Published Jun 16 • 210
WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts Paper • 2606.03220 • Published Jun 2 • 11