Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs Paper • 2608.12781 • Published 8 days ago • 29
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection Paper • 2608.20169 • Published 1 day ago • 3
EnvHarness: Awakening Static Worlds for Agent Learning Paper • 2608.19880 • Published 5 days ago • 259
SPADE: Self-Play in Adaptive Synthetic Executable Environments Paper • 2608.19197 • Published 6 days ago • 51
Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation Paper • 2608.17512 • Published 7 days ago • 51
Demystifying Agent Skills: Why They Work-Until They Don't Paper • 2608.14036 • Published 11 days ago • 163
HarnessEval-W: Agentifying the Evaluation of Visual Worlds Paper • 2608.16859 • Published 8 days ago • 123
PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment Paper • 2608.14284 • Published 11 days ago • 14
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development Paper • 2608.13417 • Published 12 days ago • 55
Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence Paper • 2608.12743 • Published 12 days ago • 44
Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures Paper • 2607.28802 • Published 26 days ago • 10
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation Paper • 2608.02287 • Published 22 days ago • 31
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Paper • 2608.01964 • Published 22 days ago • 181
PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models Paper • 2607.24957 • Published 29 days ago • 20
ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition Paper • 2607.25565 • Published 28 days ago • 66