Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability Paper • 2610.08448 • Published 5 days ago • 200
DeskForge: Dense Supervision from Desktop Environments for Computer-Use Agents Paper • 2610.02320 • Published 10 days ago • 19
World Action Modeling with Progressive Visual Planning Paper • 2610.02508 • Published 10 days ago • 97
X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization Paper • 2609.32993 • Published 15 days ago • 79
FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution Paper • 2609.36651 • Published 12 days ago • 34
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR Paper • 2609.37868 • Published 12 days ago • 65
Follow the Entities: A Corpus Map for Agentic Search Paper • 2609.37226 • Published 12 days ago • 100
Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning Paper • 2609.33781 • Published 14 days ago • 46
An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning Paper • 2609.35505 • Published 13 days ago • 26
RayOrch: Programming and Executing Lineage-Controlled Multi-Grain Dataflows for Foundation-Model Data Preparation Paper • 2609.18703 • Published 25 days ago • 56
Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings Paper • 2609.25165 • Published 20 days ago • 77
BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence Paper • 2609.20886 • Published 25 days ago • 30
Emergent Collusion in Long-Horizon LLM Agent Interaction Paper • 2609.24967 • Published 20 days ago • 19
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay Paper • 2609.25001 • Published 20 days ago • 132
MintAct: A Unified Visual Agent for Digital Environments Paper • 2609.22083 • Published 23 days ago • 35
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence Paper • 2609.17488 • Published 26 days ago • 560
Training Specialist Models without Reasoning Trajectories for Domain Expert Distillation Paper • 2609.13770 • Published 29 days ago • 9