GUI-HARVEST: Self-Improving GUI Agents through Evidence-Driven Harness Evolution Paper • 2610.00948 • Published 11 days ago • 22
Lajavaness/wav2vec2-lg-xlsr-fr-speech-emotion-recognition Audio Classification • 0.3B • Updated Apr 25, 2024 • 358 • 21
m3hrdadfi/wav2vec2-xlsr-greek-speech-emotion-recognition Automatic Speech Recognition • Updated Jul 6, 2021 • 90 • 16
m3hrdadfi/wav2vec2-xlsr-persian-speech-emotion-recognition Automatic Speech Recognition • Updated Jul 27, 2021 • 444 • 14
Hiding Tool Latency in On-Device Cascaded Voice Agent through Speculative Execution Paper • 2610.07641 • Published 6 days ago • 15
Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability Paper • 2610.08448 • Published 6 days ago • 207
Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training Paper • 2610.05416 • Published 8 days ago • 20
Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation Paper • 2610.05608 • Published 8 days ago • 167
Representation-Space MMD for Diffusion Language Models Paper • 2610.06648 • Published 7 days ago • 31
Latent-MOPD: Latent Multi-Teacher On-Policy Distillation Paper • 2610.02381 • Published 11 days ago • 70
VladS159/common_voice_16_1_romanian_speech_synthesis Viewer • Updated Feb 26, 2024 • 39.1k • 140 • 10
harshit345/xlsr-wav2vec-speech-emotion-recognition Audio Classification • Updated Dec 12, 2021 • 494 • 67
Unmask the State: When Does State Adaptation Matter for Masked Diffusion Language Models Paper • 2609.33355 • Published 15 days ago • 51
Scheduling Recursive Reasoning in Looped Transformers Paper • 2609.36653 • Published 13 days ago • 20