Factorized Hypothesis Search for Evidence-to-Taxonomy Retrieval Paper • 2608.06614 • Published 20 days ago • 7
Factorized Hypothesis Search for Evidence-to-Taxonomy Retrieval Paper • 2608.06614 • Published 20 days ago • 7
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks Paper • 2604.10015 • Published Apr 15
When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents Paper • 2510.11695 • Published Oct 13, 2025 • 3
FinCon: A Synthesized LLM Multi-Agent System with Conceptual Verbal Reinforcement for Enhanced Financial Decision Making Paper • 2407.06567 • Published Jul 9, 2024 • 1
MultiFinBen: A Multilingual, Multimodal, and Difficulty-Aware Benchmark for Financial LLM Evaluation Paper • 2506.14028 • Published Jun 16, 2025 • 94
Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning Paper • 2506.08235 • Published Jun 9, 2025
AUDITFLOW: Executable Symbolic Environments for Structured Financial Reporting Verification Paper • 2606.03031 • Published Jun 2 • 6
AUDITFLOW: Executable Symbolic Environments for Structured Financial Reporting Verification Paper • 2606.03031 • Published Jun 2 • 6
Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images Paper • 2604.07338 • Published Apr 8 • 5
Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images Paper • 2604.07338 • Published Apr 8 • 5
MultiFinBen: A Multilingual, Multimodal, and Difficulty-Aware Benchmark for Financial LLM Evaluation Paper • 2506.14028 • Published Jun 16, 2025 • 94
All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection Paper • 2601.04160 • Published Jan 7 • 4
Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection Paper • 2601.05403 • Published Jan 8 • 11
The FinBen: An Holistic Financial Benchmark for Large Language Models Paper • 2402.12659 • Published Feb 20, 2024 • 24
FinMem: A Performance-Enhanced LLM Trading Agent with Layered Memory and Character Design Paper • 2311.13743 • Published Nov 23, 2023 • 2
Can LLM Agents Be CFOs? A Benchmark for Resource Allocation in Dynamic Enterprise Environments Paper • 2603.23638 • Published Mar 24 • 11
Can LLM Agents Be CFOs? A Benchmark for Resource Allocation in Dynamic Enterprise Environments Paper • 2603.23638 • Published Mar 24 • 11