第 9 章,共 10 章 · 29 条
9. 评测基准与竞技场
衡量研究问答、交易决策、安全性和实盘竞技场表现。没有评测,金融 agent 就只是演示。
研究与开卷问答
- PIXIU FinMA + FinBen 金融 LLM 评测套件。
- FinBen The-FinAI 的综合性金融 LLM 基准。
- financebench 基于真实财报的开卷金融问答基准。
- finance-agent 带工具调用的金融研究 agent 基准(arXiv:2508.00828)。
- finance-agent-v2 Finance Agent 基准 v2,含 EDGAR、网页与价格工具。
- FinSearchComp 专家级金融搜索与推理基准(字节 Seed 相关)。
- BizFinBench 面向真实业务场景的金融 LLM 基准。
- FinEval 中文金融 LLM 评测套件。 A股/中文
- MME-Finance 面向专家级理解的多模态金融基准。
- FinToolBench 760 个可执行金融工具、295 个查询,评测工具调用 agent。
- FinMTM 多轮多模态金融推理与 agent 基准。
- finchain 可验证思维链金融推理的符号化基准。
- big-finance-benchmark BigFinanceBench 参考评测框架,基于真实工作流的金融研究基准。
- CNFinBench OpenCompass 出品的高风险金融 agent 任务基准。 A股/中文
- FinanceBenchmark 微软 M365 Copilot 财务 agent 基准(约 300 个任务,含 ERP 与网页工具)。
决策与交易基准
- INVESTOR-BENCH InvestorBench:LLM agent 金融决策基准(ACL 2025)。
- QuantitativeFinance-Bench 在 Harbor 上的状态感知交互式量化 agent 基准。
- stockbench 受控环境下检验 LLM agent 能否交易盈利的基准。
- DeepFund NeurIPS'25 基金投资风格的 agent 评测试点。
- QuantCode-Bench 可执行算法交易代码生成基准。
- TwinMarket 用于研究 agent 交互的 LLM 驱动市场仿真。
实盘竞技场与公开战绩
- live-trade-bench 交易 agent 的实盘/在线评测。
- Agent_Market_Arena 面向 LLM agent 的多市场实盘竞技场。
- alpha-arena 交易 agent 的 Alpha 竞技场竞赛 harness。
- LLM-Trading-Lab 公开实验:ChatGPT 管理一笔小额真实资金的微盘股组合,附日志与代码。 实盘
- nof0 开源 AI 交易竞技场,仿 nof1 Alpha Arena。 A股/中文
- continuous-record-llm-trading-agents 对 LLM 交易 agent 实际行为做连续记录研究的数据与产物。 论文
安全与可信
- awesome-financial-llm-trustworthiness-benchmarks 金融 LLM 可信度相关基准的精选清单。
- TradeTrap 检验 LLM 交易 agent 在扰动下是否可靠、忠实。 论文
踩坑提示
没有成本、延迟和防泄漏控制的排行榜收益不能当证据。优先选择公开污染策略和工具访问规则的基准。