Skip to content

第 9 章,共 10 章 · 29 条

9. 评测基准与竞技场 ​

衡量研究问答、交易决策、安全性和实盘竞技场表现。没有评测,金融 agent 就只是演示。

研究与开卷问答 ​

  • PIXIU FinMA + FinBen 金融 LLM 评测套件。
  • FinBen The-FinAI 的综合性金融 LLM 基准。
  • financebench 基于真实财报的开卷金融问答基准。
  • finance-agent 带工具调用的金融研究 agent 基准(arXiv:2508.00828)。
  • finance-agent-v2 Finance Agent 基准 v2,含 EDGAR、网页与价格工具。
  • FinSearchComp 专家级金融搜索与推理基准(字节 Seed 相关)。
  • BizFinBench 面向真实业务场景的金融 LLM 基准。
  • FinEval 中文金融 LLM 评测套件。 A股/中文
  • MME-Finance 面向专家级理解的多模态金融基准。
  • FinToolBench 760 个可执行金融工具、295 个查询,评测工具调用 agent。
  • FinMTM 多轮多模态金融推理与 agent 基准。
  • finchain 可验证思维链金融推理的符号化基准。
  • big-finance-benchmark BigFinanceBench 参考评测框架,基于真实工作流的金融研究基准。
  • CNFinBench OpenCompass 出品的高风险金融 agent 任务基准。 A股/中文
  • FinanceBenchmark 微软 M365 Copilot 财务 agent 基准(约 300 个任务,含 ERP 与网页工具)。

决策与交易基准 ​

  • INVESTOR-BENCH InvestorBench:LLM agent 金融决策基准(ACL 2025)。
  • QuantitativeFinance-Bench 在 Harbor 上的状态感知交互式量化 agent 基准。
  • stockbench 受控环境下检验 LLM agent 能否交易盈利的基准。
  • DeepFund NeurIPS'25 基金投资风格的 agent 评测试点。
  • QuantCode-Bench 可执行算法交易代码生成基准。
  • TwinMarket 用于研究 agent 交互的 LLM 驱动市场仿真。

实盘竞技场与公开战绩 ​

安全与可信 ​

踩坑提示 ​

没有成本、延迟和防泄漏控制的排行榜收益不能当证据。优先选择公开污染策略和工具访问规则的基准。

仅供学习研究,不构成投资建议。