OmniEval
收藏资源简介:
OmniEval是一个在金融领域中用于全方位和自动化RAG评估的基准数据集,包括自动生成的评估数据集和构建的知识语料库。
OmniEval is a benchmark dataset for comprehensive and automated RAG evaluation in the financial domain, including automatically generated evaluation datasets and a constructed knowledge corpus.
OmniEval: Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain
数据集概述
OmniEval 是一个面向金融领域的全方位自动检索增强生成(RAG)评估基准。该数据集提供了以下两个主要数据集:
-
自动生成的评估数据集:
-
构建的知识语料库:
数据集使用
1. 构建检索语料库
-
如果使用提供的知识语料库,可以从以下链接下载:
- 链接:FlashRAG_datasets
- 将下载的文件移动到
./OpenFinBench/corpus/nodes_dir目录下。
-
如果需要构建自己的知识语料库,可以执行以下脚本: bash sh corpus_builder/build_corpus.sh
2. 生成评估数据样本
-
生成评估实例: bash sh data_generator/generate_data.sh
-
过滤(质量检查)评估实例: bash sh data_generator/generate_data_filter.sh
3. 模型推理
- 配置 API 进行推理: bash sh evaluator/inference/rag_inference.sh
4. 模型评估
(a) 基于模型的评估
- 提供了五个基于模型的评估指标:准确性、完整性、利用率、数值准确性和幻觉。
- 评估模型可以从以下链接加载:
- 幻觉评估模型:OmniEval-HallucinationEvaluator
- 其他评估模型:OmniEval-ModelEvaluator
(b) 基于规则的评估
- 设置
judge_type为rule: bash sh evaluator/judgement/judger.sh
许可证
OmniEval 使用 MIT 许可证。
引用
bibtex @misc{wang2024omnievalomnidirectionalautomaticrag, title={OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain}, author={Shuting Wang and Jiejun Tan and Zhicheng Dou and Ji-Rong Wen}, year={2024}, eprint={2412.13018}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2412.13018}, }




