2npc/KnowledgeBerg
收藏资源简介:
--- configs: - config_name: default data_files: - split: train path: data/English/tip_of_iceberg_en.csv - config_name: English data_files: - split: train path: data/English/tip_of_iceberg_en.csv - config_name: Arabic data_files: - split: train path: data/Arabic/tip_of_iceberg_ar.csv - config_name: Bengali data_files: - split: train path: data/Bengali/tip_of_iceberg_bn.csv - config_name: Chinese data_files: - split: train path: data/Chinese/tip_of_iceberg_zh.csv - config_name: Dutch data_files: - split: train path: data/Dutch/tip_of_iceberg_nl.csv - config_name: French data_files: - split: train path: data/French/tip_of_iceberg_fr.csv - config_name: German data_files: - split: train path: data/German/tip_of_iceberg_de.csv - config_name: Hindi data_files: - split: train path: data/Hindi/tip_of_iceberg_hi.csv - config_name: Italian data_files: - split: train path: data/Italian/tip_of_iceberg_it.csv - config_name: Japanese data_files: - split: train path: data/Japanese/tip_of_iceberg_ja.csv - config_name: Korean data_files: - split: train path: data/Korean/tip_of_iceberg_ko.csv - config_name: Russian data_files: - split: train path: data/Russian/tip_of_iceberg_ru.csv - config_name: Spanish data_files: - split: train path: data/Spanish/tip_of_iceberg_es.csv - config_name: Swahili data_files: - split: train path: data/Swahili/tip_of_iceberg_sw.csv - config_name: Telugu data_files: - split: train path: data/Telugu/tip_of_iceberg_te.csv - config_name: Thai data_files: - split: train path: data/Thai/tip_of_iceberg_th.csv - config_name: Turkish data_files: - split: train path: data/Turkish/tip_of_iceberg_tr.csv --- # KnowledgeBerg KnowledgeBerg is a multilingual benchmark for knowledge-grounded reasoning over enumerated answer sets. The default configuration is English. Use the dataset viewer's configuration selector to open each language separately. ## Data Each language is stored as one CSV file under `data/<Language>/`. Columns: - `id` - `original_id` - `domain` - `original_question` - `original_answer` - `question_type` - `implicit_question` - `options` - `correct_option` - `reasoning_depth` - `knowledge_width` - `validation_cot`
配置项: - 配置名称:default 数据文件: - 拆分集:训练集 文件路径:data/English/tip_of_iceberg_en.csv - 配置名称:英语 数据文件: - 拆分集:训练集 文件路径:data/English/tip_of_iceberg_en.csv - 配置名称:阿拉伯语 数据文件: - 拆分集:训练集 文件路径:data/Arabic/tip_of_iceberg_ar.csv - 配置名称:孟加拉语 数据文件: - 拆分集:训练集 文件路径:data/Bengali/tip_of_iceberg_bn.csv - 配置名称:汉语 数据文件: - 拆分集:训练集 文件路径:data/Chinese/tip_of_iceberg_zh.csv - 配置名称:荷兰语 数据文件: - 拆分集:训练集 文件路径:data/Dutch/tip_of_iceberg_nl.csv - 配置名称:法语 数据文件: - 拆分集:训练集 文件路径:data/French/tip_of_iceberg_fr.csv - 配置名称:德语 数据文件: - 拆分集:训练集 文件路径:data/German/tip_of_iceberg_de.csv - 配置名称:印地语 数据文件: - 拆分集:训练集 文件路径:data/Hindi/tip_of_iceberg_hi.csv - 配置名称:意大利语 数据文件: - 拆分集:训练集 文件路径:data/Italian/tip_of_iceberg_it.csv - 配置名称:日语 数据文件: - 拆分集:训练集 文件路径:data/Japanese/tip_of_iceberg_ja.csv - 配置名称:韩语 数据文件: - 拆分集:训练集 文件路径:data/Korean/tip_of_iceberg_ko.csv - 配置名称:俄语 数据文件: - 拆分集:训练集 文件路径:data/Russian/tip_of_iceberg_ru.csv - 配置名称:西班牙语 数据文件: - 拆分集:训练集 文件路径:data/Spanish/tip_of_iceberg_es.csv - 配置名称:斯瓦希里语 数据文件: - 拆分集:训练集 文件路径:data/Swahili/tip_of_iceberg_sw.csv - 配置名称:泰卢固语 数据文件: - 拆分集:训练集 文件路径:data/Telugu/tip_of_iceberg_te.csv - 配置名称:泰语 数据文件: - 拆分集:训练集 文件路径:data/Thai/tip_of_iceberg_th.csv - 配置名称:土耳其语 数据文件: - 拆分集:训练集 文件路径:data/Turkish/tip_of_iceberg_tr.csv # KnowledgeBerg KnowledgeBerg是一款面向枚举式答案集的知识驱动推理多语言基准测试集。 默认配置为英语。可通过数据集查看器的配置选择器分别加载各语言版本的数据集。 ## 数据 各语言版本的数据均以CSV文件形式存储于`data/<Language>/`目录下。 数据字段说明: - `id`:数据唯一标识 - `original_id`:原始数据标识 - `domain`:所属领域 - `original_question`:原始问题 - `original_answer`:原始答案 - `question_type`:问题类型 - `implicit_question`:隐含问题 - `options`:候选选项集合 - `correct_option`:正确选项 - `reasoning_depth`:推理深度 - `knowledge_width`:知识覆盖广度 - `validation_cot`:验证型思维链(Chain of Thought,CoT)



