nor_agriculture_bench_with_cohere_model
收藏资源简介:
挪威农业基准数据集(含Cohere模型)是一个专为训练和评估大型语言模型在挪威农业领域应用而构建的合成数据集。该数据集源自关于挪威农业管理实践与生产LLM训练的研究论文,旨在使LLM能够用挪威语回答农业相关问题,以辅助农民提高粮食产量。数据集在Cohere Labs研究资助下生成,包含五个主要配置:原始文档(ingested)、摘要文档(summarized)、分块文档(chunked)、单跳问题(single_hop_questions)和多跳问题(multi_hop_questions),反映了从原始文档到最终问答对的数据处理流水线。数据生成流程包括文档摄取、分层摘要、文本分块、单跳/多跳问题生成以及基于重叠的引用评分筛选。数据集适用于问答任务,特别是针对挪威语农业知识的单跳和多跳问答,语言主要为挪威语(包括Bokmål和Nynorsk变体),遵循CC-BY-4.0许可证,数据规模在1万到10万样本之间。
数据集概述
数据集名称: nor_agri_bench_cohere (Norwegian Agriculture Bench with Cohere model)
数据集地址: https://huggingface.co/datasets/norjordAI/nor_agriculture_bench_with_cohere_model
许可协议: cc-by-4.0
语言: 挪威语 (no, nb, nn)
任务类别: 问答 (question-answering)
标签: agriculture, norwegian, cohere, question-answering
数据集规模: 10K < 样本数 < 100K
数据来源与用途
该数据集源自一篇研究论文中收集和描述的数据,专门用于训练大型语言模型,以回答关于挪威农业的问题。其使命是帮助挪威农民提高粮食产量。该合成数据集由 Cohere Labs Research Grant 支持。
数据集配置与特征
该数据集包含5个子配置,每个配置均只有训练集:
1. chunked (分块数据)
- 训练样本数: 3
- 数据集大小: 42,177,338 字节
- 特征:
- document_id (字符串)
- document_text (字符串)
- document_filename (字符串)
- document_metadata (结构体,包含 file_size)
- document_summary (字符串)
- summarization_model (字符串)
- chunks (列表,包含 chunk_id 和 chunk_text)
- multihop_chunks (列表,包含 chunk_ids 和 chunks_text)
2. ingested (原始数据)
- 训练样本数: 3
- 数据集大小: 7,586,679 字节
- 特征:
- document_id (字符串)
- document_text (字符串)
- document_filename (字符串)
- document_metadata (结构体,包含 file_size)
3. multi_hop_questions (多跳问答)
- 训练样本数: 9,962
- 数据集大小: 68,401,012 字节
- 特征:
- document_id (字符串)
- question (字符串)
- self_answer (字符串)
- generating_model (字符串)
- raw_response (字符串)
- citations (字符串列表)
- source_chunk_ids (字符串列表)
4. single_hop_questions (单跳问答)
- 训练样本数: 8,604
- 数据集大小: 35,609,314 字节
- 特征:
- document_id (字符串)
- question (字符串)
- self_answer (字符串)
- generating_model (字符串)
- raw_response (字符串)
- citations (字符串列表)
- chunk_id (字符串)
5. summarized (摘要数据)
- 训练样本数: 3
- 数据集大小: 7,589,458 字节
- 特征:
- document_id (字符串)
- document_text (字符串)
- document_filename (字符串)
- document_metadata (结构体,包含 file_size)
- document_summary (字符串)
- summarization_model (字符串)
数据处理流水线
该数据集通过以下流水线步骤生成:
- ingestion (数据导入): 读取原始源文档,转换为标准化 Markdown 格式
- summarization (摘要生成): 执行层级摘要,先进行分块级 LLM 摘要,再进行合并缩减
- chunking (分块): 将文本分割成基于 token 的单跳和多跳块
- single_hop_question_generation (单跳问答生成): 为每个块生成独立的问答对
- multi_hop_question_generation (多跳问答生成): 生成需要跨多个块推理的多跳问答对
- citation_score_filtering (引用分数过滤): 计算基于重叠的引用分数并过滤问答对
可复现性
该数据集可使用 YourBench v0.9.0 工具,配合指定的配置文件和 Cohere 模型 (command-a-03-2025) 进行复现。





