遇见数据集

kdv-rag-benchmark

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

KDV RAG Benchmark 是一个针对土耳其增值税(KDV)法规的检索增强生成(RAG)基准数据集,专注于时间点(Point-in-Time)检索任务。该数据集旨在评估检索系统能否根据查询事件发生时的有效法律条文版本,而非当前规则,返回正确的法律条款。数据集包含训练集(728条,覆盖2018-2023年)和测试集(154条,覆盖2024-2026年),采用时间分割以避免数据泄露。语料库提供两种粒度:未分块版本(110条,完整法律条文)和分块版本(174条,将长条文拆分为更小的段落,通常能提升检索效果)。每条查询(源自土耳其税务局GİB的税务裁定)包括问题、官方回答以及引用的法律条款ID;语料库条目包括条文ID、标题、全文、来源链接等字段。该基准可用于评估稀疏检索(如BM25)、稠密检索(如e5-large、Nomic Embed v2)、混合重排(RRF)及交叉编码器(如Qwen3-Reranker)等方法的recall@10性能。README还报告了多个实验发现,如分块对小模型可能适得其反、样板条款对评估的干扰,以及混合重排在大规模干净查询集上的优势。数据集采用CC BY 4.0许可证,数据来源于土耳其官方公开数据。

The KDV RAG Benchmark is a retrieval-augmented generation (RAG) benchmark dataset for Turkish Value Added Tax (KDV) regulations, focusing on point-in-time retrieval tasks. The dataset aims to evaluate whether retrieval systems can return the correct legal provisions based on the version of the law effective at the time of the query event, rather than current rules. It includes a training set (728 entries, covering 2018-2023) and a test set (154 entries, covering 2024-2026), with time-based splitting to avoid data leakage. The corpus is provided in two granularities: an unchunked version (110 entries, full legal articles) and a chunked version (174 entries, splitting long articles into smaller paragraphs, which often improves retrieval performance). Each query (derived from Turkish Revenue Administration GİB tax rulings) includes a question, official answer, and cited legal article IDs; corpus entries include article ID, title, full text, source link, and other fields. This benchmark can be used to evaluate recall@10 performance of methods such as sparse retrieval (e.g., BM25), dense retrieval (e.g., e5-large, Nomic Embed v2), hybrid re-ranking (RRF), and cross-encoders (e.g., Qwen3-Reranker). The README also reports several experimental findings, such as chunking potentially being counterproductive for small models, the interference of boilerplate clauses in evaluation, and the advantages of hybrid re-ranking on large, clean query sets. The dataset is licensed under CC BY 4.0, with data sourced from Turkish official public data.

创建时间:
2026-08-05
原始信息汇总

KDV RAG Benchmark 数据集总结

数据集概览

该数据集是专为土耳其增值税(KDV)法规设计的检索增强生成(RAG)基准测试集,核心特点是 Point-in-Time Retrieval——评估检索系统在特定历史时间点下,能否找到当时有效的法规条款版本,而非回答当前规则。

  • 许可证: CC BY 4.0
  • 语言: 土耳其语
  • 数据规模: 1K-10K 条记录
  • 任务类型: 问答、文本检索

数据集结构

数据划分(Temporal Split)

Split 记录数 时间范围
train 728 2018–2023
test 154 2024–2026

划分策略为时间性划分,训练集和测试集来自不同时间段,最大限度降低数据泄漏风险。

语料库(两种粒度)

配置 记录数 内容
corpus 110 KDV法(3065号)完整条款,未分割
corpus_chunked 174 同一批条款,其中27条超过2000字符的条款被细分为子段落

数据特征

训练/测试集(benchmark)

  • id: 税务局(GİB)裁定ID(整数)
  • siteLink: 来源URL(gib.gov.tr)
  • ozelgeNo: 官方裁定编号
  • ozelgeTarih: 发布日期(YYYY-MM-DD)
  • baslik: 裁定标题
  • kanunNo: 法律编号(3065)
  • soru: 纳税人问题
  • cevap: 税务局回答
  • madde_atiflar: 引用的条款列表(含ID和标题)

语料集(corpus)

  • id: 条款ID
  • title: 条款标题
  • metin: 条款全文
  • siteLink: 来源URL
  • priority: 条款顺序
  • bolum: 章节标题

分块语料集(corpus_chunked)

  • chunk_id: 分块标识(格式:MADDE_<条款ID>_<序号>
  • article_id: 对应语料中的条款ID(用于ground truth匹配)
  • title: 条款标题
  • section: 子章节标题(如有)
  • part: 块在条款中的顺序
  • metin: 分块文本
  • metin_len: 字符长度

基准测试结果

基础模型表现(recall@10)

模型 参数规模 未分块语料 分块语料
BM25 0.344 0.407
e5-large 560M 0.285 0.353
BGE-M3 560M 0.272 0.388
Qwen3-Embedding-0.6B 0.6B 0.377 0.316
Qwen3-Embedding-4B 4B —¹ 0.363
Qwen3-Embedding-8B 8B —¹ 0.515
Nomic Embed v2-moe 305M(MoE) —¹ 0.602
Türkçe-native (trmteb) —¹ 0.429

¹ 未在未分块语料上测试——部分未分割条款(如第17条,35K字符)导致长上下文模型VRAM耗尽、耗时不可接受。

关键发现

  1. 分块效应:将条款分块(article → corpus_chunked)带来的性能提升大于更换模型。唯一例外是Qwen3-Embedding-0.6B(0.377 → 0.316),表明小模型有时需要完整上下文。
  2. 样板条款问题:41%的引用指向3个与具体问题无关的常用条款(KDV税率、征税对象、纳税责任人),这些查询无法通过内容匹配检索解决。排除后(剩余91条查询),真实检索质量显著提升:BM25达0.533,Nomic v2达0.626。
  3. 模型规模与排名:最小模型(Nomic v2,305M参数)在MTEB排名上超过顶级模型(Qwen3-Embedding-8B),但经bootstrap统计检验,在排除样板条款的难题中该差异不显著。MTEB排名不直接适用于低资源语言+小型语料的任务。

混合重排序(BM25 + 密集检索,RRF)

组合 原始recall@10 (n=154) 清理后recall@10 (n=91)
BM25(单独) 0.407 0.533
Nomic v2(单独) 0.602 0.626
Qwen3-Embedding-8B(单独) 0.515 0.583
BM25 + Nomic v2 (RRF) 0.554 0.658
BM25 + Qwen3-Embedding-8B (RRF) 0.570 0.663

发现4:混合重排序并非总有效。将弱模型(Qwen3-8B)与BM25结合,在清理数据上获得显著提升(98%置信度);但已针对任务优化的强模型(Nomic v2)混合BM25无额外收益(清理数据82%置信度,原始数据反而轻微下降)。

交叉编码器重排序

组合 原始recall@10 (n=154) 清理后recall@10 (n=91)
bge-reranker-v2-m3(pool20) 0.580 0.631
Qwen3-Reranker-8B(pool20) 0.632 0.687

发现5:弱交叉编码器(bge,568M)无法显著超越单独Nomic或混合RRF——架构本身不足,模型质量是关键。强交叉编码器(Qwen3-Reranker-8B)在小数据集上显著超过BM25和Nomic单独性能。

扩展/清理后基准(发现6)

改进措施:(1)移除了76个不属于KDV法(多为税法)的引用;(2)将训练集作为额外评估查询加入(未进行微调),使查询数增至813条原始/270条清理后。

方法 原始 (n=813) 清理后 (n=270)
BM25 0.377 0.624
Nomic v2(单独) 0.593 0.646
Hibrit BM25+Nomic (RRF) 0.569 0.706
Hibrit BM25+Qwen3-8B (RRF) 0.559 0.698
bge-reranker-v2-m3(pool20) 0.618 0.653
Qwen3-Reranker-8B(pool20) 0.644 0.664

发现6:统计功效提升后结果反转——大/清理数据集中混合RRF超过交叉编码器(98%置信度),交叉编码器受限于单一首阶段检索器的top-k,而混合RRF可结合两个独立完整排序。原始(样板条款占主导)数据中交叉编码器仍领先。教训:不要轻信小数据集结论,应提高统计功效。

交叉编码器首阶段池:BM25 ∪ Nomic(发现7)

将首阶段池改为BM25 top-20 与 Nomic top-20 的并集(≤40个候选)。

方法 原始 (n=813) 清理后 (n=270)
混合BM25+Nomic(RRF) 0.569 0.706
Qwen3-Reranker-8B(仅Nomic池) 0.644 0.664
Qwen3-Reranker-8B(BM25∪Nomic池) 0.664 0.725

发现7:假设得到验证——联合池在原始和清理数据上均带来显著提升(98%和100%置信度)。关键在于添加不同来源的候选而非扩大单一来源的排序池。清理数据上超越混合RRF的差距不再显著(82%置信度),两者实践等价。代价:池大小不固定(≤40),每查询耗时约增加2倍。当前最佳成绩:清理数据recall@10 = 0.725

使用方式

python from datasets import load_dataset

基准数据

train = load_dataset("er3nhf/kdv-rag-benchmark", "benchmark", split="train") test = load_dataset("er3nhf/kdv-rag-benchmark", "benchmark", split="test")

语料(未分块,110条款)

corpus = load_dataset("er3nhf/kdv-rag-benchmark", "corpus", split="train")

语料(分块,174条记录——检索效果更佳)

corpus_chunked = load_dataset("er3nhf/kdv-rag-benchmark", "corpus_chunked", split="train")

评估方法:对每条测试记录,使用soru作为查询,madde_atiflar中的ID集合作为ground truth,计算recall@10。

数据来源

发布的是引用和标注,而非原始文本。

重要提醒

如果使用训练集进行微调,则评估只能使用原始154条记录的test集——将train加入评估会导致微调模型的数据泄漏。813/270的数字仅适用于零样本/预训练模型的比较。

搜集汇总
数据集介绍
kdv-rag-benchmark 数据集图片
构建方式
该数据集针对土耳其增值税法规的检索增强生成(RAG)任务而构建,其核心创新在于时间点检索(point-in-time retrieval)评估。数据来源于土耳其税务局(GIB)的官方税务裁定(özelge)与《增值税法》(编号3065)的条款文本,其中训练集包含2018至2023年的728条记录,测试集则涵盖2024至2026年的154条记录,采用时间切分策略以杜绝数据泄漏。语料库提供两种粒度:未分割的条款全集(110条)及将长条款拆分后的分块版本(174块),后者在检索中展现出更优性能。每条测试样本包含问题、官方答复、所援引条款的标注(madde_atiflar),语料块则保留了与原始条款的映射关系(article_id),从而支持精确的召回率评估。
特点
该数据集的独特之处在于其对时间敏感性的强调,要求检索系统能够定位特定历史日期生效的法律版本,而非仅返回当前规则,这挑战了通用语言模型在处理时效性法律查询时的局限性。基线实验揭示多项关键发现:分块处理对多数模型能带来显著增益,但小型模型例外;约41%的查询援引了与具体主题无关的通用条款,构成检索的结构性障碍;模型在土耳其语法律文本上的性能与通用基准排名并不一致,例如轻量级的Nomic Embed v2在召回率上超越了更大的模型。此外,通过混合BM25与稠密检索的倒数排名融合(RRF)以及使用强效交叉编码器重排,能进一步提升性能,而引入查询重写可带来额外收益,但收益幅度受样本量影响而呈现不确定性。
使用方法
数据集通过HuggingFace库加载,提供三个配置:benchmark(含训练与测试分片)、corpus(未分割条款)和corpus_chunked(分块条款)。评估时,将每条测试记录中的'问题'作为查询,以'madde_atiflar'字段标注的条款ID为金标准,对比检索系统返回的前k个结果的ID集合,计算召回率(recall@k)。用于测试的154条记录可直接评估,若需更大统计样本,可将训练分片作为零样本评估补充,但必须避免对训练分片进行微调,否则将造成数据泄漏。基准代码示例展示了加载数据与计算召回率的流程,便于研究者复现实验结果并开发新型RAG系统。
背景与挑战
背景概述
该数据集由土耳其研究人员于2023年创建,专注于土耳其增值税(KDV)法规的检索增强生成(RAG)评估。其核心研究问题在于,通用大语言模型在回答时间敏感的法律问题时,常因忽略法规的时效性而给出过时或错误的答案。该数据集通过引入'点对点时间检索'(point-in-time retrieval)机制,要求检索系统能够依据查询所涉事件的发生日期,找到当时有效版本的法律条款。这一创新设计填补了法律领域时间感知检索基准的空白,对法律科技、合规自动化及信息检索研究均具有重要影响,并为评估模型在动态法律环境下的鲁棒性提供了标准。
当前挑战
该数据集面临多重挑战。在领域层面,法律文本的复杂性与时效性构成主要困难:法规条文常被多次修订,且不同条款间存在大量交叉引用,导致检索系统需兼顾语义匹配与时态辨别。构建过程中,挑战体现在数据标注的精细度——需从土耳其税务局公开的税务裁定中提取问题、答案与法律条款的对应关系,并处理非标准引用(如引用其他法律)及高比例的通用性条款(约41%的引用指向雷同的'样板'条款),这些均会干扰检索评估的准确性。此外,语料的粒度选择(整条vs.分块)对模型性能影响显著,且长条款易导致资源消耗,需在评估设计上谨慎权衡。
常用场景
经典使用场景
该基准数据集专为土耳其增值税(KDV)法律领域的检索增强生成(RAG)系统设计,核心场景在于评估检索器在时间点(point-in-time)约束下的法律条文检索能力。数据集包含2018至2026年间的税务裁决(özelge)及其所引用的法律条款,通过时间分割的测试集和训练集,模拟真实世界中法律条文随时间演变的情境。经典用法是给定一个纳税人问题,要求检索系统返回在问题发生日期有效的相关法律条款,从而测试其对法律时效性的敏感度。基准提供了未切分和切分后的语料库,后者在多数模型上表现出更优的检索性能,为法律领域的信息检索研究提供了标准化的评估平台。
衍生相关工作
该基准衍生了多项前沿工作,聚焦于混合检索与重排序策略的优化。基线实验系统比较了BM25、密集检索及多种嵌入模型(如Nomic Embed v2、Qwen3系列),揭示了检索融合(如倒数排名融合RRF)与跨编码器重排序的互补优势。后续研究探索了查询重写(query rewriting)技术,利用大型语言模型将日常语言转化为法律术语,扩充候选池并提升召回率。更关键的是,数据集推动了时间感知检索模型的研究,尽管当前缺乏历史条文快照,但其设计为未来构建动态法律知识图谱提供了数据基础。此外,清洗后的评估协议(如剔除模板引用)启发了更严谨的基准构建方法,影响了其他法律NLP领域的评估实践。
数据集最近研究
最新研究方向
该数据集聚焦于土耳其增值税法领域的检索增强生成(RAG)系统评估,其前沿研究方向在于时间点检索(point-in-time retrieval)能力,即要求检索系统能够依据查询发生时点的有效法律条文进行匹配,而非基于当前法规,这对法律AI的时效性和动态适应性提出了更高要求。研究热点包括跨编码器重排序、混合检索(BM25与稠密向量结合)以及查询改写等技术的应用,实验表明通过融合多样化的检索策略和引入LLM改写查询,能显著提升法规匹配的准确性。该基准为法律科技、智慧司法等领域的模型开发提供了重要测试平台,也对多语言、低资源场景下的检索系统设计具有启示意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务