遇见数据集

kr-housing-longrag-bench

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

KR-Housing-LongRAG-Bench是一个韩语公共住房基准测试数据集,旨在评估长上下文大语言模型、检索增强生成系统以及表格/工具管道在官方住房公告、公共表格数据和住房法律证据上的性能。该数据集当前版本为v0.7(研究预览版),数据构建与v0.6版本相同。它包含2,011个问答对,划分为开发集(1,618个)、公开测试集(105个)和隐藏问题集(288个)。数据来源于10个公告提供者,覆盖9个韩国市道地区。问题风格多样,包括真实用户问题(605个)、专业分析师问题(1,250个)和诊断探针问题(156个),并识别出286个有效的近重复簇。数据集主要适用于问答和文本检索任务,特别针对韩语长上下文处理、RAG系统评估以及表格问答场景。已知注意事项包括:人工审核尚未完成;隐藏分割仅包含问题,答案被屏蔽;长上下文捆绑文本未包含在此数据包中;部分项目为诊断探针而非自然用户问题。基准注释采用CC BY 4.0许可证发布。

KR-Housing-LongRAG-Bench is a Korean public housing benchmark dataset designed to evaluate the performance of long-context large language models, retrieval-augmented generation systems, and table/tool pipelines on official housing announcements, public form data, and housing legal evidence. The current version is v0.7 (research preview), with data construction identical to v0.6. The dataset contains 2,011 question-answer pairs, divided into a development set (1,618), a public test set (105), and a hidden question set (288). Data is sourced from 10 announcement providers, covering 9 Korean municipal regions. Question styles are diverse, including real user questions (605), professional analyst questions (1,250), and diagnostic probe questions (156), with 286 effective near-duplicate clusters identified. It is primarily suitable for question answering and text retrieval tasks, especially for Korean long-context processing, RAG system evaluation, and table question answering scenarios. Known caveats include: manual review is not yet complete; the hidden split contains only questions with answers masked; long-context bundled text is not included in this data package; and some items are diagnostic probes rather than natural user questions. The benchmark annotations are released under the CC BY 4.0 license.

创建时间:
2026-06-05
原始信息汇总

数据集概述

KR-Housing-LongRAG-Bench 是一个面向韩国公共住房领域的基准测试数据集,旨在评估长上下文大语言模型、检索增强生成系统以及表格/工具流程在官方住房公告、公开表格数据和住房法律证据上的表现。

核心特性

  • 语言:韩语 (ko)
  • 许可证:CC BY 4.0
  • 任务类别:问答、文本检索
  • 标签:韩语、长上下文、RAG、表格问答、住房、基准测试
  • 版本状态v0.7 研究预览版,底层数据集构建与 v0.6 相同(之前的数据发布版本为 v0.6.3

数据集规模

  • 总问答数量:2,011 条
  • 公开数据划分
    • dev:1,618 条(包含答案)
    • test_public:105 条(包含答案)
    • test_hidden:288 条(仅含问题,答案已屏蔽,黄金谓词为空,黄金行ID为空)
  • 数据来源
    • 公告提供方:10 个
    • 公告覆盖区域:9 个 시도(韩国广域行政区)
  • 问题类型分布
    • 真实用户问题:605 条
    • 专业分析师问题:1,250 条
    • 诊断探测问题:156 条
  • 有效近似重复聚类数:286 个

数据集包含的文件

文件 划分 描述
data/dev.jsonl dev 包含答案
data/test_public.jsonl test_public 包含答案
data/test_hidden_questions.jsonl test_hidden 答案被屏蔽;黄金谓词和黄金行ID为空
data/prompts.jsonl prompts 仅定位器提示输入(公开安全)
data/source_manifest.jsonl metadata 来源注册与许可状态
data/task_schema.json metadata QA 模式定义

注意:本数据集不包含原始PDF/HWP/HWPX文档、提取的文档文本、捆绑文本、API密钥或隐藏的黄金答案。长上下文捆绑文本未在数据包中重新分发,需通过 GitHub 仓库从官方来源 URL 重建本地捆绑包。

加载方式

使用 datasets 库加载:

python from datasets import load_dataset

qa = load_dataset("comsa33/kr-housing-longrag-bench", "qa") prompts = load_dataset("comsa33/kr-housing-longrag-bench", "prompts")

print(qa["dev"][0]) print(prompts["prompts"][0])

评估方法

通过 GitHub 仓库中的官方评估器进行评分:

bash git clone https://github.com/comsa33/kr-housing-longrag-bench.git cd kr-housing-longrag-bench python3 scripts/eval_harness_v06.py --pred predictions.jsonl

预测文件格式要求:

json {"qa_id": "krhlrb_v05_0001", "prediction": "your model answer"}

评估器会报告按数据划分、任务类型和问题风格计算的原始准确率聚类加权准确率

已知限制

  • 人工审查结果尚未完成
  • 隐藏划分仅包含问题,黄金答案未在数据包中分发
  • 部分问题为诊断探测问题,并非自然用户问题
  • 该基准为研究预览版,并非最终封闭的排行榜基准

引用信息

若使用本数据集,请引用 v0.7 版本(通过其 Zenodo 版本化DOI):

@dataset{lee_kr_housing_longrag_bench_v07_2026, author = {Lee, Ruo}, title = {KR-Housing-LongRAG-Bench}, year = {2026}, version = {v0.7 (research-preview; dataset build v0.6)}, publisher = {Zenodo}, doi = {10.5281/zenodo.20570856}, url = {https://doi.org/10.5281/zenodo.20570856}, note = {Research-preview release (baseline scaffold + smoke diagnostics) over the unchanged v0.6 dataset build; the v0.6 data is archived as v0.6.3 (versioned DOI 10.5281/zenodo.20563604).} }

  • 概念 DOI:10.5281/zenodo.20559127(始终指向最新版本)
  • v0.6 数据构建归档版本:v0.6.3(版本化 DOI:10.5281/zenodo.20563604

相关资源

  • GitHub 仓库https://github.com/comsa33/kr-housing-longrag-bench
  • Zenodo 记录https://doi.org/10.5281/zenodo.20559127
搜集汇总
数据集介绍
kr-housing-longrag-bench 数据集图片
构建方式
该数据集以韩国公共住房领域为核心,精心整合了来自10个公告机构的官方住房公告、公开表格数据及住房法律证据,构建起一个涵盖2,011个问答对的高质量基准。数据集的构建过程注重来源的多样性与真实性,其问题设计则经由真实用户、专业分析师与诊断探针三种风格交织而成,总计包含605个真实用户问题、1,250个专业分析师问题及156个诊断探针,充分模拟了实际应用场景中的查询复杂性。此外,为消除冗余,数据集中识别并保留了286个有效的近似重复簇,从而在保证覆盖率的同时提升了评估的严谨性。
特点
此数据集专为评估长语境大型语言模型、检索增强生成系统及表格/工具流水线而设计,展现出鲜明的领域专属特色。其问题形式横跨自由文本与表格问答,且涵盖公开测试、非公开测试及开发集等多种划分,便于进行多层次的性能诊断。尤其是,数据集融入了诊断探针这一特殊类别,用以探测模型在长文本处理与逻辑推理中的潜在短板。值得注意的是,该基准当前为研究预览版,尚未经人工全面验证,但其结构化设计与领域聚焦性已为韩国公共住房场景下的问答系统评测提供了重要参照。
使用方法
用户可通过Hugging Face的`datasets`库便捷加载数据,调用`load_dataset`函数即可获取问答集与提示集。具体而言,开发集与公开测试集包含答案,而非公开测试集则以掩码形式隐藏了真实解答,适用于模型产出的评估。为便于评测,官方评估器可通过GitHub仓库获取,使用Python脚本即可完成对预测结果的评分,支持按数据划分、任务类型与问题风格统计加权准确率。所有预测需遵循JSONL格式,包含问答标识符与模型答案,从而确保评估流程的标准化与可复现性。
背景与挑战
背景概述
KR-Housing-LongRAG-Bench是由研究者Ruo Lee于2026年推出的一项面向韩语公共住房领域的基准测试数据集,旨在评估长上下文大语言模型、检索增强生成系统以及表格与工具流水线在真实政务场景中的表现。该数据集以2,011个问答对为核心,涵盖来自10个公告机构、9个地区的官方住房公告、公共表格数据及住房法律证据,并设计了真实用户、专业分析师与诊断探针三类问题风格。作为公开可用的研究预览版本,该基准为韩语长上下文理解与多源异构信息检索提供了首个专门评估框架,有望推动政务文本智能处理与信息抽取技术的进步。
当前挑战
数据集面对的领域挑战在于,韩语公共住房信息分散于PDF、HWP等多格式文档与表格中,且法律条文与公告内容交织,对模型的长期依赖理解与跨模态检索能力提出极高要求。构建过程中,最大难点在于原始文档的版权与使用限制,致使长上下文文本无法随数据集直接分发,用户需自行从官方来源重建;同时,隐藏测试集仅提供问题而无标准答案,需通过GitHub官方评估器进行匿名评测。此外,部分条目为诊断探针而非自然用户提问,且人工审核尚未完成,引入了一定噪音与评估偏差。
常用场景
经典使用场景
KR-Housing-LongRAG-Bench最经典的使用场景,在于对长上下文大语言模型(Long-context LLM)与检索增强生成(RAG)系统进行端到端的综合评估。该数据集以韩国公共住房公告、政府制式表格与住房法规证据为原始材料,精心构造了覆盖官方通知解析、复杂表查询与法规条款检索三类任务的2011个问答对。研究者可借此检验模型在跨文档长序列中定位信号、融合多源信息并产出结构化答案的能力,尤其擅长诊断模型在真实复杂住房政策查询中的推理深度与事实忠实度。
衍生相关工作
围绕该数据集已衍生出两项关键工作:一是官方配套的评测框架,包含用于标准化打分与聚类加权评估的脚本(eval_harness_v06.py),为后续研究提供了可复现的评估协议;二是基线系统对比实验,通过全上下文输入与稀疏检索两种管道在烟雾测试集上的性能差异,揭示了当前主流长上下文模型在处理韩语法规类多步推理任务时面临的忠实度与定位瓶颈。这些奠基性探索激励了检索策略优化、长程注意力蒸馏及多文档压缩等方向的进一步研究。
数据集最近研究
最新研究方向
KR-Housing-LongRAG-Bench作为韩国公共住房领域的首个长上下文基准测试集,聚焦于评估大语言模型在复杂住房公告、表格数据及法律条文上的长文本理解与检索增强生成能力。该数据集包含2011个问答对,涵盖真实用户与专业分析师两种问题风格,并引入诊断探针以测试模型边界。其研究前沿在于推动RAG系统对多源异构文档(如PDF、HWP、法律条文)的细粒度语义对齐,以及长上下文场景下的表问答与工具链集成。这一基准的构建紧密关联韩国住房政策透明化与智能政务需求,为多语言长上下文评估提供了稀缺的东亚语言样本,有助于揭示当前模型在结构化与非结构化数据混合推理中的短板,对提升AI在法律与公共事务领域的可信应用具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务