遇见数据集

taeyun16/korean-service-query-gating-v1

收藏
Hugging Face2026-04-09 更新2026-04-12 收录
官方服务:

资源简介:

--- language: - ko license: mit configs: - config_name: core default: true data_files: - split: train path: core/train.jsonl - split: validation path: core/validation.jsonl - split: test path: core/test.jsonl - config_name: stress_eval data_files: - split: train path: stress_eval/train.jsonl task_categories: - text-classification - text-retrieval pretty_name: Korean Service Query Gating V1 size_categories: - 1K<n<10K tags: - synthetic - korean - ood-detection - routing - helpdesk --- # Korean Service Query Gating V1 한국어 서비스 질의 게이팅 연구를 위한 합성 데이터셋입니다. 현실의 서비스 회사에서는 질문 분해, 도메인 판별, 라우팅 같은 태스크가 매우 중요하지만, 실제 질의 로그는 개인정보와 내부 정책 문제 때문에 공개하기 어렵습니다. 이 데이터셋은 그런 제약 아래에서도 재현 가능한 연구를 시작할 수 있도록 만든 **공개 가능한 Korean starting benchmark**입니다. 쉽게 말해 이 데이터셋은 아래 질문을 연구하기 위한 리소스입니다. - “이 질문이 우리 서비스 범위 안인가, 밖인가?” - “겉보기엔 비슷한데 실제 의미는 다른 질문을 어떻게 구분할까?” - “모델이 어떤 실패 유형에서 흔들리는가?” ## Quick Summary - 언어: 한국어 - 용도: 서비스 질의 게이팅 / 헬프데스크 질의 분류 / OOD stress evaluation - 구성: `core` + `stress_eval` - 성격: 합성 연구용 데이터셋 ## Friendly Glossary - `ID` (In-Domain) - 모델이 원래 처리해야 하는 질문 - 이 데이터셋에서는 IT 헬프데스크 질문을 뜻합니다. - `OOD` (Out-of-Domain) - 모델이 원래 처리 범위 밖이라고 판단해야 하는 질문 - 예: 날씨, 여행, 쇼핑, 음식 - `OOD hard` - 단어만 보면 IT 같지만 실제 의미는 IT가 아닌 질문 - `gate` - 질문을 먼저 빠르게 거르는 1차 판단기 - `gray-zone` - 모델이 확신하지 못해서 2차 검토로 넘길 수 있는 애매한 구간 - `keyword_trap` - `로그인`, `계정`, `업데이트`처럼 IT 단어가 들어 있어 모델이 속기 쉬운 케이스 - `mixed_intent` - 한 질문 안에 서로 다른 의도가 섞인 경우 - `needs_context` - 질문이 너무 짧거나 맥락이 부족해서 사람도 바로 판단하기 어려운 경우 ## Structure ```text core/train.jsonl core/validation.jsonl core/test.jsonl stress_eval/train.jsonl metadata/stress_eval_summary.json supplemental/raw/ supplemental/prompts/ ``` ## Datasets 이 리포지토리에는 두 개의 주요 데이터셋이 있습니다. ### 1. `core` `core/`는 메인 실험용 canonical split입니다. - `core/train.jsonl` - `core/validation.jsonl` - `core/test.jsonl` 여기에는 세 종류의 질문이 섞여 있습니다. - `id`: IT 헬프데스크 질의 - `ood_easy`: 명백한 비IT 질의 - `ood_hard`: IT 키워드를 포함하지만 실제 의미는 비IT인 질의 초보자 관점에서 보면 `core`는: - “기본 모델이나 threshold를 맞춰보는 데 쓰는 메인 데이터셋” - “무엇이 잘 되는지 보기 좋은 셋” 입니다. canonical split은 row-level random split이 아니라 `label + subcategory + text prefix` 기반 grouped split으로 만들었다. 또한 `id`와 `ood_easy`에는 반복적인 opening/template를 줄이는 표면 다양화 보정을 적용했다. 즉, 단순히 “합성 데이터를 많이 만든 것”이 아니라, **가설 검증에 너무 쉬워지지 않도록 한 번 더 손본 메인 연구용 셋**입니다. ### 2. `stress_eval` `stress_eval/train.jsonl`는 failure mode 진단용 보조 평가셋입니다. 핵심 필드: - `text` - `label` - `primary_tag` - `secondary_tags` - `difficulty` - `scenario` - `subcategory` - `keywords` 라벨: - `id` - `ood` - `uncertain` 대표 시나리오: - `ood_keyword_trap` - `too_short_id` - `too_short_ood` - `too_short_uncertain` - `uncertain_mixed_intent` - `uncertain_needs_context` 이 셋은 “평균 점수가 잘 나오는지”보다 - 모델이 키워드에 속는지 - 너무 짧은 질문에서 흔들리는지 - 한 문장에 두 의도가 섞이면 무너지는지 - 맥락이 부족할 때 과감하게 틀리는지 를 확인하기 위한 평가셋입니다. 즉, `stress_eval`은: - “어디서 망가지는지 보기 좋은 셋” - “failure mode를 설명하기 좋은 셋” 입니다. ## Provenance 최종 canonical v1은 단순 프롬프트 출력물이 아닙니다. 1. source prompts로 원천 synthetic raw 생성 2. 일부 클래스(`id`, `ood_easy`)에 대해 반복 표현을 줄이는 후처리 적용 3. train/test가 너무 비슷해지지 않도록 grouped split 재구성 즉 `supplemental/prompts/`는 원천 생성에 사용된 프롬프트이며, 최종 v1은 그 raw에 후처리와 canonical split 정책을 더한 결과물입니다. ## Recommended Usage - 구조 탐색/튜닝: - `core/` - stress evaluation: - `stress_eval/train.jsonl` 처음 시작할 때는 보통 이렇게 씁니다. 1. `core`로 기본 모델을 학습하거나 threshold를 맞춘다. 2. `stress eval`로 실제로 어디서 실수하는지 본다. 3. 나중에 실데이터가 있으면 그걸로 최종 검증한다. ## Quick Start 허깅페이스에서 가장 일반적으로는 `datasets` 라이브러리로 바로 읽습니다. 예시: ```python from datasets import load_dataset dataset = load_dataset("taeyun16/korean-service-query-gating-v1") print(dataset) print(dataset["train"][0]) ``` `stress_eval`을 읽고 싶다면 config를 지정하면 됩니다. ```python from datasets import load_dataset stress = load_dataset( "taeyun16/korean-service-query-gating-v1", "stress_eval", split="train", ) keyword_trap = stress.filter(lambda row: row["primary_tag"] == "keyword_trap") print(len(keyword_trap)) ``` 로컬 JSONL을 직접 읽고 싶다면 이렇게도 할 수 있습니다. ```python import json from pathlib import Path rows = [ json.loads(line) for line in Path("core/train.jsonl").open(encoding="utf-8") if line.strip() ] ``` ## Limitations - 합성 데이터라 템플릿 편향이 남아 있습니다. - 한국어 기업형 헬프데스크 맥락에 최적화돼 있습니다. - 실제 운영 로그 기반 최종 검증을 대체하지는 못합니다. 그래서 이 데이터셋은 **실서비스를 그대로 대표하는 benchmark**라기보다, - 공개 가능한 Korean starting benchmark - failure-mode-aware research dataset - real-world validation 이전 단계의 연구 리소스 로 보는 것이 가장 적절합니다. ## Citation 이 데이터셋을 사용한다면 아래 형식으로 참조할 수 있습니다. ```bibtex @misc{korean_service_query_gating_v1, title = {Korean Service Query Gating V1}, year = {2026}, note = {Synthetic Korean benchmark for embedding-gate and service-query routing research} } ```

yaml 语言: - 韩语 许可证:MIT 配置项: - 配置名称:core 默认配置:是 数据文件: - 拆分集:训练集 路径:core/train.jsonl - 拆分集:验证集 路径:core/validation.jsonl - 拆分集:测试集 路径:core/test.jsonl - 配置名称:stress_eval 数据文件: - 拆分集:训练集 路径:stress_eval/train.jsonl 任务类别: - 文本分类 - 文本检索 展示名称:韩国服务查询门控V1 样本规模:1000 < n < 10000 标签: - 合成数据集 - 韩语 - 域外检测(OOD-Detection) - 路由 - 客服台 # 韩国服务查询门控V1 本数据集为韩国语服务查询门控研究专用合成数据集。 在现实的服务企业中,问题拆解、域判别、路由等任务至关重要,但由于涉及个人隐私与内部政策限制,真实的查询日志难以公开。本数据集正是为了让研究者在上述限制下仍能开展可复现的研究而打造的**可公开获取的韩国语基准测试集(Korean starting benchmark)**。 简言之,本数据集用于研究以下问题: - 该查询是否属于本服务的覆盖范围? - 如何区分外观相似但实际语义不同的查询? - 模型会在哪些失败场景中出现判断摇摆? ## 快速概览 - 语言:韩语 - 用途:服务查询门控 / 客服台查询分类 / 域外压力测试(OOD stress evaluation) - 数据集构成:`core` + `stress_eval` - 性质:合成研究专用数据集 ## 常用术语对照表 - **域内样本(ID, In-Domain)** - 指模型原本需要处理的查询 - 本数据集中特指IT客服台查询 - **域外样本(OOD, Out-of-Domain)** - 指模型需要判定为超出处理范围的查询 - 示例:天气、旅行、购物、餐饮相关查询 - **难分域外样本(OOD hard)** - 指仅从词汇看类似IT相关,但实际语义不属于IT领域的查询 - **门控(gate)** - 指用于快速初步筛选查询的一级判别器 - **灰色地带(gray-zone)** - 指模型无法确信判断结果,需转入二次审核的模糊区间 - **关键词陷阱(keyword_trap)** - 指包含“登录”“账户”“更新”等IT词汇,易误导模型的样本案例 - **混合意图(mixed_intent)** - 指单条查询中包含多种不同意图的情况 - **需上下文(needs_context)** - 指查询过短或缺乏上下文,即使是人类也难以快速判定的样本 ## 数据集结构 text core/train.jsonl core/validation.jsonl core/test.jsonl stress_eval/train.jsonl metadata/stress_eval_summary.json supplemental/raw/ supplemental/prompts/ ## 数据集详情 本仓库包含两个主要数据集: ### 1. `core` 数据集 `core/` 为核心实验用标准划分(canonical split)数据集。 包含以下三个文件: - `core/train.jsonl` - `core/validation.jsonl` - `core/test.jsonl` 该数据集包含三类查询: - `id`:IT客服台查询 - `ood_easy`:明确的非IT查询 - `ood_hard`:包含IT关键词,但实际语义不属于IT领域的查询 对于初学者而言,`core` 数据集相当于: - 用于调试基础模型或阈值的核心数据集 - 便于观察模型性能表现的数据集 本次采用的标准划分并非基于行级随机划分,而是基于`标签+子类别+文本前缀`的分组划分方式。此外,我们对`id`与`ood_easy`样本应用了表面多样化校正,以减少重复的开场白与模板化表达。 换言之,本数据集并非简单的大规模合成数据,而是**为避免假设验证过于简单,经过进一步优化的核心研究数据集**。 ### 2. `stress_eval` 数据集 `stress_eval/train.jsonl` 为故障模式诊断专用辅助评估集。 核心字段: - `text` - `label` - `primary_tag` - `secondary_tags` - `difficulty` - `scenario` - `subcategory` - `keywords` 标签类型: - `id` - `ood` - `uncertain` 典型场景: - `ood_keyword_trap` - `too_short_id` - `too_short_ood` - `too_short_uncertain` - `uncertain_mixed_intent` - `uncertain_needs_context` 该数据集并非用于验证模型的平均得分表现,而是用于考察: - 模型是否会被关键词误导 - 模型在过短查询中是否会出现判断摇摆 - 模型在包含混合意图的查询中是否会失效 - 模型在缺乏上下文时是否会出现武断的错误判断 换言之,`stress_eval` 数据集是: - 便于观察模型故障点的数据集 - 便于分析模型故障模式的数据集 ## 数据集生成溯源 本次发布的标准V1版本并非简单的大语言模型提示词输出结果,其生成流程如下: 1. 基于源提示词生成原始合成样本 2. 对`id`与`ood_easy`类别样本应用重复表达精简的后处理 3. 基于分组划分规则重构训练集与测试集,避免二者分布过于相似 换言之,`supplemental/prompts/` 目录存放的是原始生成所用的提示词,最终V1版本是在原始合成样本基础上,经过后处理与标准划分策略优化后的成果。 ## 推荐使用方式 - 模型结构探索与调优:使用`core/`数据集 - 压力测试评估:使用`stress_eval/train.jsonl` 研究者通常可按以下流程开展实验: 1. 使用`core`数据集训练基础模型或调整判别阈值 2. 借助`stress_eval`数据集分析模型的实际失误点 3. 若后续获取到真实业务数据,可使用其开展最终验证 ## 快速上手 在Hugging Face平台上,最常用的加载方式为通过`datasets`库直接读取。 示例代码: python from datasets import load_dataset dataset = load_dataset("taeyun16/korean-service-query-gating-v1") print(dataset) print(dataset["train"][0]) 若需加载`stress_eval`数据集,只需指定配置名称即可。 示例代码: python from datasets import load_dataset stress = load_dataset( "taeyun16/korean-service-query-gating-v1", "stress_eval", split="train", ) keyword_trap = stress.filter(lambda row: row["primary_tag"] == "keyword_trap") print(len(keyword_trap)) 若需直接读取本地JSONL文件,也可采用以下方式: python import json from pathlib import Path rows = [ json.loads(line) for line in Path("core/train.jsonl").open(encoding="utf-8") if line.strip() ] ## 局限性说明 - 由于为合成数据集,仍存在模板化表达的偏差 - 本数据集针对韩国企业客服台场景进行了优化,适配性有限 - 无法替代基于真实业务运营日志的最终验证 因此,本数据集并非**完全复刻真实服务场景的基准测试集**,而更适合作为以下三类研究资源: - 可公开获取的韩国语初始基准测试集(Korean starting benchmark) - 支持故障模式分析的研究数据集 - 真实场景验证前的过渡型研究资源 ## 引用规范 若使用本数据集,请按以下格式进行引用: bibtex @misc{korean_service_query_gating_v1, title = {Korean Service Query Gating V1}, year = {2026}, note = {Synthetic Korean benchmark for embedding-gate and service-query routing research} }

提供机构:
taeyun16
二维码
社区交流群
二维码
科研交流群
商业服务