遇见数据集

medical-specialty-ru-synthetic-1000

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

Medical Specialty RU Synthetic 1000 是一个用于医疗专科路由任务的俄语合成文本分类数据集,专为根据患者主诉文本将其分配至特定医疗专科(共10类:胃肠科、妇科、皮肤科、神经科、耳鼻喉科、牙科、内科、创伤科、泌尿科和外科)的研究而设计,仅用于教育研究,不可用于实际医疗诊断。数据集包含1000条由大语言模型生成的俄语患者主诉文本,划分为训练集(800条)、验证集(100条)和测试集(100条),各类别样本均衡各100条。数据来源于三个不同的合成生成协议,原始真实文本未包含。每条记录包含33个字段,如文本内容、目标标签等,并经过自动化质量控制。数据集在零样本分类任务上表现较高,但存在合成文本与真实文本的差异、风格重复、标签泄露等限制,采用other许可。

Medical Specialty RU Synthetic 1000 is a Russian synthetic text classification dataset for medical specialty routing tasks, designed to study how to accurately assign patient complaint texts to specific medical specialties (10 classes: Gastroenterology, Gynecology, Dermatology, Neurology, ENT, Dentistry, Internal Medicine, Traumatology, Urology, and Surgery) for educational research purposes only, not for actual medical diagnosis. The dataset contains 1000 Russian patient complaint texts generated entirely by large language models, divided into a training set (800 samples), validation set (100 samples), and test set (100 samples), with balanced samples of 100 per class. It originates from three different synthetic generation protocols, and original real patient texts are not included. Each record includes 33 fields, such as text content and target labels, and has undergone automated quality control. The dataset shows higher performance in zero-shot classification tasks but has limitations including differences from real text, style repetition, and label leakage, and is licensed under other.

创建时间:
2026-07-19
原始信息汇总

Medical Specialty RU Synthetic 1000

概述

此数据集包含 1,000 条合成的俄语医疗主诉文本,用于研究将患者主诉路由至 10 种医疗专科的分类任务。该数据集为教学/研究用途,不可用于临床诊断或治疗决策。

数据集规模与划分

  • 总记录数:1,000 条
  • 训练集:800 条
  • 验证集:100 条
  • 测试集:100 条

类别与标签

数据集包含 10 个专科类别,每个类别 100 条记录:

["Гастроэнтеролог", "Гинеколог", "Дерматолог", "Невролог", "Отоларинголог", "Стоматолог", "Терапевт", "Травматолог", "Уролог", "Хирург"]

标签语义说明:label 字段等于 target_label,表示合成生成时指定的目标专科,并非分类器预测结果,也非经专家验证的医学标注。所有记录的 label_origin 均为 "synthetic_generation_target"label_human_verified 均为 false

数据来源

  • hybrid_task11:400 条
  • self_instruct_task8:300 条
  • confidence_task10:300 条 所有记录均为合成数据(is_synthetic=true),原始论坛文本未公开发布。

数据字段(完整 Schema)

id, text, label, target_label, label_origin, label_human_verified, source, style, language, length_chars, length_tokens, semantic_concepts, semantic_concept_count, semantic_margin, style_validation_status, quality_validation_status, quality_validation_reasons, quality_validator_version, generation_source_protocol, generation_protocol, generation_model, generation_service, annotation_model, annotation_service, llm_label, confidence, votes, tie, simulated_human_label, hybrid_label, annotation_output_label, annotation_method, is_synthetic, created_at

生成与标注

  • 生成模型Qwen/Qwen2.5-3B-Instruct
  • 标注模型Qwen/Qwen2.5-3B-Instruct
  • 生成/标注服务local_transformers
  • 生成日期:2026-07-21,全局 seed=42
  • 生成过程使用严格 JSON 包格式,本地解码;标注采用 zero-shot/few-shot 模式,confidence 为 5 次独立调用中的多数一致比例
  • 混合标注策略:当 confidence 高于阈值时采用 LLM 结果,否则采用模拟的 95% 精度人工标注器结果

质量控制

每条记录均通过 russian_style_concept_qa_v5 验证器,检查内容包括:

  • 所有字母属俄语西里尔字母
  • 至少包含两个独立临床概念组及目标专科的特定锚点
  • 语义边际(semantic margin)不低于 1
  • 额外检查:语法 red flags、元文本、句子重复、词汇多样性、完整性、PII、标签泄露及风格符合性 未通过验证的记录自动重新生成直至满足配额。

多样性评估

合成数据的多样性低于真实数据:

  • distinct-3:0.9014(合成) vs 0.9687(真实)
  • 平均类内 NN char-5gram Jaccard:0.137(合成) vs 0.072(真实)
  • 在 100% 的合成文本中目标类别标记显式出现,而真实文本中仅为 60.7%

许可

许可证标注为 other,商业使用前需检查所使用模型、OpenRouter 提供商及当地法律要求。

示例数据

json { "id": "task8_0001", "text": "Здравствуйте. Около недели тошнит и хотелось часто в туалет. Голодал, а аппетита никакого. Частенько чувствовался холод, хотя обычно жара. Давно так не было.", "label": "Гастроэнтеролог", "source": "self_instruct_task8" }

加载方式

python from datasets import load_dataset dataset = load_dataset("aurelianvolturi/medical-specialty-ru-synthetic-1000")

搜集汇总
数据集介绍
medical-specialty-ru-synthetic-1000 数据集图片
构建方式
该数据集通过全合成的方式构建,旨在模拟俄语患者主诉文本,用于研究医疗专科分诊的自动化路由。生成过程依赖 Qwen2.5-3B-Instruct 模型,基于三种协议:self_instruct_task8、confidence_task10 与 hybrid_task11,分别贡献 300、300 与 400 条样本,总计 1,000 条。每条文本在生成时被赋予一个目标专科标签(共 10 类),并经过严格的 JSON 格式验证与风格标识检验。重复样本通过 MinHashLSH 候选筛选和精确 Jaccard 相似度(≥0.72)双重去重。每一行均标记为合成数据,并附有完整的生成与标注协议元信息。
使用方法
该数据集适用于训练和评估俄语医疗专科分类模型。用户可通过 Hugging Face Datasets 库直接加载:load_dataset('aurelianvolturi/medical-specialty-ru-synthetic-1000')。数据已划分为训练集(800 条)、验证集(100 条)与测试集(100 条)。label 字段代表生成时预设的目标专科,可用作监督学习中的伪标签。由于合成数据在词汇显式性上高于真实主诉,建议用户在部署前使用真实数据进行额外验证,并参考质量目录中的多样性与阈值实验报告以评估模型鲁棒性。
背景与挑战
背景概述
在自然语言处理与智能医疗交汇的研究前沿,患者主诉文本的自动专科分诊是一项极具应用价值的任务。2026年7月,由aurelianvolturi主导构建的Medical Specialty RU Synthetic 1000数据集应运而生,旨在为俄语医疗文本的专科路由提供标准化基准。该数据集包含1000条合成生成的俄语患者主诉,涵盖胃肠病学、妇科、皮肤科等10个高频专科类别,源自blinoff/medical_qa_ru_data真实语料框架下的三种合成策略。作为纯教育型资源,它规避了真实患者数据的隐私与许可困境,为低资源场景下的多类别文本分类研究提供了可控、可复现的实验平台,推动了生成式语言模型在医疗文本理解与路由决策中的方法学探索。
当前挑战
该数据集所应对的核心挑战在于,真实患者主诉的专科判别天然受制于文本隐私保护、标注成本高昂以及类别分布长尾等问题。构建过程中,合成数据虽规避了伦理风险,却引入了显著的语言单一性——Self-Instruct模板覆盖率高,平均腔内5-gram Jaccard相似度达0.137,远超真实文本的0.072,且目标专科锚词在100%的合成文本中显式出现,造成zero-shot精度(0.7400)对真实场景(0.4400)严重高估。此外,合成数据可能遗漏罕见病例、固化教师模型偏见、诱发模型崩溃风险,而置信度评估仅基于投票一致性而非校准概率,需借助95%精度的程序化模拟进行混合决策,这些共同构成了从合成训练向真实部署迁移时的根本性壁垒。
常用场景
经典使用场景
在俄语医疗文本分析领域,Medical Specialty RU Synthetic 1000数据集的核心应用场景为多类别文本分类任务,具体表现为对患者主诉文本进行专科分流。该数据集包含1000条由大型语言模型生成的俄语模拟主诉,覆盖胃肠病学、妇科、皮肤科、神经科等10个常见医学专科。研究者利用该数据集训练和评估分类模型,以学习从自由文本描述到指定专科类别的映射关系,这是医患交互系统前端智能分诊的基础性环节。
解决学术问题
该数据集的构建旨在解决医疗自然语言处理中的两个关键学术难题:其一,俄语医疗资源的稀缺性导致高质量带标注数据难以获取,该合成数据集通过可控生成策略提供了对齐的标签空间;其二,针对真实患者主诉中标签泄露与语义模糊性问题,该数据集通过严格的质量控制和语义验证流程,确保每条文本与指定专科之间存在明确的语义关联,从而为研究分类模型在噪声标签下的鲁棒性提供了理想的实验基准。
实际应用
在实际应用中,该数据集可支撑构建面向俄语患者的智能预检分诊系统。例如,在在线问诊平台或医院导诊场景中,系统能根据患者输入的自由文本主诉,自动推荐相应的就诊专科,减少人工分诊的人力开销并提升服务效率。此外,该数据集还可作为俄语医疗对话系统的辅助微调数据,帮助模型学习不同专科领域的关键症状表达,或作为基准测试集评估商业或开源模型的俄语医疗理解能力。
数据集最近研究
最新研究方向
该数据集聚焦于俄语医疗文本的合成生成与专科分诊任务,通过大语言模型(如Qwen2.5-3B-Instruct)构建1000条模拟患者主诉,覆盖胃肠科、妇科等10个高频专科。研究前沿体现在三个方面:一是采用混合生成策略(Hybrid Task 11、Self-Instruct Task 8等)提升数据多样性,并引入MinHashLSH与Jaccard去重确保质量;二是设计多层级质量控制流水线,包括语法校验、语义边界检查与标签泄漏检测,并对比合成数据与真实论坛文本的词汇复杂度与模式差异;三是探索LLM与模拟人工标注的置信度阈值融合(如T=1.00时准确率达95.5%),揭示合成数据在医疗分诊中的局限——零样本准确率虽高于真实数据(74% vs 44%),但存在标签显式泄漏与风格同质化问题,为低资源语言医学NLP研究提供了可复现的基准与风险警示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务