遇见数据集

turkish-medical-rag-chromadb

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集为土耳其语医学文章数据集,包含少于1000篇医学文章,可用于特征提取、问答、检索增强生成(RAG)等任务。数据集来源于医学文章,采用CC-BY-4.0许可证。原始数据集包含文章标题、正文等字段,经过预处理后形成chunk,每个chunk包含URL、文本内容、向量表示等字段。数据集适用于构建土耳其语医学领域的语义搜索和问答系统,但需注意其输出不能替代专业医疗诊断。

This dataset is a Turkish medical article dataset containing fewer than 1000 medical articles, suitable for tasks such as feature extraction, question answering, and retrieval-augmented generation (RAG). The dataset is derived from medical articles and is licensed under CC-BY-4.0. The original dataset includes fields such as article title and body text. After preprocessing, it forms chunks, each containing URL, text content, vector representation, and other fields. The dataset is intended for building semantic search and question-answering systems in the Turkish medical domain, but it should be noted that its output cannot replace professional medical diagnosis.

创建时间:
2026-08-11
原始信息汇总

数据集详情:土耳其语医学RAG(含ChromaDB)

基本信息

  • 数据集名称:Turkish Medical RAG with ChromaDB
  • 语言:土耳其语(tr)
  • 许可证:CC-BY-4.0
  • 任务类型:特征提取、问答
  • 标签:RAG、ChromaDB、句子Transformer、医学、土耳其语
  • 数据规模:少于1000条样本(n<1K)
  • 配置:默认配置,包含train分割,数据文件为data/train.parquet

数据来源与构建

  • 本数据集从umutertugrul/turkish-medical-articles数据集中选取100篇土耳其语医学文章构建,使用固定随机种子(seed=42)选择。
  • 这是一个用于RAG(检索增强生成)搜索的小型项目,目的是展示检索结果并处理低置信度场景。
  • 重要声明:该系统不是医疗决策或诊断工具,所有结果必须由医疗专业人员验证。

数据处理与索引

  • 分块策略:采用段落感知的混合分块,短段落合并,长段落按tokenizer窗口切分。默认窗口256个token,重叠40个token。
  • 嵌入模型:默认使用magibu/embeddingmagibu-200m,向量维度768,输出经过L2归一化。
  • 向量存储:使用ChromaDB,采用余弦相似度空间(hnsw:space=cosine)。
  • 每条记录包含字段:urlchunk_textchunk_vector,以及chunk_idparent_id/article_idtitletoken_count等可追溯性字段。

性能与基准

  • 在100篇文章、379个分块上使用自然问题评估:
    • 阈值设为0.45时,20个正向问题中18个正确分块排名第一(top-1)。
    • 应用阈值后:17个真阳性、3个假阴性(召回率0.85)。
    • 10个负向问题全部被拒绝,无假阳性,精确率1.00。
  • 基准评估包含20个自然正向问题(覆盖症状、定义、风险、筛查、治疗等场景)和10个医学负向问题。
  • 低置信度时返回固定消息:“Bu sorunun cevabı dokümanlarımda yer almamaktadır”(此问题的答案不在我的文档中)。

使用说明

  • 需先访问原始数据集页面(umutertugrul/turkish-medical-articles)接受使用条款并获取访问权限,通过hf auth loginHF_TOKEN环境变量认证。
  • 提供preparebuildquerybenchmarkexportpush等命令行接口。
  • 支持使用--fake模式(确定性特征哈希编码器)无需下载模型即可运行流程,适合测试和CI环境。
搜集汇总
数据集介绍
turkish-medical-rag-chromadb 数据集图片
构建方式
该数据集旨在为土耳其语医学领域的检索增强生成(RAG)应用提供基准测试资源,其构建基于土耳其语医学论文语料库,通过种子固定选取了100篇代表性文章。构建流程包括文本预处理、段落感知的混合分块(结合短段落合并与长段落切分)、基于嵌入模型(如magibu/embeddingmagibu-200m)的向量化,以及利用ChromaDB进行持久化存储。嵌入向量经过L2归一化,并采用余弦相似度度量,最终生成包含详细元数据(如文章链接、分块文本、向量及计数信息)的Parquet或JSONL格式数据文件。
特点
该数据集的核心特色在于其高度的工程化与安全性设计。它内置了针对未授权访问的显式错误处理机制,避免静默失败。同时,提供了基准测试框架,包含20个正向和10个负向问题,用于校准置信度阈值(默认0.45),确保在无法回答时返回预设的越界消息,而非生成误导性内容。此外,数据集支持使用伪嵌入进行离线测试,便于持续集成,且所有分块均携带可追溯的父级文章标识,增强可解释性。
使用方法
使用该数据集涉及三个主要阶段:准备(prepare)、构建(build)和查询(query)。用户需先通过Hugging Face认证获取gated数据集访问权限,然后通过命令行接口依次执行分块生成、嵌入计算与Chroma索引构建。查询时提供自然语言问题,系统返回Top-K相关分块及置信度分数,并依据阈值决定是否输出预设的拒绝消息。此外,工具支持导出向量化数据用于进一步分析,并通过benchmark模式评估系统性能,所有操作均需遵循安全规范,避免硬编码凭证。
背景与挑战
背景概述
随着医疗信息数字化进程的加速,非英语地区医学知识库的检索增强生成(RAG)技术成为研究热点。该数据集由umutertugrul等人于近期创建,源自'umutertugrul/turkish-medical-articles',精选100篇土耳其语医学文章,旨在构建一个可验证的RAG系统,用于直接回答源自源文本的医学查询,并拒绝回答超出知识范围的问题。其核心研究问题在于如何通过嵌入模型与向量数据库,在低资源语言环境下实现精准的语义检索。该数据集为土耳其语医学NLP提供了基准资源,推动了多语言RAG系统在医疗领域的应用,尤其在低资源语言的检索准确性和安全边界控制方面具有示范意义。
当前挑战
该数据集面临的挑战包括:领域层面,土耳其语医学文档专业性强、术语复杂,通用嵌入模型难以捕捉语义,需定制模型,且医疗场景对答案准确性要求极高,错误或越界回答可能引发风险,因此系统需在低置信度时安全拒答,平衡召回率与精确率。构建过程中,数据集访问受Hugging Face门控限制,需用户授权;同时,文本分块需适应段落和长度变化,混合分块策略影响检索效果;此外,构建时需确保基准测试中所有正负问题均严格对应源内容,防止幻觉,并在网络、权限受限时使用模拟编码器保证流程可用性,这些均构成实际构建中的技术难点。
常用场景
经典使用场景
该数据集面向土耳其语医学文献的检索增强生成(RAG)任务,旨在构建一个低资源语言下的医学问答系统。其核心使用场景是通过混合分块策略(短段落合并、长段落按Token窗口切分)处理医学文献,结合嵌入模型(如magibu/embeddingmagibu-200m)将文本映射至向量空间,并利用ChromaDB进行相似性检索。研究者可借此探索RAG在专业领域中的分块优化、嵌入模型选择及阈值校准等关键问题,为土耳其语医学信息抽取提供基准框架。
实际应用
在实际应用中,该数据集可支撑土耳其语医学文献的智能问答服务,帮助医疗从业者或公众快速获取文献中的关键信息(如症状、定义、风险、筛查和治疗方法)。其安全设计(低置信度返回固定拒绝消息)避免了超出文档范围的生成,确保回答可靠性。同时,支持向量导出与Hugging Face数据集推送,便于构建持续更新的医学知识库系统,在临床辅助决策或健康咨询场景中发挥实用价值。
衍生相关工作
基于该数据集的研究催生了一系列衍生工作,包括针对低资源语言医学RAG的分块策略与嵌入模型适配研究,以及面向医疗领域RAG的阈值校准与安全性评估方法。此外,数据集的基准测试流程启发了跨语言RAG评测框架的发展,促进了多语言医学问答系统的可复现性实践。其开源的实现(如混合分块、向量导出)为后续研究者提供了可借鉴的工具链,推动了RAG在专业医疗领域的应用深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务