遇见数据集

tibbi-makaleler-rag-veritabani

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集是土耳其语医学文章的RAG(检索增强生成)数据集,包含预处理后的文本数据以及预构建的向量数据库。数据来源于土耳其语医学文章,经过清洗、字段裁剪(保留url、title、text)、智能文本分块(递归字符分块,块大小1500字符,重叠300字符)和向量化(使用magibu/embeddingmagibu-200m模型生成768维嵌入向量)。数据集规模在1000到10000条样本之间,以Parquet格式存储,可通过Hugging Face Datasets库加载。此外,还提供了预构建的ChromaDB向量数据库(HNSW索引,支持余弦和L2距离),以及包含文本块和对应向量坐标的Parquet/CSV文件。该数据集专为土耳其语医学领域的语义搜索、问答系统和RAG应用设计,可直接用于检索增强生成流水线,无需额外计算嵌入。

This dataset is a RAG (Retrieval-Augmented Generation) dataset for Turkish medical articles, containing preprocessed textual data and pre-built vector database. The data originates from Turkish medical articles, undergoing cleaning, field trimming (retaining url, title, text), intelligent text chunking (recursive character chunking, chunk size 1500 characters, overlap 300 characters), and vectorization (using magibu/embeddingmagibu-200m model to generate 768-dimensional embedding vectors). The dataset size ranges from 1000 to 10000 samples, stored in Parquet format, and can be loaded via Hugging Face Datasets library. Additionally, it provides a pre-built ChromaDB vector database (HNSW index, supporting cosine and L2 distances), as well as Parquet/CSV files containing text chunks and corresponding vector coordinates. This dataset is specifically designed for semantic search, question answering systems, and RAG applications in the Turkish medical domain, allowing direct use in retrieval-augmented generation pipelines without additional embedding computation.

创建时间:
2026-08-11
原始信息汇总

土耳其语医学文章RAG数据集与预构建向量数据库

项目概述

该数据集是Magibu应用人工智能架构培训框架下开发的一个端到端数据工程项目,旨在将土耳其语医学文章完全适配于RAG(检索增强生成)架构和向量空间搜索。核心目标不仅是存储原始医学文本,还包括将文本进行语义分块、转换为768维向量坐标,并提供可供毫秒级搜索的预构建ChromaDB向量数据库

技术架构与处理流程

系统架构包含5个主要步骤:

  1. 原始数据集
  2. 清洗与列裁剪(仅保留url、title、text列)
  3. 智能文本分块(基于字符的递归切分)
  4. 向量转换(使用magibu/embeddingmagibu-200m模型,768维)
  5. 向量数据库索引(ChromaDB HNSW / L2距离)

关键技术细节

技术组件 具体实现
嵌入模型 magibu/embeddingmagibu-200m(768维语义空间)
文本分块 使用LangChain RecursiveCharacterTextSplitter,块大小1500字符,重叠300字符,保留段落、句子和单词边界以保障语义完整性
向量数据库 ChromaDB(PersistentClient模式,SQLite/HNSW索引)
搜索算法 近似最近邻(ANN)/ 余弦与L2距离
数据存储格式 Parquet(列式存储,高压缩与快速I/O),使用train分割结构的DatasetDict
阈值设定 距离阈值设为1,当最近邻距离超过1时系统发出警告;若前5个结果中部分低于阈值,仅返回低于1的结果

相关GitHub链接

仓库内容与文件结构

该数据仓库提供3种主要格式以满足不同使用场景:

文件/结构 格式 描述
data/(HF数据集) .parquet 可通过datasets.load_dataset()直接加载的干净、裁剪后的原始数据集(含train分割)
vektor_veritabanim.zip .zip 包含预计算的768维向量的预构建ChromaDB数据库文件夹
tibbi_makaleler_vektorlu .parquet / .csv 文本块(chunks)及其对应的768维向量坐标列表

向量数据库与ANN的优势

传统数据库执行单词匹配(类似CTRL+F),而此仓库中的向量数据库衡量语义相似性。例如,搜索"Kanser"时,即使句子中不包含该词,也能通过向量空间中的距离相似性立即找到包含"tümör"(肿瘤)或"onkoolojik tedavi"(肿瘤治疗)的句子。暴力搜索的每次查询复杂度为O(N),而通过ChromaDB的ANN索引,即使在1000万文档中搜索时间也能保持在毫秒级别。

可复现性

为保证数据选择和抽样过程中伪随机生成器的稳定性,使用了seed=42参数。即使在不同环境中重新运行,也能获得完全相同的样本和向量排列。

数据集元数据

  • 许可证:Apache-2.0
  • 语言:土耳其语(tr)
  • 规模:1K < n < 10K
  • 标签:RAG、向量数据库、嵌入、医学、sentence-transformers、Parquet格式
搜集汇总
数据集介绍
tibbi-makaleler-rag-veritabani 数据集图片
构建方式
该数据集源于一个针对土耳其语医学文献的检索增强生成(RAG)架构的端到端数据工程项目。原始医学文本经过清洗与列裁剪,仅保留URL、标题与正文,随后采用LangChain的递归字符文本分割器进行智能分块,设定块大小为1500字符、重叠300字符,以保留语义完整性。之后,利用magibu/embeddingmagibu-200m模型将文本块转换为768维向量,并存入ChromaDB持久化向量数据库,采用HNSW索引和L2距离度量,以支持近似最近邻搜索。数据以Parquet格式存储,并提供预计算的向量数据库压缩包,便于直接使用。整个过程设定了随机种子以确保可复现性。
特点
该数据集的核心特征在于其双重形态:既包含清洗后的原始文本数据,又包含可直接用于RAG的向量数据库。其分块策略充分考虑了医学文本中的人名、分期等专业表述,通过字符级智能分割保障了语义连贯性。向量化过程采用专门的医学嵌入模型,生成768维高精度表示,而ChromaDB的ANN索引确保了在海量文档中的毫秒级检索速度。此外,数据集内置了阈值机制,当检索距离超过设定值时系统会发出警告,提高了检索结果的可靠性。其标准化的Hugging Face格式和预构建的向量目录,为开发者提供了即插即用的便利性。
使用方法
使用该数据集时,开发者可通过Hugging Face的datasets库加载原始文本数据,进行经典的自然语言处理任务。若需实现RAG系统,则可直接下载并解压预构建的ChromaDB向量数据库,利用chromadb.PersistentClient加载集合,进行语义向量检索。检索时支持余弦相似度或L2距离度量,并按阈值筛选最优结果。此外,数据集中还包含了带向量的Parquet/CSV文件,便于用户自定义索引或进行模型训练。所有代码均在GitHub上开源,提供了从构建到使用的完整示例,确保用户能快速集成到问答系统、医学文献分析等应用场景中。
背景与挑战
背景概述
该数据集名为“tibbi-makaleler-rag-veritabani”,是由Magibu应用人工智能架构培训项目的研究人员于近期创建的,旨在为土耳其语医学文献构建一个端到端的检索增强生成(RAG)数据工程解决方案。该数据集的核心研究问题是如何将非结构化的医学文本高效地转化为语义向量,并集成到可快速检索的向量数据库中,以支持基于上下文的智能问答系统。通过采用768维的嵌入模型(magibu/embeddingmagibu-200m)和递归字符分割策略,该数据集为土耳其语医学信息检索领域提供了标准化的数据基础,对RAG架构在低资源语言中的应用具有重要的推动意义。其预构建的ChromaDB向量数据库和预处理流水线,显著降低了医疗AI系统开发的门槛,促进了土耳其语医学自然语言处理的研究与实践。
当前挑战
该数据集面临多重挑战。在领域问题层面,传统关键词检索无法捕捉医学文本中的语义关联,如‘tümör’与‘onkoolojik tedavi’的关联,限制了检索系统的准确性和召回率。为此,该数据集采用ANN索引和语义嵌入,克服了这一瓶颈。在构建过程中,土耳其语医学文本的复杂结构(如缩写、专业术语和子项目繁多)使得简单的分句或分段方法失效,研究者最终采用基于字符的递归分割,并设置1500字符的chunk_size和300字符的overlap,以确保语义完整性。此外,数据清洗需去除无关列,仅保留url、title和text,同时处理文本中的噪声和冗余信息。构建高效的向量索引并保证查询时间在毫秒级,也是一大技术难点。最后,可重复性要求在所有环境下严格保持随机种子一致性,这些挑战凸显了医疗RAG系统构建的复杂性和专业性。
常用场景
经典使用场景
该数据集专为土耳其语医学文献的检索增强生成(RAG)架构而设计,提供了从预处理文本到768维向量嵌入及预构建ChromaDB向量数据库的完整数据管道。经典使用场景聚焦于医学领域的语义搜索与知识问答系统,研究者可利用该数据集构建基于语义相似度的文献检索模块,实现超越关键词匹配的深层理解。例如,用户查询“kanser”(癌症)时,系统能依据向量空间距离自动检索出包含“tümör”(肿瘤)或“onkoolojik tedavi”(肿瘤治疗)的文本片段,显著提升医学信息检索的精准度与召回率。数据集的分块策略( chunk_size=1500, overlap=300)保证了医学文本中专业术语和上下文连贯性的保留,使其成为评估和优化土耳其语医学RAG系统性能的理想基准。
衍生相关工作
该数据集催生了多项相关研究工作,包括基于土耳其语医学领域的RAG模型优化、嵌入模型微调及其评估基准的建立。研究者可借鉴其数据处理流程,探索不同分块策略(如动态分块或基于语义的分块)对检索质量的影响,并扩展至其他低资源语言的医学文本。数据集中使用的ChromaDB与HNSW索引架构,也为大规模向量检索系统的性能优化提供了参考案例。此外,该数据集可作为测试床,用于评估生成模型(如GPT、LLaMA)在土耳其语医学知识增强生成中的事实准确性和连贯性,推动可信医学AI助手的发展。其开源特性鼓励后续工作添加新数据、改进向量表示,并开发针对特定医学子领域的专用检索模块。
数据集最近研究
最新研究方向
在当前生物医学信息检索与自然语言处理领域,该数据集将土耳其语医学文献的检索增强生成(RAG)框架推向实用化发展。通过将文本内容分割为语义完整的块,并应用高达768维的嵌入式表示,结合ChromaDB向量数据库的近似最近邻搜索,实现了对医学概念(如肿瘤或癌症)的语义级匹配,超越了传统关键词匹配的局限。这一研究路径不仅为医学知识图谱的构建提供了高效的数据基础设施,也为临床决策支持系统的实时响应、医疗问答机器人的智能化提升奠定了技术基石。其开放许可与标准化格式亦促进了多语言医疗AI的协同创新,具有推动个性化医疗和循证实践的深远潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务