遇见数据集

RedditTurkey

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

Reddit数据集是一个土耳其语/英语指令-响应格式的结构化数据集,旨在为土耳其的大型语言模型生态系统做出贡献。该数据集通过自建的网络爬虫从Reddit公开评论中收集并整理而成。核心数据文件为133kReddit.jsonl,包含约133,333条记录,是从原始530,536条记录的完整数据集中,根据质量信号筛选出的高质量子集,其中土耳其语内容约占60%,英语内容约占40%。数据覆盖了特定的Subreddit社区:英语部分精选了20个高质量、低迷因内容的社区(如r/programming, r/Python, r/AskReddit);土耳其语部分则涵盖了超过140个社区(如r/Turkey, r/BiriyleKonus)。每条数据记录包含多个字段,如id(标识符)、instruction(指令)、output(响应/输出)、lang(语言)、is_duplicate(是否重复)、is_toxic(是否有毒)、toxicity_score(毒性分数)、quality_signal(质量信号)、topic_id(主题ID)和perspective_label(观点标签)。数据集已预先进行了毒性内容标记和重复数据过滤(迷你集中已移除重复项),但请注意,用户作者名未被匿名化处理。数据集适用于指令微调、对话生成、多语言语言模型训练等自然语言处理任务。数据以JSON Lines格式发布,并遵循Apache License 2.0许可证,使用时需同时遵守Reddit的公共内容政策和服务条款。

The Reddit dataset is a structured dataset in Turkish/English instruction-response format, designed to contribute to the Turkish large language model ecosystem. It is collected and organized from Reddit public comments using a self-built web crawler. The core data file is 133kReddit.jsonl, containing approximately 133,333 records, which is a high-quality subset filtered from the original full dataset of 530,536 records based on quality signals, with Turkish content accounting for about 60% and English content for about 40%. The data covers specific Subreddit communities: the English part includes 20 high-quality, low-noise communities (e.g., r/programming, r/Python, r/AskReddit), while the Turkish part covers over 140 communities (e.g., r/Turkey, r/BiriyleKonus). Each data record includes multiple fields, such as id (identifier), instruction, output, lang (language), is_duplicate, is_toxic, toxicity_score, quality_signal, topic_id, and perspective_label. The dataset has been pre-processed with toxic content labeling and duplicate data filtering (duplicates have been removed in the mini-set), but note that user author names are not anonymized. The dataset is suitable for natural language processing tasks such as instruction fine-tuning, dialogue generation, and multilingual language model training. The data is released in JSON Lines format under the Apache License 2.0, and use must comply with Reddits public content policy and terms of service.

创建时间:
2026-06-22
原始信息汇总

数据集概述:Reddit Turkey (Türkçe/İngilizce Talimat-Yanıt Veri Seti)

这是一个从 Reddit 评论中收集并构建的指令-回复(instruction–output)格式的数据集,旨在为土耳其的 LLM 生态系统提供支持。数据集使用自行开发的爬虫工具收集。

文件信息

  • 发布文件: 133kReddit.jsonl
  • 记录数量: 约 133,333 条
  • 语言分布: 60% 土耳其语(约 80,000 条)· 40% 英语(约 53,333 条)
  • 说明: 这是根据质量分数(quality_signal)筛选后的高质量子集;完整数据集(530,536 条记录)已不再发布。

数据统计与处理

  • 子集构建: 从各语言组中选取质量分数最高的样本,使用随机种子 seed=42 进行混合。
  • 过滤: 已进行毒性(toxicity)和重复(duplicate)过滤。

涵盖的 Subreddit

  • 英语: 仅包含 20 个高质量、低模因内容的 subreddit,例如 r/programming、r/Python、r/AskReddit、r/space、r/eu4 等,排除了模因/恶搞内容 subreddit。
  • 土耳其语: 涵盖 140 多个 subreddit,例如 r/Turkey、r/BiriyleKonus、r/LinuxTurkey、r/felsefe 等。

数据字段(摘要)

数据集包含以下字段:idinstructionoutputlangis_duplicateis_toxictoxicity_scorequality_signaltopic_idperspective_label 等。注意:用户名称(author)未进行匿名化处理。

使用方式

  • 直接读取 JSONL 文件:使用 Python 的 json 模块逐行加载。
  • 通过 Hugging Face datasets 库加载:使用 load_dataset 函数,指定数据文件为 133kReddit.jsonl,分割为 "train"

伦理与许可

  • 数据来源: 仅使用公开的 Reddit 数据。
  • 毒性内容: 已进行标注但未被完全移除,用户需自行应用额外过滤。
  • 重复记录: 已从迷你数据集中移除。
  • 许可证: 数据集基于 Apache License 2.0 许可。使用者还需遵守 Reddit 的 Public Content PolicyTerms of Service

目的

该数据集是更大集合的一个小子集,旨在为土耳其的 LLM 生态系统做出贡献,并以开放形式分享。

搜集汇总
数据集介绍
RedditTurkey 数据集图片
构建方式
RedditTurkey数据集依托自研的网络爬虫系统,从Reddit平台收集公开评论数据,并经过严格的结构化处理,整理为指令-输出(instruction–output)格式。在构建过程中,研究团队依据质量信号评分(quality_signal)对每个语言子集的样本进行筛选,从530,536条原始记录中提炼出约133,333条高质量子集,其中土耳其语占60%、英语占40%。数据来源涵盖140余个土耳其语子版块及20个精选英语子版块,过滤了低质与恶搞内容,并对毒性与重复数据进行标记与剔除,确保了语料库的纯净度与代表性。
特点
该数据集以双语均衡为显著特色,土耳其语占比六成、英语四成,专为支持土耳其语大语言模型生态建设而设计。数据字段丰富,包含指令与输出文本、语言标识、重复与毒性标记、质量分数、主题编号等完整元信息。子集构建强调质量优先,仅保留高评分样本,并排除了重复记录。值得注意的是,数据集未对用户昵称进行匿名化处理,且毒性内容虽被标记但未完全移除,保留了研究者在伦理使用上的审慎空间。
使用方法
数据集以JSONL格式存储,便于直接读取与处理。用户可通过Python的json库逐行加载133kReddit.jsonl文件,提取指令与输出字段进行微调或评估。更便捷的方式是采用Hugging Face的datasets库,通过load_dataset函数直接读取数据集,集成至主流训练流程。使用时需注意,毒性内容虽已打标但未彻底去除,建议下游任务中根据toxicity_score字段实施额外过滤;同时,重复条目已从子集中移除,但完整数据集不公开,用户可直接使用所提供的精选版本开展模型训练或效果评测。
背景与挑战
背景概述
RedditTurkey数据集由独立研究者Deniz Cap于近期创建,旨在通过从Reddit平台爬取的高质量对话数据,构建一个双语(土耳其语与英语)指令—响应格式的语料库,以促进土耳其本土大语言模型(LLM)生态系统的发展。该数据集包含约13.3万条经过质量筛选、毒性检测与去重处理的记录,其中土耳其语占60%、英语占40%,覆盖编程、哲学、日常生活等140余个土耳其语子版块及20个英语优质子版块。作为面向低资源语言领域的重要开源资源,该数据集为土耳其语自然语言处理研究提供了稀缺的指令微调样本,有望推动多语言LLM在土耳其语社区的适配与应用。
当前挑战
RedditTurkey数据集面临的核心挑战在于:1)领域问题层面,土耳其语作为低资源语言,缺乏大规模、高质量的指令-响应数据集,现有LLM对该语言的理解与生成能力显著弱于英语,亟需定向数据资源以缓解语言覆盖不均的问题;2)构建过程层面,从Reddit公开评论中自动提取并结构化指令-响应对存在噪声干扰,需设计复杂的质量信号筛选与去重算法;同时,毒性内容虽被标记但未完全剔除,用户需自行执行二次过滤;此外,用户名未经匿名化处理,可能引发隐私合规风险,且数据集仅包含约13万条记录,规模相对有限,可能不足以支撑深层次的语言泛化能力训练。
常用场景
经典使用场景
RedditTurkey数据集的核心价值在于其结构化的指令-响应格式,为土耳其语和英语双语环境下的语言模型微调提供了高质量的语料资源。研究人员常将其用于对话系统的监督微调,通过提取其中自然形成的问答对,训练模型理解并生成符合社交语境的自然回复。该数据集的过滤机制确保了低毒性、高语义质量的内容占比,使其特别适合构建面向土耳其本土用户的智能客服、教育辅导及内容审核等领域的对话代理。
解决学术问题
该数据集主要解决了低资源语言(尤其是土耳其语)在大规模指令微调领域的数据匮乏问题。在自然语言处理研究中,土耳其语的形态丰富性与句法独特性常导致通用模型表现欠佳,而该数据集通过高质量的Reddit语料填补了这一缺口。其跨语言混合设计也为探究多语言指令理解、跨文化语境建模以及毒性内容过滤等课题提供了实验基准,推动了非英语语言在预训练语言模型中的对齐与泛化能力研究。
衍生相关工作
该数据集的发布催生了一系列针对土耳其语的指令微调与对齐研究工作,例如利用其质量评分字段探索基于奖励模型的筛选策略,或将其与更大的多语言数据集结合以提升跨语言迁移效果。部分工作以此为基础构建了土耳其语的RLHF(基于人类反馈的强化学习)训练pipeline,并衍生出针对毒性内容检测的二分类任务基准。此外,其开源发布的Apache 2.0许可形式也为后续研究者提供了可复现的基线资源,推动了对低资源语言对话系统公平性与鲁棒性的深入探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务