traditional-chinese
收藏资源简介:
本数据集是一个专注于台湾繁体中文的大规模文本语料库,旨在填补台湾繁体中文高质量开放数据集的空白。它包含三个配置版本:1) raw配置:从多个公开语料库收集原始文本,经过过滤仅保留繁体中文,并应用了基本的个人可识别信息匿名化处理;2) taiwan-style配置:通过对raw配置应用自定义分类器构建,以检测符合台湾风格的短语、习语和词汇;3) taiwan-style-quality配置:通过对taiwan-style配置使用文本质量分类器过滤,仅保留质量分数大于0的文本。数据集适用于文本生成和特征提取等任务,但存在一些限制,如地域来源不纯、时代偏误、内容安全性过滤有限等。数据集根据开放数据共享署名许可(ODC-BY)分发。
This dataset is a large-scale text corpus focused on Traditional Chinese from Taiwan, aiming to fill the gap in high-quality open datasets for Taiwanese Traditional Chinese. It includes three configurations: 1) raw configuration: collects raw text from multiple public corpora, filtered to retain only Traditional Chinese with basic Personally Identifiable Information (PII) anonymization applied; 2) taiwan-style configuration: built by applying a custom classifier to the raw configuration to detect phrases, idioms, and vocabulary that align with Taiwanese style; 3) taiwan-style-quality configuration: constructed by filtering the taiwan-style configuration using a text quality classifier, retaining only texts with a quality score greater than 0. The dataset is suitable for tasks such as text generation and feature extraction but has limitations, including impure regional sources, temporal bias, limited content safety filtering, etc. It is distributed under the Open Data Commons Attribution License (ODC-BY).
数据集概述
该数据集是一个面向台湾繁体中文的大规模文本语料库,旨在弥补高质量、宽松许可的台湾繁体中文数据集稀缺的现状。数据集包含三个配置版本,分别对应不同的过滤和优化程度。
- 数据集名称: traditional-chinese
- 语言: 中文 (zh)
- 任务类别: 文本生成 (text-generation),特征提取 (feature-extraction)
- 标签: 繁体中文 (traditional-chinese),台湾 (taiwan),普通话 (mandarin)
- 许可协议: ODC-BY (Open Data Commons Attribution License)
数据集结构与配置
数据集提供三个子配置,从原始数据到高质量优化数据:
-
raw(原始配置)- 规模: 每个来源数据集在过滤前包含最多 1,000,000 行。
- 处理方式: 仅保留繁体中文文本,移除包含简体中文专有字符的行;明确排除了粤语和有明显中国大陆来源特征的文本;进行了基本的个人身份信息(PII)遮蔽(URL、电子邮件、密码)。
- 数据来源: 从以下公开语料库收集:
statmt/cc100、uonlp/CulturaX、HuggingFaceFW/fineweb-2、HPLT/HPLT2.0_cleaned。
-
taiwan-style(台湾风格配置)- 处理方式: 基于
raw配置,通过自定义分类器筛选出符合台湾用语习惯(词汇、习语、表达方式)的文本。 - 参考依据: 台湾与大陆的词汇对应关系参考 OpenCC 包 定义。
- 处理方式: 基于
-
taiwan-style-quality(台湾风格-质量配置,默认)- 处理方式: 基于
taiwan-style配置,通过文本质量分类器进一步筛选。 - 技术细节: 质量评估模型基于 agentlans/bge-small-en-text-quality,并使用 agentlans/en-zhtw-google-translate 数据集适配繁体中文。
- 阈值: 仅保留质量评分大于 0 的文本行。
- 处理方式: 基于
限制与偏差
- 地理纯净度: 数据集并非100%纯粹,尽管经过严格过滤,仍可能包含少量来自香港或中国大陆的内容。
- 时间偏差: 文本可能过时,缺乏近期台湾的文化趋势、网络俚语或现代表达。
- 内容安全性:
raw和taiwan-style配置大多未经安全过滤,可能包含有毒、露骨或敏感内容;taiwan-style-quality配置虽有改善但无法完全消除。 - 匿名化不完整: 个人身份信息(PII)移除有限,除电子邮件和密码外,姓名、电话号码和地址可能依然存在。
- 格式一致性: 数字和标点符号未完全规范化,存在中英文符号混用的现象。
- 政治与意识形态偏差: 文本内容涵盖关于历史、两岸关系、地缘政治等方面的广泛政治观点,包括宣传内容。
许可信息
该数据集采用 Open Data Commons Attribution License (ODC-BY) 许可协议。使用时请注明来源。




