登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
train_thai_text
train_thai_text
收藏
kaggle
2025-10-13 更新
2025-10-25 收录
泰语处理
文本预训练
数据链接:
https://www.kaggle.com/datasets/nonyxd/train-thai-text
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
i hope that we dont need to find new dataset
我希望我们无需寻找新的数据集(dataset)
应用场景:
创建时间:
2025-10-05
相关数据集
Thai-understanding
泰语处理
语音理解
Thai-Understanding是一个开源项目,提供了泰语语音理解的解决方案,包括Thai-SUP数据集和XLSR-Thai语音编码器。Thai-SUP是首个开源的泰语语音理解数据集,包含超过1000小时的数据,涵盖意图分类、命名实体识别和语音改写三个任务。XLSR-Thai是基于大规模泰语语音数据预训练的自监督学习语音编码器,能够有效捕捉泰语的语言结构和副语言线索,适用于多任务语音理解。
Hugging Face
2025-09-18 更新
52
0
nakhun/thaisum
文本摘要
泰语处理
ThaiSum是一个用于泰语文本摘要的大规模数据集,包含超过35万篇文章和摘要对。数据集来源于多个在线新闻网站,如Thairath、ThaiPBS、Prachathai和The Standard。数据集的结构包括文章标题、正文、摘要、类型、标签和URL。数据集分为训练集、验证集和测试集,分别包含358,868、11,000和11,000个样本。数据集的创建目的是为了填补泰语文本摘要领域大规模数据集
Hugging Face
2024-01-18 更新
18
0
iapp/openthaieval
泰语处理
语言模型评估
OpenThaiEval是一个全面的泰语语言评价基准数据集,包含1232个问题,跨越17种不同类型的考试,旨在评估语言模型在理解泰语和推理方面的能力。
Hugging Face
2025-09-16 更新
14
0
BAAI-WuDaoCorporaText文本预训练数据集
文本预训练
大模型
WuDaoCorpora是北京智源人工智能研究院(智源研究院)构建的大规模、高质量数据集,用于支撑大模型训练研究
智源
2023-10-18 更新
22
0
vietgpt-archive/CC-MAIN-2020-10
语言语料库
文本预训练
--- dataset_info: features: - name: raw_text dtype: string - name: meta struct: - name: subfile dtype: string - name: url dtype: string splits: - name: train
Hugging Face
2023-07-19 更新
16
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广