登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Nom-Vietnamese
Nom-Vietnamese
收藏
kaggle
2025-09-18 更新
2025-10-25 收录
越南语研究
自然语言处理
数据链接:
https://www.kaggle.com/datasets/duyu09/nom-vietnamese
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Kho Ngữ Liệu Song Song Chữ Nôm - Chữ Quốc Ngữ / 喃字-國語字平行語料庫
喃字(Chữ Nôm)-国语字(Chữ Quốc Ngữ)平行语料库
应用场景:
创建时间:
2025-09-16
相关数据集
hlillemark/c4_t5_pretrain
机器学习预训练
自然语言处理
--- dataset_info: features: - name: input_ids sequence: int32 - name: labels sequence: int64 splits: - name: validation num_bytes: 53400000 num_examples: 10000 - name: trai
Hugging Face
2023-05-22 更新
8
0
cassanof/Capybara-code
代码对话
自然语言处理
capybara数据集经过过滤,仅包含包含代码的对话(通过检测Markdown代码块的存在)。数据集的特征包括source和conversation,其中conversation是一个列表,包含input和output两个字段。数据集只有一个train分割,包含1314个示例,文件大小为7680536字节,下载大小为3402523字节。
Hugging Face
2024-01-12 更新
8
0
reyhanehrhp7/Jigsaw_partB_language_head
自然语言处理
机器学习
该数据集包含两个特征:提示(prompt)和完成(completion),均为字符串类型。数据集分为训练集、验证集和测试集三个部分,其中训练集包含1623个示例,验证集和测试集各包含203个示例。数据集的总大小为614308字节,下载大小为271617字节。
Hugging Face
2025-10-17 更新
6
0
bloyal/small-uniref30
自然语言处理
掩码填充
--- license: cc-by-4.0 dataset_info: features: - name: id dtype: int64 - name: num dtype: int64 - name: text dtype: string splits: - name: train num_bytes: 1067207.07039336
Hugging Face
2023-05-04 更新
8
0
freococo/myanmar-written-corpus
缅甸语
自然语言处理
缅甸书面语料库是一个包含高质量缅甸书面文本的全面集合,用于支持缅甸自然语言处理(NLP)的研究和开发。该语料库包含1000万句文本,采用Parquet格式,并遵循CC0 1.0许可协议。它适用于训练NLP模型、文本转语音、自动语音识别、机器翻译和文本生成等多种应用。
Hugging Face
2025-05-22 更新
7
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广