登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Data statistics per language for sub-task 1: Genre detection.
Data statistics per language for sub-task 1: Genre detection.
收藏
Figshare
2024-05-03 更新
2026-04-28 收录
文本体裁检测
多语言文本
数据链接:
https://figshare.com/articles/dataset/Data_statistics_per_language_for_sub-task_1_Genre_detection_/25747257
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Data statistics per language for sub-task 1: Genre detection.
应用场景:
创建时间:
2024-05-03
相关数据集
Massive Image Embedding Benchmark (MIEB)
自然语言处理
多语言文本
MIEB是由Durham University等机构创建的大型图像嵌入基准数据集,包含38种语言的130个任务,分为8个高级类别。数据集内容涵盖了从聚类到视觉问答等多种任务,要求模型在图像和文本嵌入方面有广泛的能力。创建过程中,特别关注了需要强视觉理解文本的任务,如视觉STS和文档理解。MIEB的应用领域广泛,旨在推动自然融合的图像文本嵌入模型的发展。
arXiv
2025-04-15 更新
64
0
ryzzlestrizzle/multi-wiki-clustering-p2p
多语言文本
数据聚类
--- license: cc-by-4.0 configs: - config_name: bs data_files: - split: test path: bs/test.jsonl.gz - config_name: ca data_files: - split: test path: ca/test.jsonl.gz - config_name: cs
Hugging Face
2024-04-22 更新
11
0
Ba2han/test-dataset-tokenized
多语言文本
自然语言处理
这是一个由个人抓取的私人数据和公开可用数据混合而成的高质量数据集,大小约为600M tokens,包含严格少于600个tokens的土耳其语和英语。在使用该数据集进行训练时,请标明引用。
Hugging Face
2025-07-16 更新
9
0
zenless-lab/alt
机器翻译
多语言文本
该数据集是一个包含英语和日语文本对的多语言数据集,适用于训练机器翻译模型。数据集包含多个配置版本,每个版本都有唯一的标识符、英语文本和日语文本,并且分为训练集和测试集。
Hugging Face
2024-12-20 更新
15
0
MultilingualUnigramLM/FineWeb2-10K
多语言文本
自然语言处理
--- configs: - config_name: afr_Latn data_files: - split: train path: data/afr_Latn-*.parquet - config_name: als_Latn data_files: - split: train path: data/als_Latn-*.parquet - config_
Hugging Face
2026-01-18 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广