登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
August4293/hello_world
August4293/hello_world
收藏
Hugging Face
2024-12-16 更新
2024-12-21 收录
文本处理
多语言数据
数据链接:
https://hf-mirror.com/datasets/August4293/hello_world
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
这是一个包含多种语言文本的示例数据集。
This is an example dataset with text in multiple languages.
应用场景:
提供机构:
August4293
相关数据集
doushabao4766/ontonotes_zh_ner
文本处理
实体识别
--- dataset_info: features: - name: id dtype: int64 - name: tokens sequence: string - name: ner_tags sequence: int64 splits: - name: train num_bytes: 7629700 num_exampl
Hugging Face
2023-05-26 更新
34
0
EleutherAI/filtering-annealing-mix_20250226-011545
文本处理
自然语言处理
这是一个包含文本数据的训练集,每个样本包括id、文本内容、来源、元数据、token数量、是否为目标过滤、单词过滤、单词过滤元数据、BERT过滤、BERT过滤元数据、组合过滤等字段。训练集大小为389,019,625,333字节,共有88,961,637个样本。数据集支持默认配置,可通过指定的路径访问训练数据。
Hugging Face
2025-03-02 更新
19
0
dgambettaphd/D_gen0_run0_llama2-7b_wiki_doc1000_real96_synt32
文本处理
机器学习
该数据集包含1000个训练样本,每个样本包含一个唯一的标识符(id)和一个文档内容(doc)。数据集总大小为642705字节,下载大小为410378字节。数据文件存储在指定路径下,适用于训练目的。
Hugging Face
2024-11-23 更新
12
0
chenghao/NEWS-COPY-train
文本处理
去重
该数据集包含NEWS COPY数据集的训练集,原始来源可以在Github上找到。数据集包含历史报纸数据。评估数据集可以在chenghao/NEWS-COPY-eval找到。
Hugging Face
2024-03-18 更新
19
0
prli/freelaw-full_pyt_llama_alpha_0-1_2_perturb
文本处理
自然语言处理
该数据集包含了经过不同文本处理方式处理的文本数据,用于验证模型对于文本变化的鲁棒性。具体包括文本内容以及通过同义词替换、引入打字错误、随机删除字符、改变字符大小写、添加空格干扰和采用下划线技巧等方式生成的文本。数据集划分为验证集,共有4000个示例。
Hugging Face
2025-10-20 更新
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广