登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
chosummingcuhk/enwiki-2026-05-01-text
chosummingcuhk/enwiki-2026-05-01-text
收藏
Hugging Face
2026-05-21 更新
2026-05-31 收录
维基百科语料
文本数据
数据链接:
https://hf-mirror.com/datasets/chosummingcuhk/enwiki-2026-05-01-text
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cc-by-sa-4.0 ---
应用场景:
提供机构:
chosummingcuhk
相关数据集
IMSDb Movie Scripts
电影剧本
文本数据
1282 Movie Scripts scraped from IMSDb
kaggle
2024-12-04 更新
50
0
KaiNylund/arxiv-year-splits
学术论文
文本数据
--- dataset_info: features: - name: text dtype: string splits: - name: 2006_2008_train num_bytes: 100484371 num_examples: 120937 - name: 2006_2008_test num_bytes: 10050474
Hugging Face
2023-12-04 更新
17
0
skymizer/fineweb-edu-dedup-45B-4-of-4
文本数据
教育研究
该数据集包含文本内容、唯一标识符和元数据等信息。文本内容是数据集的主要部分,每个文本都有一个唯一标识符。元数据提供了关于文本的额外信息,如来源URL、创建日期、文件路径、文本语言及其评分、token数量、分数和整型分数。数据集分为训练集,其大小为55.93GB,共有约1084.21万个示例。数据集的下载大小为32.43GB。
Hugging Face
2025-01-11 更新
12
0
FalconX80/bhoomillama-5.5k
文本数据
该数据集包含5500个样本,每个样本包含Prompt、Answer和text三个字段,数据类型均为字符串。数据集分为一个训练集,大小为2206576字节。
Hugging Face
2024-07-08 更新
18
0
VALUABLY-net/iab-taxonomy-multilang-content
广告分类
文本数据
这个数据集包含用于IAB(互动广告局)分类的多语言文本数据。数据文件(train.csv,val.csv)是通过处理、清洗和重构来自Kaggle上原始发布的IAB-Taxonomy URL Content Dataset生成的。伴随的处理脚本和JSON映射文件提供了数据准备和模型训练工作流程的支持。数据集使用IAB第二层类别(共392个标签)进行多类分类。
Hugging Face
2025-11-02 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广