登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
OpenWebText Dataset (TFRecords)
OpenWebText Dataset (TFRecords)
收藏
kaggle
2025-01-29 更新
2025-03-29 收录
自然语言处理
文本数据集
数据链接:
https://www.kaggle.com/datasets/skywolfmo/openwebtext-tfrecords
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Openwebtext tokenized with tiktoken gpt2
经tiktoken GPT-2标记化处理的OpenWebText(openwebtext)数据集
应用场景:
创建时间:
2025-01-29
相关数据集
IVT_Analyze2
自然语言处理
机器学习
该数据集包含问题和答案对,适用于训练问答系统。它包含一个训练集,共有6400个问题和答案对。
Hugging Face
2025-05-31 更新
3
0
Log Word Rank Movements of Stop Words for ACM-TWEB Corpus
文本分析
自然语言处理
npy file containing the list of log word rank movements of all 179 stop words that appear in the 224 ACM-TWEB abstracts.
DataCite Commons
2025-05-31 更新
2
0
fineweb-kimi-k2-instruct-no
教育评估
自然语言处理
Fineweb2 Kimi K2 指导挪威语数据集是从FineWeb2中选取的10万份文档,使用Kimi K2 Instruct模型进行注释的教育价值评估数据集。它包括id、source、text等字段,并分为训练集和测试集,用于评估网页的教育价值。
Hugging Face
2025-07-20 更新
1
0
3b_civilsum
文本摘要
自然语言处理
CivilSum summarisation using LlaMa3.2 3B
kaggle
2025-01-06 更新
2
0
tartuNLP/finetranslations-et
机器翻译
自然语言处理
FineTranslations-et是HuggingFaceFW/finetranslations数据集的爱沙尼亚语子集,为便于访问而重新上传。该数据集包含翻译文本、原始文本块、语言分数和质量指标等特征,适用于翻译和文本生成任务。数据集发布在Open Data Commons Attribution License (ODC-By) v1.0许可下,并受CommonCrawl使用条款约束。
Hugging Face
2026-01-10 更新
2
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广