登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
EleutherAI/unscramble
EleutherAI/unscramble
收藏
Hugging Face
2023-11-02 更新
2024-03-04 收录
数据链接:
https://hf-mirror.com/datasets/EleutherAI/unscramble
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: other ---
应用场景:
提供机构:
EleutherAI
原始信息汇总
数据集概述
许可证信息
许可证类型:其他
相关数据集
EleutherAI/qm-mixture
数学分类
机器学习
Quirky Math是一个用于测试ELK(Eliciting Latent Knowledge)方法的数据集集合,特别是在模型输出可能错误或误导的情况下。该数据集包含三个版本,每个版本使用不同的模板设置:mixture、grader first和grader last。这些数据集用于LoRA微调24个“quirky”模型,以分类加法方程是否正确(在平衡欠采样后)。这些模型可用于测量ELK探测方法
Hugging Face
2023-12-02 更新
16
0
EleutherAI/quirky_sentiment_bob
情感分析
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* dataset_info: featur
Hugging Face
2024-01-12 更新
9
0
EleutherAI/dclm-dedup_20250227-004105-filters-only
文本过滤
自然语言处理
该数据集包含了多个字段,用于表示文本过滤的相关信息。具体包括:唯一标识符id,是否为目标过滤的is_filter_target字段,以及表示单词过滤、BERT过滤和组合过滤的布尔字段。每个过滤字段还可能包含额外的元数据,例如单词过滤的关键词和BERT过滤的得分及触发段。数据集分为训练集,共有约4亿多个示例,大小约为30GB。同时,提供了默认配置,指定了训练数据的文件路径。
Hugging Face
2025-03-07 更新
8
0
EleutherAI/coqa
对话问答
自然语言处理
CoQA是一个用于构建对话式问答系统的大规模数据集。该数据集的目标是衡量机器理解文本段落并回答对话中出现的一系列相互关联问题的能力。此外,该数据集还添加了原始数据集中缺失的“additional_answers”特性。
Hugging Face
2025-01-10 更新
15
0
EleutherAI/SmolLM-135M-100b
自然语言处理
机器学习
这是一个大约1000亿token的文本数据集,它是由用于训练SmolLM-135M模型的SmolLM语料库混合而成的样本。数据集包含两个特征:文本内容和来源信息。文本内容以字符串形式存储,同时记录了每个文本的来源。训练集大小为425,062,797,780字节,共有约1,089,554,32个示例。
Hugging Face
2025-03-18 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广