遇见数据集

tomaarsen/zelo-scores-10kx100-granite-4.1-30b

收藏
Hugging Face2026-05-02 更新2026-05-31 收录
官方服务:

资源简介:

这是一个由DataForge生成的合成数据集,用于文本生成和语言建模任务。数据集使用模型ibm-granite/granite-4.1-30b,基于源数据集tomaarsen/zelo-pairs-10kx100-quantile-anchor的train分割生成。生成配置包括温度、top_p、top_k参数为None,最大令牌数为4096,模型最大上下文为32768,并禁用了推测解码。系统提示定义了一个相关性评分任务:给定查询和两个文档(A和B),模型需要决定哪个文档与查询更相关,评分范围为-1.0到1.0,负值表示文档A更相关,正值表示文档B更相关。用户提示为列messages。数据集包含1,001,000个样本(约1.0M),并生成了352,337,836个令牌(约352.3M)。数据集统计显示,处理的文档数为1,001,000,总提示令牌数为517,236,012(约517.2M),总完成令牌数为352,337,836(约352.3M),平均提示令牌数为516.72,平均完成令牌数为351.99。数据集许可证为other,由用户tomaarsen贡献。

语言: - 英语 许可证:其他 标签: - dataforge - granite-4.1-30b - 合成数据 - zelo-pairs-10kx100-quantile-anchor 注释生成者: - 机器生成 语言生成来源: - 从现有文本采集 数据集显示名称:tomaarsen/zelo-scores-10kx100-granite-4.1-30b 规模类别:样本量超过100万 源数据集:tomaarsen/zelo-pairs-10kx100-quantile-anchor 任务类别: - 文本生成 任务子项: - 语言建模 配置项: - 配置名称:默认 数据文件: - 拆分方式:训练集 路径:data/**/*.parquet 训练-评估索引: - 配置:默认 任务:文本生成 任务子项:语言建模 拆分: 训练集拆分:train 评估集拆分: 列映射: text: text # 数据集卡片:tomaarsen/zelo-scores-10kx100-granite-4.1-30b ## 数据集概述 本数据集为由[DataForge](https://github.com/huggingface/dataforge)生成的合成数据: * 模型:`ibm-granite/granite-4.1-30b`(`main`分支) * 源数据集:`tomaarsen/zelo-pairs-10kx100-quantile-anchor`(`train`拆分集) * 生成配置:`temperature=None`、`top_p=None`、`top_k=None`、`max_tokens=4096`、`model_max_context=32768` * 推测解码:已禁用 * 系统提示词:`你是一个相关性评分系统。给定一个查询与两份文档(A与B),你的任务是判断哪一份文档与给定查询的相关性更强。请审慎思考,权衡两份文档各自的优劣。首先,请用若干语句分析文档A的利弊;随后,花费一定时间思考文档B的利弊;最后,对二者进行对比并作出相关性更强的选择。请勿在思考初期就作出决断,保持开放心态,直至思考的最后1-2句话再给出结论。 评分范围为-1.0至1.0:负值代表文档A相关性更强,正值代表文档B相关性更强,你可在该区间内选取任意数值。 你的最终回复必须以如下格式的单行内容结尾:`Score: <介于-1.0与1.0之间的浮点数>`。` * 用户提示词:对应`messages`列 本次生成共产出1,001,000(约100万)条样本,累计生成352,337,836(约3.523亿)个Token。 你可通过以下代码加载该数据集: python from datasets import load_dataset ds = load_dataset("tomaarsen/zelo-scores-10kx100-granite-4.1-30b") ## 数据集统计 | 指标 | 数值 | | --- | --- | | 处理文档数 | 1,001,000(约100万) | | 提示词总Token数 | 517,236,012(约5.172亿) | | 补全文本总Token数 | 352,337,836(约3.523亿) | | 单条提示词平均Token数 | 516.72 | | 单条补全文本平均Token数 | 351.99 | ## 许可证信息 许可证:其他 ## 贡献说明 感谢[@tomaarsen](https://huggingface.co/tomaarsen)为本数据集提供的贡献。

提供机构:
tomaarsen
二维码
社区交流群
二维码
科研交流群
商业服务