遇见数据集

ttj/dataset-ironing-smollm2-135m-ppl

收藏
Hugging Face2026-05-16 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个nanochat预训练的parquet数据集,标注了来自`HuggingFaceTB/SmolLM2-135M`模型的离线逐样本困惑度。

配置项: - 配置名称:default 数据文件: - 拆分集:训练集(train) 路径:"*.parquet" # base_data_smolm2_135m_ppl 本数据集为一款标注有来自`HuggingFaceTB/SmolLM2-135M`的离线单样本困惑度(perplexity)的nanochat预训练Parquet格式数据集。 ## 数据字段 - `text`:原始训练文本。 - `perplexity`:固定参考模型计算得到的单样本困惑度(perplexity)。 - `perplexity_num_tokens`:所用参考词元(Token)预测目标的总数量。 - `perplexity_nll`:取指数前的平均负对数似然(negative log likelihood)值。 - `perplexity_reference_model`:当前数据行所使用的参考模型标识符。 ## 全局统计信息 全局统计信息存储于`perplexity_stats.json`文件中,具体统计数据如下: json { "num_examples": 12789760, "num_finite": 12789760, "mean": 16.971930903637244, "std": 8.10952495285045, "deciles": { "0.1": 9.473104233607561, "0.2": 11.27557233495321, "0.3": 12.72408254281915, "0.4": 14.077568768709655, "0.5": 15.460851038454923, "0.6": 16.983914074862593, "0.7": 18.8197051905061, "0.8": 21.31558898948356, "0.9": 25.69053539187382 }, "min": 1.2803555606074715, "max": 992.5975294944326, "reference_model": "HuggingFaceTB/SmolLM2-135M", "max_context_length": 8192, "input_shards": [ "shard_00000.parquet", "shard_00001.parquet", ... "shard_00239.parquet" ], "output_shards": [ "shard_00000.parquet", "shard_00001.parquet", ... "shard_00239.parquet" ], "is_partial": false, "missing_output_shards": [], "output_dir": "/home/ttj/.cache/nanochat/base_data_smolm2_135m_ppl", "perplexity_column": "perplexity", "token_count_column": "perplexity_num_tokens", "nll_column": "perplexity_nll" } 参考上下文长度:`8192`。 输入分片总数:`240`。

提供机构:
ttj
二维码
社区交流群
二维码
科研交流群
商业服务