data-farming-justrl-1p5b-dapo-math-17k-rollouts
收藏资源简介:
# data-farming-justrl-1p5b-dapo-math-17k-rollouts Merged offline vLLM rollout outputs for the full `dapo_math_17k` data-farming eval. ## Summary | Field | Value | |-------|-------| | Model | `JustRL-DeepSeek-1.5B` | | Input dataset | `dapo_math_17k` | | Prompts | `17398` | | Rollout repeats | `4` | | Total rollout rows | `69592` | | Source shard files | `64` rank parquets | | Temperature | `1.0` | | Top-p | `0.95` | | Top-k | `-1` | | Max tokens | `25600` | | Source HDFS prefix | `hdfs://harunawl/home/byte_data_seed_wl/user/gaohuanang/research/opd/eval_outputs/20260609_data_farming_justrl_1p5b` | ## Files - `data/dapo_math_17k_rollouts.parquet`: merged rollout parquet for all 8 Merlin shards - `metadata.json`: merge manifest Each row keeps the original eval columns plus rollout fields such as: - `completion` - `completion_tokens` ## Usage ```python import pandas as pd df = pd.read_parquet("data/dapo_math_17k_rollouts.parquet") print(len(df), df.columns.tolist()) ``` Or from ModelScope after upload: ```python from modelscope.msdatasets import MsDataset ds = MsDataset.load("c7wc7w/data-farming-justrl-1p5b-dapo-math-17k-rollouts", split="train") ```



