遇见数据集

condense_300K

收藏
魔搭社区2026-07-08 更新2026-07-15 收录
官方服务:

资源简介:

# Condense-300K — Query-Aware Condenser SFT Dataset `Condense-300K` 是面向 **Condenser 模型冷启动 SFT** 的多源混合数据集,共 **290,762** 条样本。每条样本由生产管线 [`make_condensed_sft.py`](../cookbook/rl/make_condensed_sft.py) 风格的流程生成:给定一个 `(query, source)` 对,由 super-LLM 输出 **两段式 Markdown 压缩答案**,与 `extract_compressed` 工具协议配对,让下游 reader 模型能 (a) 直接吸收 `## Read inline` 段中的关键事实,(b) 通过 `## Call extract_compressed for` 段中列出的指针主题,按需调用工具回取被延迟的细节。 ## 用途 训练一个 **"压缩助手"** 模型 —— 在 RL/agentic pipeline 中作为上游压缩器,对长源文本(passage / 代码 / 推理 trace)按用户 query 做有损但**指针完整**的压缩,配合 `extract_compressed` 工具实现"先读摘要、按需展开"的多跳上下文工作流。典型下游: - 多跳问答(HotpotQA、MuSiQue 等)的 reader 模型上下文构造 - 代码理解任务的 API/类签名提取 - 长 reasoning trace 的关键步保留 + 细节回查 ## 数据规模与来源占比 | Source | n | 占比 | 字符压缩率 p50 / p90 | |---|---:|---:|:---:| | github-code | 59,901 | 20.6% | 6.5% / 20.4% | | toucan | 49,215 | 16.9% | 39.3% / 74.2% | | angrygiraffe-claude-opus-4.6-4.7-reasoning-8.7k | 40,565 | 14.0% | 37.1% / 70.0% | | musique | 38,399 | 13.2% | 84.2% / 131.4% | | swe-smith | 35,318 | 12.1% | 36.7% / 79.6% | | Chinese-DeepSeek-R1-Distill-data-110k | 20,199 | 6.9% | 23.6% / 37.5% | | tiny-textbooks | 19,996 | 6.9% | 27.5% / 42.0% | | competition_math | 13,698 | 4.7% | 100.5% / 195.1% | | Opus-4.6-Reasoning-3000x-filtered | 6,757 | 2.3% | 28.0% / 52.4% | | claude-opus-4.6-10000x | 6,714 | 2.3% | 34.3% / 67.8% | | **总计** | **290,762** | **100%** | — | 数据覆盖代码(`github-code`、`swe-smith`)、长教科书段(`tiny-textbooks`)、多跳 QA passage(`musique`)、竞赛数学解题(`competition_math`)、长 reasoning trace(`angrygiraffe-claude-opus`、`Opus-4.6-Reasoning`、`claude-opus-4.6-10000x`、`Chinese-DeepSeek-R1-Distill`)、通用指令对话(`toucan`)共六大类,约 60% 英文 / 25% 中文 / 15% 代码。 > 注:`musique` 与 `competition_math` 子集源文长度本身偏短(多数 < 600 字符),两段式模板固定开销约 150–200 字符使其压缩率漂移到 80–200%;事实保真度 OK,但训练**压缩比**信号有限,可按需在下游做长度过滤。 ## 文件结构 ``` condense_300K/ ├── README.md └── train.jsonl # 290,762 行,约 2.5 GB ``` ## Schema 每行一个 JSON 对象: | 字段 | 类型 | 说明 | |---|---|---| | `id` | str | 形如 `<source>__<hash1>__<hash2>` 的全局唯一 ID | | `source` | str | 源数据集名(见上表) | | `query` | str | 触发压缩的用户问题 / 抽取目标,决定 `## Read inline` 应保留哪些事实 | | `original_len` | int | 源文本字符数 | | `compressed_len` | int | assistant 输出字符数 | | `original_tokens` | int | 源文本 token 数(部分 source 未填,为 0) | | `compressed_tokens` | int | assistant 输出 token 数(同上) | | `messages` | list | 三轮 `system / user / assistant` | `messages` 结构: - **`system`**:固定的压缩助手指令,要求输出两段式 Markdown,与 `extract_compressed` 工具配对。 - **`user`**:`## Query\n{query}\n\n## Source\n{source_text}`。 - **`assistant`**:两段式输出 - `## Read inline`:以 `Topic: ...` 起首,用 telegraphic style(无冠词、用冒号/逗号代替 "is"/"has")罗列与 query 直接相关的关键事实。 - `## Call extract_compressed for`:列出延迟读取的子主题指针(`- key: 描述`),下游 reader 调用 `extract_compressed` 时按这些 key 回取原文。 ## 输出格式示例 ```jsonl { "id": "tinytb__7c0421568a645967__f31d8ff6", "source": "tiny-textbooks", "query": "List the common types of tourist attractions...", "original_len": 2857, "compressed_len": 666, "messages": [ {"role": "system", "content": "You are a compression assistant..."}, {"role": "user", "content": "## Query\n...\n\n## Source\nLesson Title: ..."}, {"role": "assistant", "content": "## Read inline\nTopic: ...\n...\n\n## Call extract_compressed for\n- ...: ..."} ] } ``` ## 生成管线 复用与 [`make_condensed_sft.py`](../cookbook/rl/make_condensed_sft.py) 同源的 super-LLM + `ModelCondenser` 路径: 1. **采样**:从各 source 按目标占比采样 `(query, source_text)` 对,长源文按段落切分为 `Chunks`。 2. **压缩生成**:super-LLM 在固定 system prompt 下产出两段式 Markdown,要求 `## Call extract_compressed for` 段的每个 key 都对应原文中确实存在的细节,避免编造指针。 3. **格式校验**:丢弃缺失任一段、Topic 行缺失或指针 key 为空的样本。 4. **长度统计**:写入 `original_len` / `compressed_len` 等字段,便于下游做长度过滤或加权采样。 ## 加载 ```python from datasets import load_dataset ds = load_dataset( 'json', data_files='condense_300K/train.jsonl', split='train', ) print(ds[0]['messages'][2]['content']) ``` ## 适配建议 - **训练 condenser**:直接以 `messages` 做标准 SFT;建议 `max_length ≥ 8192` 容纳长源文。 - **按 source 加权**:`musique` / `competition_math` 中 `original_len < 600` 的样本压缩比信号弱,可下采样或丢弃。 - **训练通用助手**:可仅取 `Chinese-DeepSeek-R1-Distill-data-110k`、`tiny-textbooks`、`Opus-4.6-Reasoning-3000x-filtered` 三个保真度高、压缩率稳定的子集(约 47k 行)作高质量子库。 ## License Apache License 2.0

提供机构:
maas
创建时间:
2026-05-31
二维码
社区交流群
二维码
科研交流群
商业服务