sepalith
收藏资源简介:
Sepalith数据集是一个面向R语言的下一个编辑建议(next-edit-suggestion)训练数据集,由多个来源的代码编辑数据组成。数据集的语料库(corpus)包含来自CRAN包(包括包关联的许可证信息)、通用R代码(hidden-r)以及通过Git挖掘的编辑对(edit-pairs)。此外,数据集还包含由合成案例家族(families)生成的JSONL文件,每个文件对应一个作者来源(如glm-5.3、muse-spark-1.2等),并附有来源追踪信息(.done.jsonl/.stats.json)。训练/评估分割(mixtures/sft_vX)是从这些家族中组装而成的。每条数据记录包含base_sample_id(内容哈希父链接)以及规则或后端来源信息。该数据集适用于R语言代码编辑建议、自动补全或代码生成模型的训练。
The Sepalith dataset is a training dataset for next-edit-suggestion in R language, composed of code editing data from multiple sources. The corpus includes CRAN packages (with associated license information), general R code (hidden-r), and edit-pairs mined from Git. Additionally, the dataset contains JSONL files generated by synthetic case families, each corresponding to an author source (e.g., glm-5.3, muse-spark-1.2, etc.), along with source tracking information (.done.jsonl/.stats.json). Training/evaluation splits (mixtures/sft_vX) are assembled from these families. Each data record includes base_sample_id (content hash parent link) and rule or backend source information. The dataset is suitable for training models for R code editing suggestions, auto-completion, or code generation.
数据集概述
Sepalith 是一个面向 R 语言的开源、专业化“下一编辑建议”训练数据集,目前为私有状态(Private)。
该数据集的核心目标是为 R 语言的编辑建议模型提供训练数据,其内容组织具有高度结构化和可追溯性。
目录结构
数据集分为三个主要层级:
-
corpus/(源语料库):包含已获取且追踪许可的来源数据。cran/packages/:CRAN 包的分片(shards)。hidden-r/:采集的通用 R 代码。edit-pairs/:通过 Git 挖掘的编辑对数据。- 同时包含每个包的来源与许可证信息。
-
families/(合成案例族):按families/<family>/<source>.jsonl组织,每个文件对应一个作者来源(如glm-5.3、muse-spark-1.2、x-preview、OpenRouter 模型 ID,或corpus表示确定性生成、无 LLM 参与)。每个文件附带.done.jsonl/.stats.json元数据文件,记录生成过程信息,确保每一行数据可溯源且可安全清除。 -
mixtures/sft_vX/(混合数据集):由families通过实验/后处理脚本(如experiments/post-processing/assemble_sft_v5.py)组装生成的训练/评估切分数据,属于派生数据,可重建。
数据可追溯性
每条数据记录包含 base_sample_id(内容哈希父链接)以及规则/后端来源信息,生成代码位于 Sepalith 仓库的 experiments/synthetic-data/ 目录中。
注意:以上所有信息均来自提供的 README 文件,未包含数据集详情页中不存在的内容。




