遇见数据集

TearedModels/conlangcrafter-cpt-bd412d52

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个名为conlangcrafter-cpt-bd412d52的继续预训练(CPT)语料库,使用构造语言生成,语言ID为bd412d52。它通过ConlangCrafter管道合成,旨在为语言模型微调提供一个明显分布外的目标。由于该语言是在公共模型预训练截止后由LLM管道生成的,且从未以任何形式发布过,因此没有大型预训练模型接触过它。与分布内数据(如网络文本或数学数据)相比,使用该语料库进行CPT会表现出更大的评估损失下降。数据集包含文本、主题和块ID等列,仅用于训练分割,总共有3,077行,约13,259,122个字符,使用Vertex AI Gemini模型生成,并经过质量门控检查。

Continued-pretraining (CPT) corpus in a constructed language generated by the ConlangCrafter pipeline (language id bd412d52). This dataset exists to give language-model fine-tuning runs a demonstrably out-of-distribution target. Because the language was synthesized by an LLM pipeline after public model pretraining cutoffs and never published in any form before, no large pretrained model has seen it. CPT against this corpus therefore exhibits a much larger eval-loss drop than CPT against in-distribution data such as web text or math. It includes columns for text, topic, and chunk_id, with a train-only split, containing 3,077 rows, approximately 13,259,122 characters, generated using Vertex AI Gemini model, and subject to quality gates.

提供机构:
TearedModels
搜集汇总
数据集介绍
构建方式
该数据集通过ConlangCrafter流水线构建,利用大语言模型合成一种全新的人造语言(语言ID:bd412d52)。生成过程采用Vertex AI Gemini进行一次性合成,将完整的语言规范(包括音系、语法、词库)作为系统提示,并通过旋转主题种子确保内容多样性。每个生成的文本块需经过质量门控,包括词库重叠率下限、英文单词上限及最小长度要求,不合格的块最多使用新的主题种子重试两次。最终获得包含3,077个样本、约1,300万字符的高质量语料,所有样本均经过严格筛选以确保语言的一致性和纯净性。
特点
该数据集的核心优势在于其明确为分布外(out-of-distribution)数据设计。由于语言是在公开模型预训练截止日期后由LLM流水线合成,且从未以任何形式发布,所有大型预训练模型均未接触过此语言。在连续预训练(CPT)过程中,该语料能够引发比网络文本或数学等分布内数据更大的评估损失下降,从而为语言模型的微调提供可量化的分布偏移测试基准。数据集包含文本、主题种子和块索引三列,仅提供训练集分割,便于直接用于分布外泛化研究。
使用方法
该数据集主要面向连续预训练场景,特别适配modded-continued-training框架,但其通用模式允许集成至其他训练管线。使用时可直接加载JSON格式数据,字段包括文本内容(text)、主题种子(topic)和块索引(chunk_id)。研究者在微调流程中应将其作为分布外目标语料,通过对比CPT前后模型在测试集上的损失变化,可有效评估模型对新语言的泛化能力。建议结合ConlangCrafter完整语言规范(spec.md)理解数据结构,从而设计更为严谨的分布偏移实验方案。
背景与挑战
背景概述
ConlangCrafter-CPT-bd412d52数据集由Morris Alper、Moran Yanuka、Raja Giryes和Gašper Beguš于2025年创建,旨在为语言模型持续预训练(Continued Pretraining, CPT)提供一种严格意义上的分布外(Out-of-Distribution, OOD)评估基准。该数据集通过ConlangCrafter多跳LLM流水线合成,语种为一种从未在公开语料中出现的人造语言(Conlang),其语音、语法和词汇规范均来自HuggingFace上的ConlangCrafter项目。核心研究问题在于,现有大模型在预训练阶段已见过海量自然语言文本,而针对此合成语言的CPT能够揭露模型对新语言的适应能力,并产生显著的评估损失(Eval Loss)下降幅度,从而为分布偏移下的持续训练方法提供有力的实验支撑。该数据集已被整合至modded-continued-training框架,对推动合成语言在NLP鲁棒性研究中的应用具有重要示范价值。
当前挑战
该数据集所应对的领域挑战在于,持续预训练方法在面临分布外数据时,传统评估指标难以量化模型真正的适应能力。现有的CPT语料(如网页文本或数学语料)极易被模型在预训练阶段隐式记忆,导致评估损失下降无法真实反映模型对新分布的泛化能力。在数据集构建过程中,面临着两大挑战:一是如何确保合成语言具备内在一致性且严格不被公开模型训练数据污染,要求生成管道必须在模型预训练截止日期之后运行,并经由质量门控(如词汇覆盖率、英文词汇上限、段落长度)筛选;二是如何解决语言生成中的模态退化与主题多样性,通过旋转话题种子和重新生成机制,在有限迭代内产出超过3000条结构完整的人造语言文本。
常用场景
经典使用场景
在语言模型持续预训练的研究中,conlangcrafter-cpt-bd412d52数据集因其独特的构造语言属性,成为评估模型在极端分布外数据上适应能力的理想测试基准。该数据集通过系统化流程生成,包含超过三千条文本片段,每条均附带主题标签与唯一标识符,使得研究人员能够精准追踪模型在完全陌生语言环境中的学习曲线。借助该数据集,研究者可以设计对比实验,观察模型从初始高困惑度到逐步收敛的过程,进而探究持续预训练阶段模型结构、学习率调度与数据组成对分布外泛化能力的影响。这一经典应用场景为理解语言模型的知识固化与迁移潜力提供了可量化的实验平台。
衍生相关工作
该数据集的发布催生了一系列围绕分布外持续预训练方法论的创新工作。其底层的ConlangCrafter管线本身即为一项多跳大语言模型生成框架的代表性成果,展示了如何通过结构化提示与质量门控机制系统生产人工语言文本。基于该数据集,研究者提出了多种分布外适应评估指标,并探索了课程学习、重放缓冲与正则化策略对模型在构造语言上性能的影响。一些工作进一步扩展了该研究的边界,将构造语言作为探针,分析模型内部表示层对不同语言结构的敏感度,揭示了注意力头与神经元激活模式在应对陌生句法时的自适应重排机制。这些衍生研究不仅深化了人们对语言模型局限性的认知,也为设计更具适应能力的下一代预训练框架奠定了实证基础。
数据集最近研究
最新研究方向
conlangcrafter-cpt-bd412d52数据集代表了将人工构造语言(conlang)应用于大语言模型持续预训练(CPT)的最新前沿探索。该数据集通过ConlangCrafter管线合成一种完全未在公开语料中出现过的构造语言,为模型提供了明确的分布外(out-of-distribution)训练目标。在持续预训练过程中,使用该数据集的模型展现出远超传统网络文本或数学语料的效果损失下降幅度,这一发现对于评估和提升模型在未知语言结构上的泛化能力具有重要启示。当前相关研究热点集中于利用合成构造语言来模拟真实世界中的低资源语言场景,检验模型能否在从未接触过的语言系统下有效学习与表征,从而推动多语言处理和跨语言迁移学习的前沿边界。这一工作的潜在影响在于为构造语言学的计算建模提供了系统化的数据生成方法与评估基准,并使持续预训练策略在极端分布偏移条件下的适应性研究进入新阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务