AmanPriyanshu/FSD-PT-PleIAs-SYNTH-15M-EN-NonMem-Mem
收藏官方服务:
资源简介:
FSD-PT PleIAs SYNTH 15M 英语子集是一个包含1500万文档的纯英语数据集,用于预训练小型推理模型。该数据集是从PleIAs/SYNTH原始数据集中筛选和采样得到的,通过过滤仅保留英语内容,并采用轮询采样方式以确保不同练习类型的多样性。数据集包括查询、生成推理轨迹、最终答案、语言(始终为英语)、练习类型、生成模型和词数等列。
A 15M-document English-only subset of PleIAs/SYNTH for pretraining small reasoning models.
提供机构:
AmanPriyanshu


