遇见数据集

AmanPriyanshu/FSD-PT-PleIAs-SYNTH-15M-EN-NonMem-Mem

收藏
Hugging Face2026-05-23 更新2026-05-31 收录
官方服务:

资源简介:

FSD-PT PleIAs SYNTH 15M 英语子集是一个包含1500万文档的纯英语数据集,用于预训练小型推理模型。该数据集是从PleIAs/SYNTH原始数据集中筛选和采样得到的,通过过滤仅保留英语内容,并采用轮询采样方式以确保不同练习类型的多样性。数据集包括查询、生成推理轨迹、最终答案、语言(始终为英语)、练习类型、生成模型和词数等列。

A 15M-document English-only subset of PleIAs/SYNTH for pretraining small reasoning models.

提供机构:
AmanPriyanshu
二维码
社区交流群
二维码
科研交流群
商业服务