Cartik/Ru-train-dataset
收藏资源简介:
Big Russian Dataset是一个结合了多种主要俄语数据集的集合,包含一定程度的推理内容。该数据集经过去重、清理、使用GPT-4.1评分和过滤处理。数据集包含对话、来源、主题等多种特征,以及正确性、信息量、参与度等多个评分指标。它主要用于文本生成任务,主要语言为俄语,涉及指令、对话、数学、物理和代码等主题。数据集还包括多个子集,如IlyaGusev/saiga_scored、attn-signs/kolmogorov-3等,并对其进行了过滤处理。
The Big Russian Dataset is a combination of various primarily Russian-language datasets with some sort of reasoning. The dataset was deduplicated, cleaned, scored using GPT-4.1, and filtered. It includes features such as conversation, source, topic, and various scoring metrics like correctness, informativeness, and engagement. The dataset is designed for text-generation tasks, primarily in Russian, and covers topics like instruction, conversation, math, physics, and code. It incorporates multiple sub-datasets like IlyaGusev/saiga_scored and attn-signs/kolmogorov-3, which have been filtered according to specific conditions.





