OpceanAI/sota-coding
收藏资源简介:
SOTA Coding & Reasoning Dataset是一个多语言数据集,支持英语、西班牙语、法语、中文、意大利语、俄语、日语、阿拉伯语、印地语、德语和捷克语。该数据集设计用于多种自然语言处理任务,包括文本生成、翻译、问答和文本分类。它包含推理、指令调优和思维链等标签,适用于训练和评估先进的编码和推理模型。数据集规模在10万到100万条之间,由机器生成和专家生成的内容组成,旨在促进多语言环境下的AI推理能力发展。
The SOTA Coding & Reasoning Dataset is a multilingual dataset supporting languages including English, Spanish, French, Chinese, Italian, Russian, Japanese, Arabic, Hindi, German, and Czech. It is designed for various natural language processing tasks such as text generation, translation, question-answering, and text classification. The dataset features tags like reasoning, instruction-tuning, and chain-of-thought, making it suitable for training and evaluating advanced coding and reasoning models. With a size ranging from 100K to 1M entries, it combines machine-generated and expert-generated content to advance AI reasoning capabilities in multilingual contexts.



