遇见数据集

OpceanAI/sota-general

收藏
Hugging Face2026-05-23 更新2026-05-31 收录
官方服务:

资源简介:

SOTA通用数据集是一个多语言、多任务的自然语言处理数据集,支持包括英语、西班牙语、法语、中文、意大利语、俄语、日语、阿拉伯语、印地语、德语和捷克语在内的11种语言。该数据集涵盖文本生成、翻译、问答、强化学习和文本分类等多种任务类别,数据由机器生成和专家生成相结合,规模在10万到100万条之间。数据集特别强调推理能力、多语言处理、指令调优和思维链技术,适用于训练和评估先进的自然语言处理模型。

The SOTA General Dataset is a multilingual, multi-task natural language processing dataset supporting 11 languages including English, Spanish, French, Chinese, Italian, Russian, Japanese, Arabic, Hindi, German, and Czech. It covers various task categories such as text generation, translation, question answering, reinforcement learning, and text classification. The dataset combines machine-generated and expert-generated data, with a scale between 100,000 and 1 million entries. It emphasizes reasoning capabilities, multilingual processing, instruction tuning, and chain-of-thought techniques, making it suitable for training and evaluating advanced natural language processing models.

提供机构:
OpceanAI
二维码
社区交流群
二维码
科研交流群
商业服务