遇见数据集

wissamantoun/orca_parquet

收藏
Hugging Face2026-03-01 更新2026-03-29 收录
官方服务:

资源简介:

--- pretty_name: ORCA – Arabic Language Understanding Benchmark language: - ar configs: - config_name: abusive data_files: - split: train path: data/abusive/train.parquet - split: validation path: data/abusive/validation.parquet - split: test path: data/abusive/test.parquet - config_name: adult data_files: - split: train path: data/adult/train.parquet - split: validation path: data/adult/validation.parquet - split: test path: data/adult/test.parquet - config_name: age data_files: - split: train path: data/age/train.parquet - split: validation path: data/age/validation.parquet - split: test path: data/age/test.parquet - config_name: ans-claim data_files: - split: train path: data/ans-claim/train.parquet - split: validation path: data/ans-claim/validation.parquet - split: test path: data/ans-claim/test.parquet - config_name: ans-stance data_files: - split: train path: data/ans-stance/train.parquet - split: validation path: data/ans-stance/validation.parquet - split: test path: data/ans-stance/test.parquet - config_name: aqmar-ner data_files: - split: train path: data/aqmar-ner/train.parquet - split: validation path: data/aqmar-ner/validation.parquet - split: test path: data/aqmar-ner/test.parquet - config_name: arabic-ner data_files: - split: train path: data/arabic-ner/train.parquet - split: validation path: data/arabic-ner/validation.parquet - split: test path: data/arabic-ner/test.parquet - config_name: baly-stance data_files: - split: train path: data/baly-stance/train.parquet - split: validation path: data/baly-stance/validation.parquet - split: test path: data/baly-stance/test.parquet - config_name: dangerous data_files: - split: train path: data/dangerous/train.parquet - split: validation path: data/dangerous/validation.parquet - split: test path: data/dangerous/test.parquet - config_name: dialect-binary data_files: - split: train path: data/dialect-binary/train.parquet - split: validation path: data/dialect-binary/validation.parquet - split: test path: data/dialect-binary/test.parquet - config_name: dialect-country data_files: - split: train path: data/dialect-country/train.parquet - split: validation path: data/dialect-country/validation.parquet - split: test path: data/dialect-country/test.parquet - config_name: dialect-pos data_files: - split: train path: data/dialect-pos/train.parquet - split: validation path: data/dialect-pos/validation.parquet - split: test path: data/dialect-pos/test.parquet - config_name: dialect-region data_files: - split: train path: data/dialect-region/train.parquet - split: validation path: data/dialect-region/validation.parquet - split: test path: data/dialect-region/test.parquet - config_name: emotion data_files: - split: train path: data/emotion/train.parquet - split: validation path: data/emotion/validation.parquet - split: test path: data/emotion/test.parquet - config_name: emotion-reg data_files: - split: train path: data/emotion-reg/train.parquet - split: validation path: data/emotion-reg/validation.parquet - split: test path: data/emotion-reg/test.parquet - config_name: gender data_files: - split: train path: data/gender/train.parquet - split: validation path: data/gender/validation.parquet - split: test path: data/gender/test.parquet - config_name: hate-speech data_files: - split: train path: data/hate-speech/train.parquet - split: validation path: data/hate-speech/validation.parquet - split: test path: data/hate-speech/test.parquet - config_name: irony data_files: - split: train path: data/irony/train.parquet - split: validation path: data/irony/validation.parquet - split: test path: data/irony/test.parquet - config_name: machine-generation data_files: - split: train path: data/machine-generation/train.parquet - split: validation path: data/machine-generation/validation.parquet - split: test path: data/machine-generation/test.parquet - config_name: mq2q data_files: - split: train path: data/mq2q/train.parquet - split: validation path: data/mq2q/validation.parquet - split: test path: data/mq2q/test.parquet - config_name: msa-pos data_files: - split: train path: data/msa-pos/train.parquet - split: validation path: data/msa-pos/validation.parquet - split: test path: data/msa-pos/test.parquet - config_name: offensive data_files: - split: train path: data/offensive/train.parquet - split: validation path: data/offensive/validation.parquet - split: test path: data/offensive/test.parquet - config_name: qa data_files: - split: train path: data/qa/train.parquet - split: validation path: data/qa/validation.parquet - split: test path: data/qa/test.parquet - config_name: sarcasm data_files: - split: train path: data/sarcasm/train.parquet - split: validation path: data/sarcasm/validation.parquet - split: test path: data/sarcasm/test.parquet - config_name: sentiment data_files: - split: train path: data/sentiment/train.parquet - split: validation path: data/sentiment/validation.parquet - split: test path: data/sentiment/test.parquet - config_name: sts data_files: - split: train path: data/sts/train.parquet - split: validation path: data/sts/validation.parquet - split: test path: data/sts/test.parquet - config_name: topic data_files: - split: train path: data/topic/train.parquet - split: validation path: data/topic/validation.parquet - split: test path: data/topic/test.parquet - config_name: wsd data_files: - split: train path: data/wsd/train.parquet - split: validation path: data/wsd/validation.parquet - split: test path: data/wsd/test.parquet - config_name: xlni data_files: - split: train path: data/xlni/train.parquet - split: validation path: data/xlni/validation.parquet - split: test path: data/xlni/test.parquet --- # ORCA – Arabic Language Understanding Benchmark Converted from the original [`wissamantoun/orca_hf`](https://huggingface.co/datasets/wissamantoun/orca_hf) dataset script to parquet files. ## Usage ```python from datasets import load_dataset # Load a specific config ds = load_dataset("PATH/orca_parquet", name="sentiment") # Load all configs ds = load_dataset("PATH/orca_parquet") ```

展示名称:ORCA – 阿拉伯语言理解基准测试集(ORCA – Arabic Language Understanding Benchmark) 语言: - 阿拉伯语(ar) 配置项: - 配置名称:辱骂性文本分类(abusive) 数据文件: - 划分集:训练集(train),路径:data/abusive/train.parquet - 划分集:验证集(validation),路径:data/abusive/validation.parquet - 划分集:测试集(test),路径:data/abusive/test.parquet - 配置名称:成人内容检测(adult) 数据文件: - 划分集:训练集,路径:data/adult/train.parquet - 划分集:验证集,路径:data/adult/validation.parquet - 划分集:测试集,路径:data/adult/test.parquet - 配置名称:年龄属性理解(age) 数据文件: - 划分集:训练集,路径:data/age/train.parquet - 划分集:验证集,路径:data/age/validation.parquet - 划分集:测试集,路径:data/age/test.parquet - 配置名称:回答-主张分类(ans-claim) 数据文件: - 划分集:训练集,路径:data/ans-claim/train.parquet - 划分集:验证集,路径:data/ans-claim/validation.parquet - 划分集:测试集,路径:data/ans-claim/test.parquet - 配置名称:回答-立场分类(ans-stance) 数据文件: - 划分集:训练集,路径:data/ans-stance/train.parquet - 划分集:验证集,路径:data/ans-stance/validation.parquet - 划分集:测试集,路径:data/ans-stance/test.parquet - 配置名称:阿克马尔命名实体识别(aqmar-ner) 数据文件: - 划分集:训练集,路径:data/aqmar-ner/train.parquet - 划分集:验证集,路径:data/aqmar-ner/validation.parquet - 划分集:测试集,路径:data/aqmar-ner/test.parquet - 配置名称:阿拉伯语命名实体识别(arabic-ner) 数据文件: - 划分集:训练集,路径:data/arabic-ner/train.parquet - 划分集:验证集,路径:data/arabic-ner/validation.parquet - 划分集:测试集,路径:data/arabic-ner/test.parquet - 配置名称:巴利立场分类(baly-stance) 数据文件: - 划分集:训练集,路径:data/baly-stance/train.parquet - 划分集:验证集,路径:data/baly-stance/validation.parquet - 划分集:测试集,路径:data/baly-stance/test.parquet - 配置名称:危险内容检测(dangerous) 数据文件: - 划分集:训练集,路径:data/dangerous/train.parquet - 划分集:验证集,路径:data/dangerous/validation.parquet - 划分集:测试集,路径:data/dangerous/test.parquet - 配置名称:二元方言分类(dialect-binary) 数据文件: - 划分集:训练集,路径:data/dialect-binary/train.parquet - 划分集:验证集,路径:data/dialect-binary/validation.parquet - 划分集:测试集,路径:data/dialect-binary/test.parquet - 配置名称:方言国别分类(dialect-country) 数据文件: - 划分集:训练集,路径:data/dialect-country/train.parquet - 划分集:验证集,路径:data/dialect-country/validation.parquet - 划分集:测试集,路径:data/dialect-country/test.parquet - 配置名称:方言词性标注(dialect-pos) 数据文件: - 划分集:训练集,路径:data/dialect-pos/train.parquet - 划分集:验证集,路径:data/dialect-pos/validation.parquet - 划分集:测试集,路径:data/dialect-pos/test.parquet - 配置名称:方言地域分类(dialect-region) 数据文件: - 划分集:训练集,路径:data/dialect-region/train.parquet - 划分集:验证集,路径:data/dialect-region/validation.parquet - 划分集:测试集,路径:data/dialect-region/test.parquet - 配置名称:情感分类(emotion) 数据文件: - 划分集:训练集,路径:data/emotion/train.parquet - 划分集:验证集,路径:data/emotion/validation.parquet - 划分集:测试集,路径:data/emotion/test.parquet - 配置名称:情感回归(emotion-reg) 数据文件: - 划分集:训练集,路径:data/emotion-reg/train.parquet - 划分集:验证集,路径:data/emotion-reg/validation.parquet - 划分集:测试集,路径:data/emotion-reg/test.parquet - 配置名称:性别属性理解(gender) 数据文件: - 划分集:训练集,路径:data/gender/train.parquet - 划分集:验证集,路径:data/gender/validation.parquet - 划分集:测试集,路径:data/gender/test.parquet - 配置名称:仇恨言论检测(hate-speech) 数据文件: - 划分集:训练集,路径:data/hate-speech/train.parquet - 划分集:验证集,路径:data/hate-speech/validation.parquet - 划分集:测试集,路径:data/hate-speech/test.parquet - 配置名称:反语识别(irony) 数据文件: - 划分集:训练集,路径:data/irony/train.parquet - 划分集:验证集,路径:data/irony/validation.parquet - 划分集:测试集,路径:data/irony/test.parquet - 配置名称:机器生成文本检测(machine-generation) 数据文件: - 划分集:训练集,路径:data/machine-generation/train.parquet - 划分集:验证集,路径:data/machine-generation/validation.parquet - 划分集:测试集,路径:data/machine-generation/test.parquet - 配置名称:问题对问题匹配(mq2q) 数据文件: - 划分集:训练集,路径:data/mq2q/train.parquet - 划分集:验证集,路径:data/mq2q/validation.parquet - 划分集:测试集,路径:data/mq2q/test.parquet - 配置名称:现代标准阿拉伯语词性标注(msa-pos) 数据文件: - 划分集:训练集,路径:data/msa-pos/train.parquet - 划分集:验证集,路径:data/msa-pos/validation.parquet - 划分集:测试集,路径:data/msa-pos/test.parquet - 配置名称:冒犯性言论检测(offensive) 数据文件: - 划分集:训练集,路径:data/offensive/train.parquet - 划分集:验证集,路径:data/offensive/validation.parquet - 划分集:测试集,路径:data/offensive/test.parquet - 配置名称:问答任务(qa) 数据文件: - 划分集:训练集,路径:data/qa/train.parquet - 划分集:验证集,路径:data/qa/validation.parquet - 划分集:测试集,路径:data/qa/test.parquet - 配置名称:讽刺识别(sarcasm) 数据文件: - 划分集:训练集,路径:data/sarcasm/train.parquet - 划分集:验证集,路径:data/sarcasm/validation.parquet - 划分集:测试集,路径:data/sarcasm/test.parquet - 配置名称:情感分析(sentiment) 数据文件: - 划分集:训练集,路径:data/sentiment/train.parquet - 划分集:验证集,路径:data/sentiment/validation.parquet - 划分集:测试集,路径:data/sentiment/test.parquet - 配置名称:语义文本相似度(sts) 数据文件: - 划分集:训练集,路径:data/sts/train.parquet - 划分集:验证集,路径:data/sts/validation.parquet - 划分集:测试集,路径:data/sts/test.parquet - 配置名称:主题分类(topic) 数据文件: - 划分集:训练集,路径:data/topic/train.parquet - 划分集:验证集,路径:data/topic/validation.parquet - 划分集:测试集,路径:data/topic/test.parquet - 配置名称:词义消歧(wsd) 数据文件: - 划分集:训练集,路径:data/wsd/train.parquet - 划分集:验证集,路径:data/wsd/validation.parquet - 划分集:测试集,路径:data/wsd/test.parquet - 配置名称:跨语言自然语言推理(xlni) 数据文件: - 划分集:训练集,路径:data/xlni/train.parquet - 划分集:验证集,路径:data/xlni/validation.parquet - 划分集:测试集,路径:data/xlni/test.parquet # ORCA – 阿拉伯语言理解基准测试集 本数据集由原始 [`wissamantoun/orca_hf`](https://huggingface.co/datasets/wissamantoun/orca_hf) 数据集脚本转换为Parquet格式文件而来。 ## 使用方法 python from datasets import load_dataset # 加载指定配置的数据集 ds = load_dataset("PATH/orca_parquet", name="sentiment") # 加载全部配置的数据集 ds = load_dataset("PATH/orca_parquet")

提供机构:
wissamantoun
二维码
社区交流群
二维码
科研交流群
商业服务