遇见数据集

yapay_zeka_turkce_mmlu_bolum_sonuclari

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集包含68个样本,每个样本由一个model字段(字符串类型,可能表示模型名称或标识符)和55个以土耳其语命名的数值字段组成。这些数值字段涵盖了广泛的土耳其教育、考试和职业领域,主要包括:1) 标准化考试(如KPSS公务员考试、TUS医学专科考试、大学入学基础科学考试、驾照考试);2) 学科领域(如哲学、历史、土耳其语言文学、宗教知识、社会学、经济学);3) 职业与专业领域(如烹饪、媒体与传播、物流、会计与税务、农业、旅游与酒店管理、老年护理、儿童发展、人力资源管理、企业管理等)。数据集形式为结构化表格,适用于多任务评估、教育数据分析或跨领域模型性能比较等场景,特别关注土耳其语语境下的知识与应用领域。

This dataset contains 68 samples, each consisting of a model field (string type, possibly representing a model name or identifier) and 55 numerical fields named in Turkish. These numerical fields cover a wide range of Turkish education, examination, and professional domains, including: 1) Standardized exams (such as KPSS civil service exam, TUS medical specialty exam, university entrance basic science exam, drivers license exam); 2) Academic disciplines (such as philosophy, history, Turkish language and literature, religious knowledge, sociology, economics); 3) Vocational and professional fields (such as cooking, media and communication, logistics, accounting and taxation, agriculture, tourism and hospitality, elderly care, child development, human resources management, business administration, etc.). The dataset is in structured tabular format and is suitable for multi-task evaluation, educational data analysis, or cross-domain model performance comparison, with a particular focus on knowledge and application contexts in Turkish.

创建时间:
2026-07-23
原始信息汇总
  • 数据集名称: yapay_zeka_turkce_mmlu_bolum_sonuclari
  • 数据集来源: Hugging Face,地址为 https://huggingface.co/datasets/uzcaliskan/yapay_zeka_turkce_mmlu_bolum_sonuclari
  • 数据集描述: 该数据集包含多个土耳其语考试或领域(如KPSS、TUS、历史、哲学等)中不同模型的平均表现结果。
  • 主要特征:
    • model: 模型名称(字符串类型)
    • ortalama: 平均分(浮点数)
    • KPSS: 整数型分数
    • Üniversite Giriş Sınavı Temel Bilimler: 大学入学考试基础科学分数(浮点数)
    • TUS: 医学专业入学考试分数(浮点数)
    • Futbol: 足球知识分数(整数)
    • Kim 500 Milyar İster: 电视问答节目分数(整数)
    • Ehliyet Sınavı: 驾照考试分数(整数)
    • KPSS Denemeleri: KPSS模拟考试分数(整数)
    • Felsefe: 哲学分数(整数)
    • Tarih: 历史分数(浮点数)
    • Türk Dili ve Edebiyatı: 土耳其语语言文学分数(浮点数)
    • Dini Bilgiler: 宗教知识分数(整数)
    • Adalet: 司法领域分数(整数)
    • Sağlık Yönetimi: 健康管理分数(浮点数)
    • İlahiyat: 神学分数(浮点数)
    • Siyer: 伊斯兰先知传记分数(浮点数)
    • Aşçılık: 烹饪分数(整数)
    • Medya ve İletişim: 媒体与传播分数(整数)
    • AUZEF: 安纳托利亚大学开放教育学院相关分数(整数)
    • Acild Durum ve Afet Yönetimi: 紧急情况与灾害管理分数(整数)
    • Bankacılık ve Sigortacılık: 银行与保险分数(整数)
    • Büro Yönetimi ve Yönetici Asistanlığı: 办公室管理与行政助理分数(整数)
    • DHBT: 宗教知识考试分数(整数)
    • Dış Ticaret: 对外贸易分数(整数)
    • Elektrik Enerjisi Üretim,İletim ve Dağıtımı: 电能生产、传输与分配分数(整数)
    • Emlak ve Emlak Yönetimi: 房地产与物业管理分数(整数)
    • Ev İdaresi: 家政管理分数(整数)
    • Fotoğrafçılık ve Kameramanlık: 摄影与摄像分数(整数)
    • Halkla İlişkiler ve Reklamcılık: 公共关系与广告分数(整数)
    • Halkla İlişkiler ve Tanıtım: 公共关系与推广分数(整数)
    • Havacılık Yönetimi: 航空管理分数(整数)
    • Kamu Yönetimi: 公共管理分数(整数)
    • Kültürel Miras ve Turizm: 文化遗产与旅游分数(整数)
    • Laborant ve Veteriner Sağlık: 实验员与兽医健康分数(整数)
    • Lojistik: 物流分数(整数)
    • Maliye: 财政学分数(整数)
    • Marka İletişimi: 品牌传播分数(整数)
    • Menkul Kıymetler ve Sermaye Piyasası: 证券与资本市场分数(整数)
    • Muhasebe ve Vergi Uygulamaları: 会计与税务应用分数(整数)
    • Okul Öncesi Öğretmenliği: 学前教育教师分数(整数)
    • Parakende Satış ve Mağaza Yöneticiliği: 零售与店铺管理分数(浮点数)
    • Radyo ve Televizyon Programcılığı: 广播与电视节目制作分数(浮点数)
    • Sağlık Kurumları İşletmeciliği: 医疗机构管理分数(浮点数)
    • Sosyal Hizmet: 社会工作分数(浮点数)
    • Sosyal Hizmetler: 社会服务分数(浮点数)
    • Sosyoloji: 社会学分数(浮点数)
    • Spor Yönetimi: 体育管理分数(浮点数)
    • Tarım: 农业分数(浮点数)
    • Turizm ve Otel İşletmeciliği: 旅游与酒店管理分数(浮点数)
    • Turizm ve Seyehat Hizmetleri: 旅游与旅行服务分数(浮点数)
    • Tıbbi Dökümantasyon ve Sekreterlik: 医疗文档与秘书分数(浮点数)
    • Uluslar Arası İlişkiler: 国际关系分数(浮点数)
    • Uluslararası Ticaret ve Lojistik Yönetimi: 国际贸易与物流管理分数(浮点数)
    • Yaşlı Bakımı: 老年护理分数(浮点数)
    • Yerel Yönetimler: 地方政府分数(浮点数)
    • Yönetim Bİlişim Sistemleri: 管理信息系统分数(浮点数)
    • Çalışma Ekonomisi ve Endüstri İlişkileri: 劳动经济学与产业关系分数(浮点数)
    • Çağrı Merkezi Hizmetleri: 呼叫中心服务分数(浮点数)
    • Çocuk Gelişimi: 儿童发展分数(浮点数)
    • Özel Koruma ve Güvenlik: 特殊保护与安全分数(浮点数)
    • İktisat: 经济学分数(浮点数)
    • İnsan Kaynakları Yönetimi: 人力资源管理分数(浮点数)
    • İşletme Yönetimi: 企业管理分数(浮点数)
  • 数据集划分: 仅包含训练集(train),共68个样本,占用36022字节。
  • 配置文件: 默认配置(default),数据文件路径为 data/train-*
  • 下载大小: 49747字节。
  • 数据集大小: 36022字节。
搜集汇总
数据集介绍
yapay_zeka_turkce_mmlu_bolum_sonuclari 数据集图片
构建方式
该数据集名为yapay_zeka_turkce_mmlu_bolum_sonuclari,专注于记录土耳其语大语言模型在多领域考试中的表现。数据集通过收集多个模型在涵盖KPSS、大学入学考试基础科学、TUS、足球知识、宗教知识、法律、健康管理、旅游等多个土耳其语考试科目上的得分构建而成。每条数据包含模型名称、平均分以及各科目的具体分数,共计68个样本,涵盖了从学术到职业的广泛领域,形成了一幅模型能力的全景图。
使用方法
使用该数据集时,研究人员可将其作为土耳其语大语言模型的基准测试工具。通过对比不同模型在各科目上的得分,可以洞察模型在特定知识领域的优势与不足。数据以表格形式存储,包含模型名称和数值型分数,便于直接加载到数据分析框架中进行统计分析、可视化或作为模型评估指标。建议将平均分作为整体性能的粗略参考,同时深入分析各科目分数以获取更细致的评价。
背景与挑战
背景概述
yapay_zeka_turkce_mmlu_bolum_sonuclari数据集由土耳其研究机构构建,旨在评估大语言模型在土耳其语多学科知识上的表现。该数据集创建于人工智能与教育测评交叉领域兴起的背景下,通过系统收集土耳其各类国家级考试(如KPSS、TUS、大学入学考试等)及专业领域测试的题目,形成覆盖法律、医学、历史、宗教、工程等多达60余个科目的评估基准。其核心研究问题聚焦于量化模型在土耳其语特定文化语境中的知识储备与推理能力,为多语言自然语言处理评测提供了非英语语种的重要参照。该数据集的出现填补了土耳其语模型基准评估的空白,对推动低资源语言人工智能评测标准化具有开创性意义。
当前挑战
该数据集面临的首要挑战是评测任务的文化特异性和领域多样性,不同于通用的MMLU基准,土耳其语考试体系包含大量本土化知识点(如伊拉希亚特、锡耶尔等),对模型的文化理解能力提出严峻考验。构建过程中,不同科目试题的难度不均衡、评分标准不一以及官方试题的版权限制导致数据获取困难,虽最终整合了68条模型得分记录,但样本量较小且部分科目数据稀疏。此外,模型在跨领域知识整合中的表现差异显著,如“足球”与“埃希耶特”等科目得分为整数型,可能反映出评测粒度不足的问题,如何设计更精细的评估维度以捕捉模型深层推理能力,仍是该数据集待解决的关键难题。
常用场景
经典使用场景
在自然语言处理与人工智能领域,跨语言知识评估一直是衡量模型性能的重要维度。该数据集专为土耳其语场景设计,汇集了来自土耳其各类标准化考试与专业领域的试题结果数据,覆盖从法律、医学、工程到人文社科等数十个学科。其最经典的用途是作为土耳其语言模型的多任务基准测试集,研究者通过分析模型在不同科目中的得分表现,来全面评估其跨领域知识掌握程度与推理能力。
解决学术问题
该数据集有效解决了非英语语言模型在多样化知识评估中缺乏标准化基准的困境。长期以来,大规模语言模型的评测多聚焦于英语资源,导致对土耳其语等语种模型的泛化能力认知不足。通过构建涵盖多学科、多难度的结构化测评体系,该数据为研究者提供了可量化的工具,用于探查模型在专业领域知识迁移与细粒度推理中的薄弱环节,从而推动多语言与低资源语言智能系统的公平发展与性能提升。
实际应用
在实际应用中,该数据集可用于自动化评估与教育智能系统的开发。例如,教育科技公司可借助它训练能够模拟土耳其各类国家级考试(如KPSS、TUS、Ehliyet Sınavı)的人工智能辅导系统,实现个性化知识点诊断与学习路径规划。同时,企业也可将其作为人才筛选与职业能力评测的辅助工具,在医疗、法律、金融等垂直领域部署高度专业化的问答与客服系统,提升服务效率与准确性。
数据集最近研究
最新研究方向
该数据集聚焦于土耳其语大语言模型在多样化本土考试中的表现评估,涵盖KPSS、大学入学考试、TUS等61个领域,横跨人文、社科、法律、医学等学科。当前前沿研究方向在于利用此类细粒度基准,系统分析多语言模型在非英语场景下的知识深度与泛化能力,尤其关注土耳其语特定文化、制度与职业教育知识的掌握程度。随着LLM全球部署的加速,该数据集不仅为土耳其语NLP提供标准化评测依据,更揭示语言模型在低资源语言教育、职业资格认证等热点场景中的适配瓶颈,有力推动多语种AI公平性与实用性的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务