遇见数据集

Linguistic-AI-Infra-Dataset

收藏
github2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

本项目是一个面向大模型语言学能力评测的标准数据库,基于Universal Dependencies的CoNLL-U测试集,将多语言、多树库的标注数据整理为统一JSONL格式,支持分词、词性标注、依存句法分析、转写等任务的自动评测,包含18种语言、135,180个句子级样本。

This project provides a standardized database for evaluating the linguistic proficiency of large language models (LLMs). Built upon the CoNLL-U test sets from Universal Dependencies, it organizes annotated multilingual and multi-treebank data into a unified JSONL format, enabling automatic evaluation for tasks such as word segmentation, part-of-speech (POS) tagging, dependency parsing, and transcription. The database contains 18 languages and a total of 135,180 sentence-level samples.

创建时间:
2026-07-09
原始信息汇总

数据集概述

数据集名称:Linguistic-AI-Infra-Dataset

项目目标:构建一个面向大模型语言学能力评测的标准数据库,将多语言、多树库的 Universal Dependencies (UD) CoNLL-U 测试集数据整理为统一 JSONL 格式,支持在线评测、Prompt 评测、模型对比和错误分析。

建立初衷:原始 CoNLL-U 文件更适合语言学研究和传统 NLP 工具链,不适合直接作为在线评测系统的数据接口。本项目将 UD 测试集转换为标准数据库,实现题目抽取、模型回答收集和自动评分三件事,避免将标准答案直接暴露给模型,并使数据服务、评测逻辑和前端展示逐步独立演进。

当前版本:第一版可用形态,重点完成从 UD CoNLL-U test files 到统一 JSONL 数据集的转换。

数据集内容

  • 数据规模

    • 18 种目标语言
    • 135,180 个句子级样本
    • 97 个正式 UD test .conllu 文件来源
  • 目录结构

    • Standard_Dataset/standard_dataset.jsonl:全量合并文件
    • Standard_Dataset/by_language/*.jsonl:按语言拆分的文件(如 Chinese_中文.jsonlEnglish_英语.jsonl 等)
    • Standard_Dataset/metadata.json:数据统计和 Schema 说明

数据格式

样本格式:每一行 JSONL 对应一个 UD 句子,保留来源信息和标准答案,不保留原始 CoNLL-U 块和 lemma。

核心字段

  • id:标准样本 ID
  • language:语言英文名
  • treebank:UD treebank 名称
  • source_file:来源 .conllu 文件名
  • sent_id:原始 UD 句子 ID
  • parallel_id:可选,原始数据中存在时保留
  • text:句子文本
  • sentence_translit:可选,句子级转写
  • answers:标准答案
  • tasks_available:当前样本可用于评测的任务列表

特殊说明dependency 中当 head_id0 时,head_form 固定为 ROOT

支持的任务

  • segmentation:分词结果,保留标点
  • upos:UD 通用词性标注
  • xpos:语言或树库特定词性标注,仅当整句所有 token 都有 XPOS 时提供
  • dependency:依存句法标注,格式为 [token_id, token_form, head_id, head_form, deprel]
  • transliteration:token 级转写,仅当整句所有 token 都有 MISC.Translit 时提供

数据构建方式

转换脚本scripts/build_standard_dataset.py

默认输入Target_Conllus/

默认输出Standard_Dataset/

构建规则

  • 一个 UD 句子转换为一个标准 JSONL 样本
  • 跳过 multiword token 行(如 1-2
  • 跳过 empty node 行(如 3.1
  • 保留标点作为普通 token
  • xpostransliteration 采用整句可用策略
  • 依存关系同时保留 token ID、token form、head ID、head form 和 deprel

数据来源

  • 数据基于 Universal Dependencies (UD) 的 CoNLL-U 格式测试集
  • CoNLL-U 格式详细说明见:https://universaldependencies.org/format.html
  • CoNLL-U 字段包括:ID、FORM、LEMMA、UPOS、XPOS、FEATS、HEAD、DEPREL、DEPS、MISC
搜集汇总
数据集介绍
Linguistic-AI-Infra-Dataset 数据集图片
构建方式
该数据集依托于 Universal Dependencies 项目中的 CoNLL-U 格式测试集,经由一个统一的构建脚本将多语言、多树库的标注数据转换为标准 JSONL 格式。具体而言,每一句 UD 句子对应一个 JSONL 样本,构建过程中跳过 multiword token 行与 empty node 行,保留标点作为普通 token,并采用整句可用策略处理 xpos 和 transliteration 字段。依存关系字段同时记录 token ID、token form、head ID、head form 及 deprel,确保结构完备。构建脚本位于 scripts/build_standard_dataset.py,默认读取 Target_Conllus/ 目录下的源文件,输出至 Standard_Dataset/,并附有元数据文件以记录统计信息与 schema 说明。
特点
该数据集具备多项突出特性。首先,它覆盖了18种目标语言,包含135,180个句子级样本,来源跨越97个正式 UD 测试集,语言与树库多样性显著。其次,样本格式将标准答案与待评测输入严格分离,通过隐藏的 answers 字段实现自动化评分,避免了答案泄露风险。此外,数据集支持分词、词性标注(通用与特定于语言的标签)、依存句法分析以及转写等多种语言学任务,任务兼容性广泛。数据按语言拆分存储,便于聚焦特定语言的评测,而全量合并文件则适合跨语言对比,整体设计兼具可扩展性与细粒度追踪能力。
使用方法
使用该数据集时,用户可直接读取 Standard_Dataset/standard_dataset.jsonl 全量文件或按语言访问 by_language/ 目录下的子文件。每个样本包含 text 字段提供句子文本,tasks_available 字段指明可用任务,用户据此抽取题目,仅向模型提供句子文本与任务要求,避免暴露隐藏的 answers 字段中的标准答案。模型输出预测结果后,系统后端可利用 answers 字段进行自动评分与对比统计。该设计支持构建在线评测服务,允许数据服务、评测逻辑与前端展示独立演进,同时便于开展 Prompt 评测、模型对比及错误分析等下游应用。
背景与挑战
背景概述
随着大语言模型在自然语言处理领域的蓬勃发展,如何系统、公正地评测其语言学能力成为学术界与工业界共同关注的焦点。Universal Dependencies(UD)项目通过提供跨语言、高质量的句法标注资源,为语言学分析奠定了坚实基础,但其原始CoNLL-U格式更适用于传统NLP工具链,难以直接服务于大模型在线评测系统。为此,该数据集于2024年由相关研究团队创建,旨在构建一个面向大模型语言学评测的标准数据库。该工作以UD测试集为蓝本,整合了18种目标语言、97个正式树库中的135,180个句子级样本,并将多语言、多树库的标注数据统一为JSONL格式,从而支持分词、词性标注、依存句法分析及转写等任务的自动评测。这一标准化数据集不仅为大模型提供了统一的跨语言评测样本,还通过分离标准答案与待评测输入,促进了数据服务、评测逻辑和前端展示的独立演进,对推动大模型语言学能力评测的规范化与自动化具有重要影响。
当前挑战
该领域面临的核心挑战在于如何构建一个既全面又公平的多语言语言学评测体系。大模型在跨语言、低资源语言、句法结构及词性识别上的能力差异难以直接比较,而现有UD资源虽质量较高,却因标注风格各异、格式不统一而难以直接用于评测。具体到构建过程,挑战包括:其一,多语言、多树库的标注数据需整合为统一格式,必须处理不同语言选择的特定标注标签及语义关系,确保数据兼容性与可比性;其二,需跳过multiword token与empty node等特殊行,并保留标点作为普通token,同时采用整句可用策略决定XPOS与转写字段的提供,这增加了数据清洗与转换的复杂度;其三,标准答案需与模型输入严格分离,避免信息泄露,同时要设计稳定的自动评分逻辑,支持分词、词性标注、依存关系等多种任务的精确比对。这些挑战共同决定了数据集的可用性与评测的可靠性。
常用场景
经典使用场景
在自然语言处理领域,Linguistic-AI-Infra-Dataset最为经典的应用场景是作为大模型多语言语言学能力的标准化评测基准。该数据集以Universal Dependencies框架下的CoNLL-U测试集为基石,系统整合了18种语言、135,180个句子级样本,涵盖分词、词性标注、依存句法分析及转写等核心语言学任务。研究者可直接向模型输入句子文本与任务要求,利用隐藏的标准答案进行自动评分,从而精准评估模型在跨语言、低资源语言及细粒度句法结构上的表现。这种设计不仅规避了标准答案暴露的风险,更通过统一JSONL格式实现了评测流程的解耦与复用,为模型间的公平对比与能力诊断提供了坚实的数据支撑。
解决学术问题
该数据集有效解决了大模型语言学能力评测中普遍存在的跨语言可比性不足与数据格式碎片化问题。在学术研究层面,它填补了传统CoNLL-U格式难以直接对接现代在线评测系统的空白,使研究者能够系统探究模型在分词一致性、词性识别准确性、依存关系理解深度等维度的差异。通过保留样本来源、语言及树库信息,数据集支持细粒度的错误分析与语言特定现象追踪,为揭示模型在形态丰富语言或句法歧义结构上的短板提供了实证基础。其设计理念推动了评测范式从孤立任务向多语言、多任务联合评估的演进,深化了学术界对大模型语言学泛化能力的理论认知。
衍生相关工作
基于Linguistic-AI-Infra-Dataset,学界与工业界已衍生出多项经典工作。在数据构建层面,后续工作扩展了其覆盖范围,从初始的18种语言向更丰富的低资源语种与方言演进,并引入了情感语义等高层级语言学任务。在评测方法论上,研究者借鉴其抽题-回答-评分架构,开发了支持多轮交互与上下文理解的动态评测框架。此外,该数据集催生了一系列模型分析工具,通过其细粒度标注的能力,揭示了不同架构模型(如编码器-解码器与仅解码器模型)在依存句法建模上的差异化策略。这些衍生工作共同强化了语言学评测在AI模型迭代中的核心地位,并推动了标准化数据集生态的繁荣。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务