Linguistic-AI-Infra-Dataset
收藏资源简介:
本项目是一个面向大模型语言学能力评测的标准数据库,基于Universal Dependencies的CoNLL-U测试集,将多语言、多树库的标注数据整理为统一JSONL格式,支持分词、词性标注、依存句法分析、转写等任务的自动评测,包含18种语言、135,180个句子级样本。
This project provides a standardized database for evaluating the linguistic proficiency of large language models (LLMs). Built upon the CoNLL-U test sets from Universal Dependencies, it organizes annotated multilingual and multi-treebank data into a unified JSONL format, enabling automatic evaluation for tasks such as word segmentation, part-of-speech (POS) tagging, dependency parsing, and transcription. The database contains 18 languages and a total of 135,180 sentence-level samples.
数据集概述
数据集名称:Linguistic-AI-Infra-Dataset
项目目标:构建一个面向大模型语言学能力评测的标准数据库,将多语言、多树库的 Universal Dependencies (UD) CoNLL-U 测试集数据整理为统一 JSONL 格式,支持在线评测、Prompt 评测、模型对比和错误分析。
建立初衷:原始 CoNLL-U 文件更适合语言学研究和传统 NLP 工具链,不适合直接作为在线评测系统的数据接口。本项目将 UD 测试集转换为标准数据库,实现题目抽取、模型回答收集和自动评分三件事,避免将标准答案直接暴露给模型,并使数据服务、评测逻辑和前端展示逐步独立演进。
当前版本:第一版可用形态,重点完成从 UD CoNLL-U test files 到统一 JSONL 数据集的转换。
数据集内容
-
数据规模:
- 18 种目标语言
- 135,180 个句子级样本
- 97 个正式 UD test
.conllu文件来源
-
目录结构:
Standard_Dataset/standard_dataset.jsonl:全量合并文件Standard_Dataset/by_language/*.jsonl:按语言拆分的文件(如Chinese_中文.jsonl、English_英语.jsonl等)Standard_Dataset/metadata.json:数据统计和 Schema 说明
数据格式
样本格式:每一行 JSONL 对应一个 UD 句子,保留来源信息和标准答案,不保留原始 CoNLL-U 块和 lemma。
核心字段:
id:标准样本 IDlanguage:语言英文名treebank:UD treebank 名称source_file:来源.conllu文件名sent_id:原始 UD 句子 IDparallel_id:可选,原始数据中存在时保留text:句子文本sentence_translit:可选,句子级转写answers:标准答案tasks_available:当前样本可用于评测的任务列表
特殊说明:dependency 中当 head_id 为 0 时,head_form 固定为 ROOT。
支持的任务
segmentation:分词结果,保留标点upos:UD 通用词性标注xpos:语言或树库特定词性标注,仅当整句所有 token 都有 XPOS 时提供dependency:依存句法标注,格式为[token_id, token_form, head_id, head_form, deprel]transliteration:token 级转写,仅当整句所有 token 都有MISC.Translit时提供
数据构建方式
转换脚本:scripts/build_standard_dataset.py
默认输入:Target_Conllus/
默认输出:Standard_Dataset/
构建规则:
- 一个 UD 句子转换为一个标准 JSONL 样本
- 跳过 multiword token 行(如
1-2) - 跳过 empty node 行(如
3.1) - 保留标点作为普通 token
xpos和transliteration采用整句可用策略- 依存关系同时保留 token ID、token form、head ID、head form 和 deprel
数据来源
- 数据基于 Universal Dependencies (UD) 的 CoNLL-U 格式测试集
- CoNLL-U 格式详细说明见:https://universaldependencies.org/format.html
- CoNLL-U 字段包括:ID、FORM、LEMMA、UPOS、XPOS、FEATS、HEAD、DEPREL、DEPS、MISC




