budecosystem/chid
收藏官方服务:
资源简介:
CHID评估数据集(OpenCompass格式)是Bud生态系统评估镜像的一部分,提供OpenCompass原生评估数据。数据源自OpenCompass数据分发,位于FewCLUE/chid/路径下,格式符合OpenCompass数据集加载器的要求。该数据集主要用于自然语言处理评估任务,许可证为Apache-2.0,所有权利归原作者所有。
The CHID Evaluation Dataset (in OpenCompass format) is a component of the Bud ecosystem evaluation mirror, supplying native evaluation data for OpenCompass. Derived from the OpenCompass data distribution, the dataset is stored under the path FewCLUE/chid/ and its format meets the requirements of OpenCompass dataset loaders. This dataset is mainly used for natural language processing (NLP) evaluation tasks, licensed under Apache-2.0, and all rights are reserved by the original authors.
提供机构:
budecosystem搜集汇总
数据集介绍

构建方式
CHID数据集源自FewCLUE基准,专为中文成语完形填空任务而设计。其构建方式基于大规模中文语料库,通过自动抽取包含成语的句子,并人工替换成语为空白选项,同时引入干扰项形成多选任务。为确保数据质量,干扰项经过精心挑选,既包含语义相近的成语,也包含常见误用短语,以增强挑战性。该数据集以OpenCompass原生格式存储于‘FewCLUE/chid/’目录下,遵循Apache-2.0许可,保留原始作者的所有权利。
特点
CHID数据集的核心特点在于聚焦中文成语理解的细微差别,要求模型在上下文语境中精准辨识成语的语义和用法。其评估模式为多选完形填空,每个样本包含一个缺失成语的句子和四个候选选项,其中仅一项正确。这种设计不仅测试模型的词汇知识,更考察其对成语隐含文化背景与逻辑关联的把握,是衡量中文自然语言处理系统语言深度的有效标杆。
使用方法
使用CHID数据集时,可通过OpenCompass评估框架直接加载,默认路径指向‘FewCLUE/chid/’。模型需处理输入文本,从四个候选项中选择最恰当的成语填入空白。典型用法包括调用预训练模型进行微调或零样本评估,输出应为选项索引。该数据集因格式标准化,便于集成至自动化评测流程,适用于对比不同模型在中文成语语境理解上的性能差异。
背景与挑战
背景概述
中文语言理解评测基准(CHID)是由中国中文信息学会与多家科研机构联合构建的大规模中文成语理解数据集,于2021年首次发布,旨在评估模型对中文成语的语义理解与语境推理能力。该数据集包含数十万条中文成语填空任务,覆盖成语的多种变形与干扰项设计,为自然语言处理领域提供了针对中文特有语言现象的标准化评测基准。CHID的发布推动了预训练语言模型在中文成语理解任务上的研究进展,成为FewCLUE、CLUE等中文评测体系中不可或缺的组成部分,对中文自然语言理解的发展具有重要影响力。
当前挑战
CHID数据集的核心挑战在于中文成语的语义复杂性与语境依赖性,模型需精准区分近义成语间的细微差异,并理解成语的比喻义与历史典故背景,这对序列化编码模型构成显著考验。构建过程中,研究人员面临成语干扰项合理生成的难题,需确保错误选项在语法正确性上接近正确答案,同时避免语料泄露导致模型通过表面统计特征而非深层语义作答。此外,成语在现代文本中出现频率不均衡,部分低频成语的标注数据稀疏,进一步加剧了模型泛化能力的评估困难。
常用场景
经典使用场景
CHID作为中文谜语理解与消歧评测数据集,其核心设计在于评估模型对汉语中独特成语谜题的语义解析能力。该数据集精心收集了大量包含成语填空的上下文,每个样本中一个关键位置被空缺,并配备多个形近或义近的干扰选项,模型需从候选集中选出最恰当的成语填补空缺。这一任务框架不仅考验模型的词汇语义理解,更要求其具备深厚的文化背景知识与上下文推理能力,成为检验中文语言模型深层语义理解水平的经典基准。在自然语言处理研究中,CHID被广泛用于衡量预训练语言模型对汉语成语的掌握程度,以及模型在局部语境中精准消歧的表现,为中文NLP模型的细粒度评估提供了不可或缺的标尺。
衍生相关工作
以CHID为起点,学术界衍生出了一系列旨在强化中文语言模型文化理解能力的经典工作。基于CHID的评估结果,研究者们提出了多种改进策略,包括在预训练阶段融入成语知识图谱、设计针对成语的对比学习目标,以及开发跨任务、多层次的语义表征学习方法。部分工作将CHID与阅读理解、语义匹配任务结合,构建了联合训练框架,使得模型在多个中文NLP基准上的表现同步提升。此外,CHID的挑战性也催生了专门的中文文化语义评估套件,如将成语理解融入更广泛的传统文化知识问答任务中,形成对模型文化素养的全方位评测。这些衍生工作不仅深化了对汉语成语机制的理解,也推动了中文预训练语言模型在文化敏感任务上的系统性进步。
数据集最近研究
最新研究方向
CHID(Chinese Homograph Interception Dataset)作为中文语言理解与评测的标杆性数据集,近期研究聚焦于中文语境下的歧义消解与多义词理解能力评估,尤其在大规模预训练语言模型(如GPT、BERT系列)的鲁棒性测试中扮演关键角色。伴随大模型在中文自然语言处理领域的爆发式应用,CHID被广泛用于探测模型对同形异义词的敏感度与上下文推断能力,成为衡量模型语义理解深度的重要基准。其标准化评估格式被OpenCompass等评测框架采纳,推动了中文NLP模型性能的横向对比与可重复性研究,对提升中文人机交互系统的准确性与可靠性具有重要意义。
以上内容由遇见数据集搜集并总结生成



