TechWolf/Skill-extraction-SkillSkape-graded
收藏资源简介:
该数据集名为skill-extraction-skillskape-graded,是一个用于技能提取任务的分级相关性标注数据集。它基于来自`jjzha/skillskape`数据集的句子,并针对ESCO(欧洲技能、能力、资格和职业)v1.1.0技能分类体系进行了相关性标注。数据集的布局遵循BEIR(信息检索基准)惯例,可直接用于MTEB(大规模文本嵌入基准)风格的检索评估器。数据集包含三个主要配置:queries(查询,包含100个句子及其ID)、corpus(语料库,包含13,891个ESCO技能条目,每个条目有技能URI、英文首选标签、英文描述和ESCO版本信息)和qrels(查询-文档相关性判断,包含1,389,100行数据,每行有查询ID、语料库ID和相关性分数)。相关性分数采用0-4的等级标度,其中0表示不相关,4表示最相关。每个查询都针对所有13,891个ESCO技能进行了标注(即每个查询有13,891行qrels数据)。数据集分为验证集(validation split)和测试集(test split)。验证集已完全标注了0-4的分级相关性;测试集目前仅提供二进制相关性标注(1表示真正相关,0表示不相关),其细粒度分级标注将在RecSys-HR挑战赛结束后发布。数据来源于欧洲委员会的ESCO分类(CC BY 4.0许可)和`jjzha/skillskape`数据集(同样CC BY 4.0许可),标注本身也以CC BY 4.0许可发布。
The dataset skill-extraction-skillskape-graded provides graded-relevance annotations for sentences from the `jjzha/skillskape` dataset against the ESCO v1.1.0 skill taxonomy. Its layout follows the BEIR convention, making it a drop-in for MTEB-style retrieval evaluators. It includes three configs: queries (100 sentences with IDs), corpus (13,891 ESCO skill entries with URIs, English preferred labels, descriptions, and ESCO version), and qrels (1,389,100 rows of query-document relevance judgments with scores on a 0-4 scale, where higher scores indicate greater relevance). Every query is annotated against all 13,891 ESCO skills. The dataset has validation and test splits: the validation split is fully graded (0-4), while the test split currently has binary relevance labels (1 for genuinely relevant, 0 otherwise), with fine-grained graded annotations withheld for an ongoing challenge and to be released later. Data sources include the ESCO classification (CC BY 4.0) and `jjzha/skillskape` (CC BY 4.0), with annotations released under CC BY 4.0.




