遇见数据集

cp2021-semantic-search-app

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集包含意大利 CP2021 职业分类体系下的 813 个 5 位代码及其对应的描述符文本。每个代码对应一个职业类别,描述符为简短的自然语言文本。该数据集主要用于将自由文本语义映射到最接近的 CP2021 5 位代码,可应用于职业编码、文本分类、语义相似度计算等任务。数据以 CSV 格式存储,每一行包含一个代码和其描述符,无额外标签。数据集由 Codifica semantica CP2021 应用提供,该应用使用 BAAI/bge-m3 模型和余弦相似度实现文本到代码的匹配。

The dataset contains 813 five-digit codes from the Italian CP2021 occupation classification system with their corresponding descriptor texts. Each code represents an occupation category, and the descriptor is a short natural language text. The dataset is primarily used for semantic mapping of free text to the closest CP2021 five-digit code, applicable to tasks such as occupation coding, text classification, and semantic similarity computation. Data is stored in CSV format, each row contains a code and its descriptor, without extra labels. The dataset is provided by the Codifica semantica CP2021 application, which uses the BAAI/bge-m3 model and cosine similarity to achieve text-to-code matching.

创建时间:
2026-09-29
原始信息汇总

Codifica semantica CP2021 (5 digit)

概述

  • 应用类型:语义编码应用
  • 功能:将自由文本分配最接近的5位CP2021代码
  • 核心技术:使用 BAAI/bge-m3 模型的嵌入和余弦相似度
  • SDK:Gradio

工作原理

  1. data/cp2021_5_6digit_descriptors.csv 包含813个5位CP2021描述符
  2. 首次启动时,app.py 计算描述符的嵌入并保存到 data/cp2021_embeddings.npy(在CPU上需要几分钟)
  3. 后续启动时,嵌入从文件重新读取:应用仅计算用户输入文本的嵌入,并按余弦相似度对代码排序
  4. 预计算嵌入的替代方法:运行 python build_knowledge_base.py

本地启动

bash pip install -r requirements.txt python app.py

Space内容

app.py parameters.py build_knowledge_base.py requirements.txt README.md data/cp2021_5_6digit_descriptors.csv

参数配置

  • 所有参数(模型、路径、结果数量、界面文本)均在 parameters.py 中定义

元数据

  • 标题:Codifica semantica CP2021
  • 表情符号:🧭
  • 颜色渐变:从蓝色到靛蓝
  • 固定:否
搜集汇总
数据集介绍
cp2021-semantic-search-app 数据集图片
构建方式
该数据集的构建依托于语义编码技术,旨在将自由文本映射至意大利CP2021分类体系中的五位数字代码。其核心资源为data/cp2021_5_6digit_descriptors.csv文件,内含813个CP2021五位描述符。构建流程首先借助BAAI/bge-m3模型对全部描述符进行嵌入计算,生成高维向量表示并存储为data/cp2021_embeddings.npy文件。该嵌入过程在首次启动时执行,CPU环境下需耗时数分钟,后续可通过运行build_knowledge_base.py脚本实现预计算,从而避免重复运算,确保知识库的即时可用性。
特点
数据集的特点体现在其语义匹配机制与结构化参数配置上。通过余弦相似度对用户输入文本的嵌入向量与预计算的描述符嵌入进行比对,系统能够高效排序并返回最接近的CP2021代码。所有关键参数,包括所用模型、文件路径、返回结果数量及界面文本,均集中定义于parameters.py中,便于灵活调整。该设计兼顾了计算效率与可维护性,适用于需要快速分类的应用场景,且对首次运行与后续运行做了明确区分,优化了资源利用。
使用方法
使用该数据集时,用户需先安装依赖项,执行pip install -r requirements.txt,随后运行python app.py启动本地服务。应用界面允许输入自由文本,系统自动计算其嵌入并基于余弦相似度返回最匹配的五位CP2021代码。为提升响应速度,建议提前运行python build_knowledge_base.py以预生成嵌入文件。Space内包含app.py、parameters.py、build_knowledge_base.py、requirements.txt及数据文件夹,所有配置均通过parameters.py进行统一管理,确保操作的一致性与可重复性。
背景与挑战
背景概述
在语义检索与文本分类的交叉领域,CP2021编码体系为意大利经济活动提供了标准化的分类框架。为降低人工归类成本并提升检索效率,研究人员基于BAAI/bge-m3多语言嵌入模型构建了cp2021-semantic-search-app数据集,将自由的文本描述映射至五位数CP2021编码。该数据集包含813个五位数描述符,通过余弦相似度实现语义匹配,其核心研究问题在于如何利用稠密向量表示弥合自然语言表述与结构化分类代码之间的语义鸿沟。该工作为经济统计、自动化归档以及语义搜索系统提供了可复用的知识库与评估基准,推动了多语言嵌入模型在专业领域分类任务中的落地应用。
当前挑战
该数据集所应对的领域问题在于自由文本与标准经济活动编码之间的精准对齐,这要求模型在语义层面区分高度相似但编码不同的经济类别。构建过程中的挑战同样突出:需为813个描述符生成高质量嵌入,并在CPU环境下首次计算时耗时数分钟,增加了部署与迭代的复杂度;同时,多语言嵌入模型对意大利语专业术语的表征能力尚待验证,可能影响相似度排序的准确性。此外,五位数编码粒度较细,类间语义差异微弱,易导致检索结果混淆,而数据集中未提供大规模人工标注的验证集,限制了模型性能的量化评估。
常用场景
经典使用场景
在文本分类与语义编码领域,该数据集构建了一个基于稠密向量检索的语义匹配应用,其经典使用场景在于将自由文本自动映射至CP2021五位数编码体系。借助BAAI/bge-m3模型生成的嵌入表示与余弦相似度排序,系统能够从813个描述符中精准定位最贴近的编码类别,为税务、统计及行政文本的自动化归类提供了可复现的语义检索范式。
解决学术问题
该数据集直面学术研究中长期存在的短文本多分类与语义鸿沟问题,即自由表述与标准编码体系之间缺乏直接映射关系。通过预计算描述符嵌入并采用余弦相似度进行近邻搜索,它有效缓解了传统关键词匹配在语义泛化上的不足,为语义文本相似度、零样本分类及嵌入空间对齐等研究提供了实证基准与可操作框架。
衍生相关工作
围绕该数据集,衍生出若干经典工作,包括基于多语言嵌入模型的编码检索流程优化、嵌入预计算与缓存机制的工程实现,以及面向编码体系的相似度阈值调优与结果重排策略。这些工作共同推动了语义检索在标准化编码场景中的落地,并为后续多粒度编码映射与跨语言编码匹配研究奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务