tabular-data-to-business-glossaries-annotation-dataset
收藏资源简介:
这是一个从data.gov收集的表格数据集,通过大型语言模型标注了业务词汇表。数据集包括从data.gov收集的226个表格数据、各种业务词汇表以及表格数据与业务词汇表实体之间的对齐。数据集的元数据包括发布组织、数据集名称、列名、标签列表、主题、访问级别和许可证。
This is a tabular dataset sourced from data.gov, where business vocabularies have been annotated using Large Language Models (LLMs). The dataset contains 226 tabular data entries collected from data.gov, a diverse set of business vocabularies, as well as the alignment relationships between entities in the tabular data and those in the business vocabularies. The metadata associated with the dataset includes the publishing organization, dataset name, column names, tag list, topics, access level, and license.
数据集概述
1. 数据集描述
该数据集包含从data.gov收集的表格数据(数据集和列)、各种业务术语表以及表格数据与业务术语表实体之间的对齐信息。数据集的选择基于以下原因:
- 易于使用的API
- 大量公共和开源数据
- 表格数据集带有主题和标签列表
- 表格列具有有意义的名称
数据集内容
| 内容描述 | 说明 |
|---|---|
| data/ | 收集的表格数据,以csv文件形式存储 |
| metadata/ | 数据集、列、主题和标签的元数据 |
| business-glossaries/ | 业务术语表,以csv文件形式存储 |
| alignments/ | 列和数据集与业务术语表的对齐信息 |
| figures/ | 统计图表 |
| scripts/ | 用于数据集生成的Python脚本 |
2. 数据集构建
2.1. 数据收集和准备
从data.gov收集了226个与交通领域相关的数据集(表格)。数据集的统计信息如下:
| 统计信息 | 数值 |
|---|---|
| 数据集数量 | 226 |
| 列数量 | 5232 |
| 每个数据集的最大列数 | 381 |
| 每个数据集的最小列数 | 2 |
| 每个数据集的平均列数 | 23 |
| 每个数据集的最大行数 | 100 |
| 每个数据集的最小行数 | 4 |
| 每个数据集的平均行数 | 62 |
每个数据集的元数据包括发布组织、数据集名称、列名称、标签列表、主题、访问级别和许可证。主题和标签经过清洗后,按主题分组(结果存储在theme_to_tags_metadata.json),共得到34个主题,每个主题有相应的标签列表。
2.2. LLM生成的业务术语表
使用大型语言模型mistralai/Mistral-7B-Instruct-v0.3生成业务术语表。每个主题的标签列表作为输入,LLM生成与主题和标签相关的业务概念层次结构。业务术语表的统计信息如下:
| 统计信息 | 数值 |
|---|---|
| 业务术语表数量 | 34 |
| 每个术语表的最大业务实体数 | 26 |
| 每个术语表的最小业务实体数 | 4 |
| 每个术语表的平均业务实体数 | 14 |
| 每个术语表的最大层次数 | 9 |
| 每个术语表的最小层次数 | 2 |
| 每个术语表的平均层次数 | 4 |
2.3. LLM生成的对齐信息
使用相同的LLM模型生成对齐信息。对于每个数据集,LLM生成数据集列与相应业务术语表实体之间的对齐信息。对齐信息的统计信息如下:
| 统计信息 | 数值 |
|---|---|
| 对齐的列数量 | 1017 |
| 对齐列的比率 | 19.02% |
| 对齐的数据集数量 | 226 |
| 对齐数据集的比率 | 100% |
3. 许可证
该数据集遵循CC BY-NC-SA 4.0许可证。部分数据集受特定许可证约束,详见column_and_dataset_metadata.csv。




