建筑企业关联关系图谱垂类大模型语料数据
收藏资源简介:
该数据可用于训练建筑行业企业关联关系分析垂类大语言模型,使其能够深度理解企业经营管理过程中对于关联方查询、股权穿透、高管交叉任职等方向的自然语言问题,并准确转化为对应的SQL查询语句,从而实现企业关联关系数据的高效查询与图谱分析。依托建设通平台整合的工商登记、招投标公告、企业年报、司法信息等多源数据构建标准化语料体系,模型经训练后可精准理解"股权投资""高管交叉""投标关联""母子公司""分支机构"等关联关系特有需求,建筑行业企业可基于本语料数据的"指标名称""问题查询"等字段内容,适配自身关联关系数据表结构(如替换建表语句中的表名、字段名),通过自然语言快速启用文字转SQL功能进行复用。本数据也为建筑行业提供稀缺的、高质量的关联关系分析垂直领域语料库,支撑意图识别、自然语言处理等核心技术的研发与评测,推动建筑企业关联关系数据分析标准的建立与企业画像技术的发展。1. 数据清洗与标准化 数据清洗:对从建设通平台整合的工商登记、招投标公告、企业年报、司法信息等多源原始数据进行清洗,剔除重复关联记录、缺失关键字段(如企业名称、关系类型)的数据及存在逻辑矛盾的样本。例如,持股比例超过100%、投资金额为负值等异常记录均予以剔除。表格中"结果输出"为"无匹配数据"的样本,作为查询无返回结果的标准语料被保留,增强了模型对数据缺失场景的理解能力。 格式统一:统一关系类型名称(如"高管交叉""投标关联")、人员职务表述(如"法定代表人""股东")和SQL语法风格,确保语料的规范性和一致性。对建表语句进行格式化,统一字段类型和注释风格。 2. 问题分类与结构化 按照企业关联关系分析的特定场景对问题进行归类,主要包括企业关联方总览、关系类型筛选、高管交叉任职查询、股权穿透分析、投标关联查询、项目合作分析、母子公司与分支机构查询、关联人员任职查询、法定代表人关联查询及关联关系数量统计等,确保语料对企业关联关系分析核心场景的全面覆盖。 3. 核心算法建模 (1)语义解析与要素提取:采用基于规则和行业词典的文本分析方法,对自然语言问题进行解析,精准提取关键要素。针对关联关系领域的特有表述(如"实控人""一致行动人""交叉持股""串标""挂靠"等),构建关联术语同义词映射表,将口语化表述归一化为标准关系类型名称。同时提取查询对象(企业A/企业B/人员/项目)、关系类型、筛选条件(地区、持股比例、投资金额、时间范围)及聚合维度等关键要素。 (2)SQL语句生成:基于预定义的"关联术语-字段"映射规则和"查询意图-过滤条件"映射规则,自动生成标准化的SQL查询语句。映射规则覆盖双向企业匹配(enterprise_name_a OR enterprise_name_b)、多条件组合(AND/OR)、排序(ORDER BY)、分页(LIMIT)、聚合函数(COUNT/SUM/AVG)、分组统计(GROUP BY)及日期范围查询(BETWEEN)等SQL语法结构,重点强化双向关系匹配和多维度组合查询的SQL生成能力。




