遇见数据集

建筑行业土地交易市场问数垂类大模型语料数据

收藏
浙江省数据知识产权登记平台2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

本数据采集公司平台系统中土地交易监测与竞标分析数据,专为训练建筑行业土地市场分析领域垂类大语言模型而构建。企业在参与土地竞标决策时,需要系统分析历史成交数据以评估地块价值和竞争态势,传统模式下需逐个查阅积累的土地交易监测数据,信息分散在不同系统和文件中,价格波动趋势难以高效追踪。土地成交价格受区域规划、政策调控、市场供需等多重因素影响,价格波动频繁且趋势难以把握。土地交易数据涉及地块位置、用途、成交价、溢价率等十余个维度的信息,传统的人工整理方式效率低下。本数据采用Text-to-SQL(自然语言转SQL)技术路径,覆盖地块基本信息查询、土地用途查询、成交价格查询、占地面积查询、溢价率查询、用途分布统计、价格范围筛选、日期范围查询、多条件组合查询、土地市场综合分析查询等18种典型市场分析场景。企业可基于本语料数据的“指标名称”“问题查询”等字段内容,适配自身数据表结构(如替换建表语句中的表名、字段名),快速启用文字转SQL功能进行复用。本数据产品作为稀缺的、高质量的垂直领域语料,对推动建筑行业土地市场分析智能化发展提供了有力支撑,对建筑行业数据要素价值释放和AI技术应用落地具有重要意义1. 数据清洗与标准化: 对原始土地交易监测数据进行多维度清洗处理:(1)脱敏处理:企业名称采用"前2字+**+后4字"的脱敏规则,地址信息采用"省市+***"的脱敏规则,确保数据可用性的同时保护企业隐私和商业机密;(2)数据标准化:统一日期格式、金额单位、面积单位等数据表达规范,数值字段保留两位小数精度;(3)异常样本保留:对查询结果为"无匹配数据"的样本予以保留,用于训练模型识别边界查询和空结果场景,提升模型的鲁棒性。 2. 问题分类与结构化: 将自然语言问题按土地交易市场分析场景归类为18种类型:地块基本信息查询、用途分布统计、价格范围筛选、日期范围查询等核心场景。同时按查询复杂度分为单条件查询、范围查询、多条件组合查询和综合分析查询四个维度。 3. 核心算法建模: (1)语义解析:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对用户自然语言问题进行深度语义解析,采用CRF序列标注技术提取问题中的关键查询条件(地块位置、价格范围、日期区间、土地用途、竞得人等),为后续SQL生成提供结构化输入。 (2)SQL生成:采用Text-to-SQL技术将自然语言问题自动转换为可执行的SQL查询语句。基于编码器-解码器(Encoder-Decoder)架构,编码器将自然语言问题和数据库Schema信息编码为语义向量表示,解码器逐Token生成对应的SQL语句,能够准确处理多条件组合、聚合统计、范围查询等复杂SQL语法结构。 (3)异常检测:采用IsolationForest(n_estimators=100, contamination=0.05)孤立森林算法对生成的语料进行异常检测,识别SQL语法错误、语义不一致、结果与问题不匹配等异常样本,异常语料过滤率不低于99%,确保训练语料的质量和可靠性。规则补充:(4)逻辑核验:由资深建筑行业土地市场分析专家对生成的语料进行最终核验,重点检查SQL语句的业务逻辑正确性、叙述式结果的信息完整性和表达准确性,确保每条训练样本符合行业实际业务场景。 4. 语料库持续迭代: 建立"应用-反馈-优化"闭环迭代机制:收集用户在实际使用中的问答日志,对回答不准确或用户不满意的样本进行专家审核和修正,定期更新土地交易监测数据和语料库,持续提升垂类大模型在土地市场分析领域的问数能力。

创建时间:
2026-05-19
搜集汇总
数据集介绍
建筑行业土地交易市场问数垂类大模型语料数据 数据集图片
背景与挑战
背景概述
该数据集聚焦建筑行业土地交易市场,专为训练垂类大语言模型而构建,采用Text-to-SQL技术将自然语言问题自动转换为SQL查询语句,覆盖地块信息、用途、价格、面积、溢价率等十余个维度,涉及18种典型市场分析场景。数据规模达15000条,经过脱敏标准化、问题分类、语义解析、SQL生成、异常检测及专家核验等处理流程,确保语料质量与业务逻辑正确性,旨在提升建筑行业土地市场分析的智能化水平。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务