登录后查看消息通知
遇见数据集
杭州筑龙信息技术股份有限公司

杭州筑龙信息技术股份有限公司

企业

杭州筑龙信息技术股份有限公司成立于2008年,属软件和信息技术服务业,主营第二类增值电信业务。面向建筑市场分析、企业信用评估、建筑招投标智能查询等领域提供数据服务,开放建设通-建筑业大数据服务平台(建筑市场分析、企业信用评估)、建筑企业中标业绩智能分析垂类大模型语料数据(建筑招投标智能查询、自然语言转SQL)、建筑企业关联关系图谱垂类大模型语料数据(建筑企业关联关系分析、垂类大语言模型语料),支撑市场分析与定价决策。

建筑市场分析企业信用评估建筑招投标智能查询软件信息服务高新技术企业
成立于 2008 年浙江省https://www.cbi360.net/491748212@qq.com

数据概览

85
数据集总量
280
总浏览量
0
关注人数
2026-08-22
最近更新
分类统计

相关机构

  • 杭
    杭州壹东建筑设计有限公司
    拥有数据集:30个
    企业
  • 广
    广州食摄集摄影设计有限公司
    拥有数据集:12个
    企业
  • 浙
    浙江风驰机械有限公司
    拥有数据集:11个
    企业
  • 数
    数交科技(河南)有限公司
    拥有数据集:11个
    企业
  • 深
    深圳市方吉无限科技有限公司
    拥有数据集:10个
    企业

数据集列表

建筑行业资质标准AI知识问答语料数据
建筑资质知识问答
资质审查咨询
本数据产品面向建筑行业资质标准知识问答场景,构建涵盖15类建筑业企业资质、4个资质等级、12个问题分类的问答语料数据集。当前行业面临三大痛点:一是资质标准条文繁多,企业人员难以快速准确理解各类资质的人员配备、业绩要求、资产标准等具体规定;二是资质申请升级延续等流程复杂,企业常因对标准理解偏差导致申报材料不合规反复退回;三是行业缺乏系统化资质标准问答训练语料,现有大模型在建筑资质领域回答准确率低。本数据集覆盖资质等级划分、人员配备、企业业绩、企业资产、技术装备、资质申请等12个问题维度,可用于训练建筑资质标准知识问答大模型,支撑企业资质智能审查和在线咨询服务。
浙江省数据知识产权登记平台2026-08-21 更新20
建筑企业需求意图识别垂类大模型语料数据
建筑行业意图识别
自然语言转SQL
该数据可用于训练建筑企业需求意图识别垂类大语言模型,使其能够深度理解建筑企业在项目合作、采购寻源、资质服务、融资需求等业务场景中提交的自然语言需求描述,并准确转化为对应的SQL查询语句,从而实现需求数据的高效检索与意图分类分析。依托建设通平台整合的企业基础信息、需求原文、意图标注、项目类型、预算范围、紧急程度、需求来源等多源数据构建标准化语料体系,模型经训练后可精准理解"施工寻源""材料采购""资质代办""设备租赁""融资需求""政策咨询"等建筑行业特有需求意图,建筑行业企业可基于本语料数据的"指标名称""问题查询"等字段内容,适配自身需求数据表结构(如替换建表语句中的表名、字段名),快速启用文字转SQL功能进行复用。本数据也为建筑行业提供稀缺的、高质量的需求意图识别垂直领域语料库,支撑意图识别、自然语言处理等核心技术的研发与评测,推动建筑行业对于企业需求意图精准识别形成可量化评估的方向发展。同时对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化: 数据清洗:对从平台整合的原始数据进行清洗,剔除重复需求记录、缺失关键字段的数据及存在逻辑矛盾的样本。表格中"结果输出"为"无匹配数据"的样本,作为查询无返回结果的标准语料被保留,增强了模型对数据缺失场景的理解能力。 格式统一:统一意图类别划分标准(施工寻源/材料采购/资质服务/政策咨询等)、紧急程度等级(紧急/较急/一般/不急)、需求状态(待处理/跟进中/已签约/已关闭)和SQL语法风格,确保语料的规范性和一致性。对建表语句进行格式化,统一字段类型和注释风格。 2.问题分类与结构化:按照需求意图识别的特定场景对问题进行归类,主要包括需求意图总览、意图类别筛选、意图子类别筛选、多条件组合筛选及需求原文模糊查询等,确保语料对需求意图识别核心场景的全面覆盖。 3.核心算法建模: (1)语义解析与要素提取:采用基于规则和行业词典的文本分析方法,对自然语言问题进行解析,精准提取关键要素。针对需求意图识别领域的特有表述(如"找施工队""采购建材""代办资质"等),构建需求术语同义词映射表,将口语化表述归一化为标准意图类别和子类别查询条件。同时提取查询对象、筛选条件及聚合维度等关键要素。 (2)SQL语句生成:基于预定义的"需求术语-字段"映射规则和"查询意图-过滤条件"映射规则,自动生成标准化的SQL查询语句。映射规则覆盖多条件组合、排序、分页、聚合函数、分组统计及模糊匹配等SQL语法结构,重点强化多条件组合筛选和需求原文模糊查询的SQL生成能力。 规则补充: (3)异常值检测:对生成的SQL及其执行结果进行双重校验。一方面,利用LOF(局部异常因子)算法检测SQL语句的逻辑异常(如聚合函数缺失GROUP BY、多条件组合存在矛盾、LIKE通配符使用不当等);另一方面,结合IQR(四分位距)统计方法,识别结果中可能存在的异常值(如需求原文长度异常、关键词数量偏离正常范围等),并打标或过滤,确保语料质量。 (4)逻辑核验与业务对齐:对生成的"问题-SQL-结果"三元组进行最终核验。结合需求意图识别业务知识,判断SQL逻辑是否正确,确保语料不仅语法正确,更具备高度的业务适用性和准确性。 4. 语料库的持续迭代 构建语料库的闭环迭代机制。新产生的需求意图识别查询问题及其经核验的SQL语句会定期注入语料库,持续提升语料库对需求意图识别业务场景的覆盖度和数据质量。
浙江省数据知识产权登记平台2026-08-18 更新20
建筑行业评标报告关键信息智能提取大模型训练数据
建筑行业评标报告信息抽取
招投标文档智能处理
建筑行业招投标活动中,评标报告是记录评标过程和结果的核心文件,包含项目名称、招标人、评标方法、评标委员会人数、中标候选人、评标总分、技术标得分、商务标得分、评标日期等关键信息。传统模式下,这些信息依赖人工逐项阅读和录入,效率低下且易出错;大量评标报告堆积导致信息提取滞后,影响中标结果确认和项目跟进;不同地区评标报告的格式和表述差异大,人工提取难以保证一致性。本数据产品面向建筑行业评标报告关键信息智能提取场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型的标注语料数据集,训练大模型实现从非结构化文本中自动提取评标方法、中标候选人等9个关键信息字段。招标单位可实现评标信息自动化归档,投标企业可快速获取评标结果反馈,行业研究机构可批量获取评标数据用于竞争分析,推动建筑行业评标信息处理从人工模式向智能化方向发展。
浙江省数据知识产权登记平台2026-08-18 更新40
建筑行业评标专家回避风险智能识别大模型语料数据
评标专家回避风险识别
Text-to-SQL垂域语料
本数据专为训练建筑行业评标专家回避风险智能识别领域垂类大语言模型而构建。当前,建筑行业评标专家回避制度是保障招投标公平公正的重要机制,要求评标专家在存在利害关系时主动回避,但专家回避关系核查主要依赖人工审核,需要逐一比对专家与投标单位之间是否存在近亲属关系、经济利益关系、任职关系等多种回避情形,核查过程繁琐且遗漏风险高。同时,评标专家信息分散在各级住建部门、公共资源交易中心等多个平台,数据格式不统一,回避风险识别成本高,难以实现全面覆盖。本数据产品采用Text-to-SQL(自然语言转SQL)技术路径,紧密适配评标专家信息表结构,覆盖专家基本信息查询、专业类别查询、专家级别查询、参评次数查询、回避次数查询、回避原因查询、专业分布统计、回避率查询、多条件组合查询、回避风险综合查询等18种典型评估场景,生成高质量的自然语言问题-SQL语句-叙述式结果三元组训练语料。语料数据可直接适配企业自身数据表结构,实现快速复用和部署。作为建筑行业稀缺的、高质量的垂直领域语料,本数据产品为垂类大语言模型的训练和优化提供了有力支撑,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化:对原始评标专家语料数据进行去重、格式统一和脱敏处理。SQL语句统一采用标准MySQL语法,结果输出统一为自然语言描述格式。专家姓名采用姓+*脱敏,企业名称采用前2字+**+后4字脱敏。数据表含10个字段(record_id、expert_name、expert_id、expert_level、specialty、expert_region、eval_count、avoid_count、company_relation、register_date),各字段与算法规则各环节一一对应。2.问题分类与结构化:将自然语言问题按查询意图归为8类——专家人数统计(按条件统计专家数量)、参评次数查询(极值与分布)、回避次数查询(回避次数及关联分析)、等级分布统计(初/中/高级分布)、地区分布统计(按省市统计)、专业分布统计(按擅长专业统计)、关联企业查询(特定企业专家信息)、综合查询(跨维度组合条件)。通过槽位填充提取查询条件,映射到数据表字段:expert_name、expert_level、specialty、expert_region、eval_count、avoid_count、company_relation、register_date。3.核心算法建模:采用BERT-base-Chinese(12层Transformer,768维隐藏层)进行语义编码,通过意图识别判断查询属于上述8类中的哪一类,槽位填充提取条件并映射到对应字段。SQL生成模块覆盖SELECT聚合、WHERE过滤、GROUP BY分组、HAVING阈值筛选等模式。引入IsolationForest(n_estimators=100, contamination=0.01)对SQL进行异常检测,过滤率>=99%。语料经人工抽检核验,准确率100%。4.语料库持续迭代:建立生成-评估-优化闭环,从SQL准确率和结果准确率两维度评估,自动化检查语义一致性、字段覆盖率和脱敏合规性,定期收集错误样本优化,持续提升Text-to-SQL在评标专家回避风险领域的表现。
浙江省数据知识产权登记平台2026-08-14 更新30
建筑企业信用修复知识问答对大模型训练数据
建筑行业信用修复
信用修复智能问答
本数据产品专为训练建筑行业信用修复领域垂类大语言模型而构建。建筑企业在经营过程中,因行政处罚、司法失信、拖欠工资、安全事故等多种原因可能被记入不良信用记录,严重影响企业招投标资格和商业信誉。然而传统模式下,企业法务和信用管理人员需要逐个查阅《信用修复管理办法》《保障农民工工资支付条例》等多部法律法规,面对行政处罚修复、司法失信修复、经营异常移出、严重失信主体修复等不同场景时,政策条文分散、适用条件复杂、流程要求各异,难以快速获取准确的修复指导。本数据产品采用知识问答对(QA)技术路径,覆盖行政处罚、司法失信、经营异常、严重失信、拖欠工资、工程质量、安全事故、环保违规、税务失信、招投标违规、资质暂停、合同履约、拖欠工程款、虚假宣传、知识产权、社保缴纳、贷款逾期、行业禁入等18种典型信用修复场景。企业可基于本语料数据的问答对内容,适配自身信用管理知识体系,快速构建信用修复智能问答系统进行复用。本数据为建筑行业提供了稀缺的、高质量的垂直领域语料,有力支撑了信用修复领域的自然语言处理技术研发、模型训练与评测,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化:对原始信用修复知识数据进行多维度清洗处理。去重处理:基于问题文本的语义相似度(余弦相似度阈值0.95)去除重复或高度相似的问答对。格式统一:答案文本统一采用'条件+流程+材料+法律依据+注意事项'的结构化格式。关键词标准化:每条问答对的关键词字段提取3-5个核心关键词,采用行业术语标准词表进行统一。数据表包含10个字段:序号、问题、答案、关键词、问题类型、专业度、清晰度、实用性、聚焦度、准确性,各字段与算法规则各环节一一对应。2.问题分类与结构化:将问答对按问题类型字段归为6类——政策咨询型(查询法规条文与政策解读)、流程指导型(指导修复操作步骤与办理程序)、条件查询型(查询修复适用条件与资格要求)、案例分析型(结合具体企业违规案例进行分析)、对比分析型(比较不同地区或不同违规类型的修复差异)、材料清单型(列举修复所需申请材料与证明文件)。同时按关键词字段覆盖的信用修复主题域划分为行政处罚、工程质量、安全生产、环保违规、税务失信、招投标违规、经营异常、严重失信等多个业务子类,确保问题分类在问题类型和关键词两个字段上均有准确体现。3.核心算法建模:采用BERT-base-Chinese预训练模型对问题进行语义编码,通过TextCNN分类器识别问题类型字段对应的6种分类意图。基于TF-IDF+BM25混合检索策略,从问答语料库中召回Top-K条匹配结果,再由Cross-Encoder语义重排序模型精排后输出答案。五维质量评分字段(专业度、清晰度、实用性、聚焦度、准确性,各1-5分)采用IsolationForest异常检测过滤低质量样本,确保入库语料各维度评分均不低于4分。4.语料库持续迭代:建立应用-反馈-优化闭环机制,收集用户使用日志中的问答记录,对低满意度样本进行专家审核修正后注入新语料,持续提升模型在信用修复领域的问答能力。
浙江省数据知识产权登记平台2026-08-14 更新10
建筑行业中标通知书关键信息智能提取大模型训练数据
建筑招投标信息抽取
中标通知书关键信息提取
建筑行业招投标活动中,中标通知书是记录中标结果的核心法律文件,包含项目名称、招标人、中标人、中标金额、项目编号、建设工期、质量要求、项目经理、中标日期等关键信息。传统模式下,这些信息依赖人工逐项阅读和录入,效率低下且易出错;大量中标通知书堆积导致信息提取滞后,影响项目跟进和市场竞争分析;不同地区通知书的格式和表述差异大,人工提取难以保证一致性。本数据产品面向建筑行业中标通知书关键信息智能提取场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型的标注语料数据集,训练大模型实现从非结构化文本中自动提取项目名称、中标金额等9个关键信息字段。招标单位可实现中标信息自动化归档,中标企业可快速录入项目信息,行业研究机构可批量获取市场数据用于竞争分析,推动建筑行业招投标信息处理从人工模式向智能化方向发展。
浙江省数据知识产权登记平台2026-08-19 更新10
建筑行业招标文件关键信息智能提取大模型训练数据
建筑行业招标文件信息提取
垂直领域大模型训练
本数据产品专为训练建筑行业招标文件信息提取领域垂类大语言模型而构建。建筑行业招标文件通常包含招标人信息、项目概况、资质要求、工期要求、技术参数、评标方法、合同条款等大量关键信息,这些信息分散在数十页乃至上百页的文档中,人工逐条提取耗时耗力且容易遗漏。传统招投标业务中,企业投标人员需要反复阅读招标文件,手动摘录各项关键信息用于编制投标文件和合规审查,效率低下且出错率较高。同时,不同招标文件的格式和表述方式差异较大,信息结构化程度低,给自动化处理带来挑战。本数据产品采用信息提取(Information Extraction)技术路径,覆盖招标人名称提取、项目金额提取、投标截止时间提取、资质要求提取、技术参数提取、评标方法提取、中标人信息提取等18种典型信息提取场景。企业可基于本语料数据的提取方法和标准答案字段内容,适配自身招标文件格式特点,快速构建招标文件关键信息智能提取系统进行复用。本数据为建筑行业提供了稀缺的、高质量的垂直领域语料,有力支撑了招标文件信息提取领域的自然语言处理技术研发、模型训练与评测,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化: 对原始招标文件提取数据进行多维度清洗处理:(1)去重处理:基于text_id和original_text+target_field_name组合键去除重复记录;(2)格式统一:文本类型字段标准化为"招标公告/招标文件/中标公示/补充通知"四种取值,字段数据类型标准化为"字符串/日期时间/金额/文本段落"四种取值;(3)脱敏处理:企业名称采用"前2字+**+后4字"规则脱敏,电话号码采用"前3位+****+后4位"规则脱敏,地址信息保留省市信息其余替换为"***";(4)保留"提取失败"样本,增强模型对复杂文本的鲁棒性。 2. 问题分类与结构化: 将信息提取场景按目标字段归类为18种类型:招标人名称提取、质量标准提取、项目经理要求提取、技术参数提取等核心场景。每种场景对应特定的提取方法组合。 3. 核心算法建模: (1)语义解析与要素提取:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对招标文件原始文本进行深度语义解析,通过语义角色标注(SRL)识别文本中的论元结构,明确关键语义关系,为信息提取提供结构化语义基础。 (2)信息提取与匹配:采用命名实体识别(BiLSTM-CRF序列标注模型)结合正则表达式和领域规则引擎的双路径策略。针对结构化程度较高的信息(如电话号码、金额),设计专门的正则表达式模式进行匹配提取;针对半结构化信息(如资质要求、合同条款),基于关键词触发和上下文窗口规则进行提取。规则补充:(3)异常值检测:采用IsolationForest孤立森林算法(n_estimators=100, contamination=0.05, max_samples='auto')对提取结果进行异常检测,识别提取结果与标准答案不匹配、置信度异常偏低、字段类型错误等样本,异常语料过滤率>=99%。 (4)逻辑核验与业务对齐:建立提取结果与标准答案的匹配验证机制,综合考量实体边界置信度、上下文匹配度、规则匹配强度等多维特征。进行最终核验确保业务适用性。 4. 语料库的持续迭代: 建立"应用-反馈-优化"闭环机制:收集提取结果与人工标注标准答案的对比数据,统计各场景的提取正确率和置信度分布;针对错误样本进行原因分析,定向优化模型和规则;定期注入新语料,持续提升信息提取的覆盖度和数据质量。
浙江省数据知识产权登记平台2026-08-18 更新20
建筑行业中标金额规模提取及大模型分析语料数据
建筑招投标金额提取
中标规模分级
建筑行业招投标活动中,中标金额是衡量项目投资规模和市场价值的核心指标。然而,建筑行业中标金额数据分散在不同地区、不同工程类型的中标公告中,格式不统一、表述差异大,传统人工方式难以高效完成金额提取和规模分级;大量中标金额数据缺乏系统化分析,企业无法快速判断项目规模级别,影响投标策略制定和资源配置;行业缺乏统一的金额规模分析标准,不同地区对项目规模的认定存在偏差。本数据产品面向建筑行业中标金额规模AI分析场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型、5个规模等级的标注语料数据集,训练大模型实现从中标文本中自动提取金额并完成规模分级分析。招标单位可快速评估项目规模,投标企业可制定差异化竞争策略,行业研究机构可批量获取金额分布数据用于市场趋势分析,推动建筑行业招投标金额分析从人工模式向智能化方向发展。
浙江省数据知识产权登记平台2026-08-18 更新30
建筑行业招标公告信息问数垂类大模型语料数据
建筑行业招标查询
Text-to-SQL训练语料
当前,建筑行业招标公告数量庞大且分布广泛,涵盖项目名称、项目所在地、工程类型、投标保证金、招标状态等多维度关键信息,公告信息量巨大,施工企业在参与投标竞争时需要从多个维度快速检索和筛选符合自身条件的招标公告,传统的人工浏览方式效率低下且难以实现精准匹配。 同时,招标公告信息分散、数据格式不统一,查询筛选成本高。 本数据采用Text-to-SQL(自然语言转SQL)技术路径,紧密适配招标公告信息表结构,覆盖公告基本信息查询、项目名称查询、项目所在地查询、工程类型查询、招标预算查询、投标截止时间查询、开标时间查询、资质要求查询、保证金查询、招标方式查询、代理机构查询、发布日期查询、招标状态查询、地区公告查询、预算范围筛选、日期范围查询、多条件组合查询、招标公告综合查询等18种典型查询场景,生成高质量的自然语言问题-SQL语句-叙述式结果三元组训练语料。语料数据可直接适配企业自身数据表结构,实现快速复用和部署。作为建筑行业稀缺的、高质量的垂直领域语料,本数据产品为垂类大语言模型的训练和优化提供了有力支撑,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化: 对原始语料数据进行全面清洗和标准化处理,包括去除重复记录、修正格式异常、统一字段命名规范等。对涉及招标代理机构名称等敏感信息进行脱敏处理,招标代理机构名称采用"前2字+**+后4字"的脱敏规则。项目名称、公告标题等公开信息保持原始格式,投标人资质要求等长文本进行截断处理。同时保留"无匹配数据"样本,确保模型能够正确处理查询无结果的边界情况,提升模型在实际应用中的鲁棒性。 2. 问题分类与结构化: 对生成的自然语言问题进行多维度分类与结构化标注。基于问题语义将问题归类到18种典型查询场景(公告基本信息查询、工程类型查询、招标预算查询、资质要求查询、招标状态查询、招标公告综合查询等),同时通过槽位填充技术提取问题中的关键查询条件,如项目名称、项目所在地、工程类型、招标预算、投标截止时间、开标时间、投标人资质要求、投标保证金、招标方式、招标代理机构、发布日期、招标状态等,为后续SQL生成提供结构化输入。 3. 核心算法建模: 采用BERT-base-Chinese预训练语言模型(12层Transformer,768维隐藏层,110M参数)作为语义理解基础,通过意图识别模块判断用户查询属于18种场景中的哪一类,同时通过槽位填充技术提取关键查询条件。在异常检测环节,引入IsolationForest孤立森林算法(n_estimators=100, contamination=0.01)对生成的SQL语句进行异常检测,过滤语法错误和语义不一致的异常样本,异常过滤率>=99%。所有生成的语料均经过人工专家核验,确保SQL准确率和结果准确率均达到100%。 4. 语料库持续迭代: 建立"生成-评估-优化"闭环迭代机制,从SQL准确率和结果准确率两个维度评估模型输出质量。通过自动化脚本对生成的语料进行质量校验,包括问题与SQL的语义一致性检查、字段覆盖率验证、脱敏合规性审核等。定期收集错误样本进行针对性优化,持续更新训练语料和场景覆盖,不断提升Text-to-SQL模型在建筑行业招标公告信息查询领域的表现。
浙江省数据知识产权登记平台2026-08-14 更新30
建筑行业行政处罚文书智能提取大模型训练数据
建筑行业行政处罚文书信息提取
垂直领域大模型训练
本数据产品专为训练建筑行业行政处罚文书信息提取领域垂类大语言模型而构建。建筑行业行政处罚文书包含处罚机关、被处罚企业、违法行为类型、处罚类别、罚款金额、整改要求等大量关键信息,但文书格式差异大、表述方式多样,信息分散在不同段落中,人工逐份提取耗时耗力且容易遗漏。传统模式下,建筑企业法务人员需要反复阅读大量处罚文书,手动摘录各项关键信息用于企业风险排查、合规审查和信用评估,效率低下且出错率较高。不同地区、不同类型的处罚文书(处罚决定书、责令改正通知、行政处罚告知书、听证告知书)格式和表述方式差异较大,信息结构化程度低,给自动化处理带来挑战。本数据产品采用信息提取(Information Extraction)技术路径,覆盖处罚机关提取、信用代码提取、罚款金额提取、处罚日期提取、整改要求提取、文书编号提取、文书类型提取、处罚依据提取、处罚期限提取、项目关联提取、人员关联提取、金额计算提取、综合信息提取等18种典型信息提取场景。本数据产品作为稀缺的、高质量的垂直领域语料,对推动建筑行业行政处罚文书信息提取智能化发展提供了有力支撑,对建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化:对采集的行政处罚文书原始文本进行数据清洗和标准化处理:(1)去除文档中的页眉页脚、水印等无关信息,统一不同地区处罚文书的格式差异,将处罚决定书、责令改正通知、行政处罚告知书、听证告知书四种文书类型进行结构化标注;(2)脱敏处理:企业名称执行"前2字+**+后4字"脱敏规则,法定代表人姓名执行"姓+*"脱敏规则,统一社会信用代码执行"前3位+***********+后4位"脱敏规则;(3)统一日期格式、金额单位等数据表达规范;(4)异常样本保留:对提取结果为"无匹配数据"的样本予以保留,用于训练模型识别边界场景和空结果场景,提升模型的鲁棒性。2.问题分类与结构化:基于行政处罚文书信息提取的业务需求,将提取任务划分为18种典型场景:处罚机关提取、被处罚企业提取、金额计算提取、综合信息提取。每个场景对应特定的目标字段、提取方法和问题模板。3.核心算法建模:(1)语义解析:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对处罚文书进行深度语义解析,通过语义角色标注识别文本中的论元结构,采用CRF序列标注技术提取关键实体。(2)信息提取:采用BiLSTM-CRF序列标注模型对处罚文书文本进行实体抽取,构建了包含行政机关名称、企业名称、人名、统一社会信用代码、日期时间、金额、法规条款、项目名称等实体类型的行业专属标注体系。针对结构化程度较高的信息(如文书编号、信用代码、罚款金额、日期时间等),设计专门的正则表达式模式进行精确匹配提取。(3)异常检测:采用IsolationForest(n_estimators=100,contamination=0.05)孤立森林算法对提取结果进行异常检测,识别实体边界错误、上下文歧义、规则覆盖不足等异常样本,异常语料过滤率不低于99%,确保训练语料的质量和可靠性。(4)逻辑核验:对提取结果进行最终核验,重点检查提取信息的业务逻辑正确性、实体边界的准确性、法规条款引用的规范性,确保每条训练样本符合行业实际业务场景。4.语料库持续迭代:建立"应用-反馈-优化"闭环迭代机制:收集提取结果与人工标注标准答案的对比数据,统计各场景的提取正确率和置信度分布;针对错误样本进行原因分析,定向优化模型和规则;定期更新训练语料和规则库,持续提升信息提取的准确率和覆盖面。
浙江省数据知识产权登记平台2026-08-14 更新10
关于我们
遇见数据集——让每个数据集都被发现,让每一次遇见都有价值。
数发科官网www.sfktec.com
联系我们
selectdataset@iotsh.com.cn
商业合作
数据驱动未来,携手共赢发展
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15沪公网安备31010402336585号
热门搜索