遇见数据集

模型续写评测基准(Model Continuation Benchmark)

收藏
github2026-08-13 更新2026-08-18 收录
官方服务:

资源简介:

基于《GB 55017-2021 工程勘察通用规范》第2~6章条文构建的模型续写评测数据集,包含194条续写样本,用于量化模型复现规范原文的能力。

A model continuation evaluation dataset constructed based on the provisions of Chapters 2 to 6 of GB 55017-2021 General Code for Engineering Investigation, which includes 194 continuation samples and is designed to quantify the capability of models to reproduce the original text of the code.

创建时间:
2026-08-13
原始信息汇总

数据集概述

模型续写评测基准(Model Continuation Benchmark) 是一个基于《GB 55017-2021 工程勘察通用规范》第 2~6 章条文构建的模型续写评测数据集与评测脚本。该数据集将规范条文拆分为 context → gold 续写对,用于量化评估大模型复现规范原文的能力。

核心功能

  • 数据标注:194 条续写样本,包含章节、条文号、条目类型、拆分规则、质量标记等 16 个字段
  • 自动评测:调用 OpenAI 兼容 API 让模型续写,输出编辑距离、编辑相似度、完全匹配率
  • 质量筛选:use_for_eval 标记进入主评测的样本,quality_flag 标注样本质量,支持按子集评估
  • 可视化报告:一键生成 PNG 报告(指标卡片 + 按章节得分条形图 + 最优样例对照)
  • 可复现:.env 配置模型参数,--dry-run / --limit 支持预览与冒烟测试

数据字段说明

字段 含义
id 样本编号(如 gb55017_ch2_001)
standard / chapter / article 规范名、章节、条文号
item_no / item_type 条目序号与类型(条文引导 / 分项补全 / 条款半句)
full_text 完整条文原文
context / gold 续写上文 / 标准续写答案
split_rule 拆分为 context/gold 的规则
use_for_eval 是否进入主评测(是/否)
quality_flag 样本质量标记(OK / 偏短 / 结构性引导等)

评测指标

edit_similarity = 1 - Levenshtein(pred, gold) / max(len(pred), len(gold))

  • edit_similarity:字符级编辑相似度,1.0 为完全一致
  • exact_match_rate:完全匹配比例
  • 结果同时按 chapter 和 quality_flag 分组汇总

环境配置

数据集依赖 Python 环境,需安装 pandas、openpyxl、pillow 等库,并通过 .env 文件配置模型 API 参数(API_URL / API_KEY / MODEL_NAME)。支持通过命令行参数选择评测子集、限制样本数量、预览提示词、读取已有预测列等。

使用场景

该数据集适用于 AI 模型评测研究,特别是评估大模型在开放式续写任务中对规范原文的复现能力。需要注意的是,规范条文续写是开放式任务,模型自由发挥与原文逐字对齐难度较高,实测平均编辑相似度约 10%,建议结合语义相似度等指标综合评价。

搜集汇总
数据集介绍
模型续写评测基准(Model Continuation Benchmark) 数据集图片
构建方式
本数据集根植于《GB 55017-2021 工程勘察通用规范》的条文精髓,匠心独运地将其第2至第6章内容解构为194条续写样本。通过精细的文本分割策略,将每一条规范条文拆解为context与gold的二元结构,使大模型得以依据前文续写后续条款。每条样本均标注有章节、条文号、条目类型、拆分规则及质量标记等16个详尽字段,并辅以use_for_eval标志筛选主评测集,确保数据来源的权威性与构建过程的严谨性。
特点
该数据集独具匠心地聚焦于规范条文的开放式续写任务,以字符级编辑相似度作为核心量化指标,精准评估模型复现规范原文的能力。其特色在于多维度质量筛选机制,通过quality_flag标记样本质量,支持按章节和子集灵活评估,同时提供可视化PNG报告,直观呈现模型表现。此外,数据集兼容OpenAI API,支持dry-run预览与limit冒烟测试,确保评测的可复现性与高效性。
使用方法
使用流程便捷而直观:首先安装依赖并配置.env文件中的模型参数,随后通过--dry-run参数预览提示词与标准答案,无需调用模型即可验证数据完整性。实际评测时,运行主脚本即可自动调用API让模型续写,输出编辑距离与相似度等指标。用户既可按预设的use_for_eval子集评测,也可通过--limit限定样本量进行快速测试,或利用--pred-column直接读取已有预测结果打分,灵活适配不同研究场景。
背景与挑战
背景概述
模型续写评测基准(Model Continuation Benchmark)于近年由相关研究团队构建,旨在评估大语言模型在专业规范文本续写任务上的能力。该数据集基于《GB 55017-2021 工程勘察通用规范》第2至6章条文,通过系统化拆分规则生成194条续写样本,涵盖章节、条文号、条目类型等多维标注字段。核心研究问题在于量化模型对规范性、严谨性文本的复现程度,以字符级编辑相似度作为自动评测指标。该基准为自然语言处理领域提供了面向专业领域的续写评测新视角,尤其对工程勘察等垂直场景下的文本生成能力评估具有开创性意义,推动了规范文本自动化处理与AI辅助工程实践的发展。
当前挑战
该数据集面临的挑战多维且深刻。于领域问题层面,规范条文续写属开放式任务,模型自由生成内容与原文逐字对齐难度极高,实测平均编辑相似度仅约10%,凸显文本复现的固有困难,需引入语义相似度等复合指标方可更全面地评测生成质量。于构建过程层面,将复杂规范条文合理拆分为context与gold对需权衡语义完整性与任务可行性,不同拆分规则(如条文引导、分项补全、条款半句)对评测结果影响显著,且部分样本存在长度偏短或结构性引导等质量问题,需依赖use_for_eval与quality_flag标记进行精细筛选。此外,数据规模有限(194条)限制模型能力评估的泛化性,如何扩展样本并保持标注一致性亦是待解难题。
常用场景
经典使用场景
该数据集的核心应用场景聚焦于评估大语言模型对专业规范文本的精准续写能力。通过将《工程勘察通用规范》第2至6章条文进行系统性拆分,构建了上下文与标准答案的配对样本,进而要求模型基于前置语境生成后续内容。此过程不仅检验了模型对规范条文的语义理解与再现精度,还利用字符级编辑相似度作为客观度量,量化模型输出与原文的吻合程度。该基准尤其适用于验证模型在封闭领域知识上的忠实度,为自然语言处理技术在专业文本生成任务中的性能评估提供了标准化工具。
实际应用
在实际应用层面,该基准可服务于工程勘察行业的智能化文档处理流程。设计单位或咨询机构可借用此评测体系,筛选出在续写规范条文方面表现优异的大模型,辅助自动生成勘察报告中的标准描述段落,提高文档撰写的规范性与工作效率。同时,该数据集亦可作为企业级知识库系统的基础校验工具,确保模型在依据规范内容进行问答或文本补全时,输出的准确性与一致性。此外,其评测脚本设计的可配置性与报告生成功能,方便了非技术背景的工程人员快速理解模型性能,促进了AI技术在传统基建领域的落地融合。
衍生相关工作
基于该数据集已衍生出一系列深化研究。在方法论层面,有工作尝试将字符级编辑相似度与语义向量相似度结合,构建多维度综合评分体系,以缓解单纯文字匹配对合理变通表达的误判。在模型优化方向上,衍生出针对专业文本的微调策略研究,利用该数据集样本作为训练反馈,提升模型对规范条文的生成稳定性。此外,该基准的拆分规则与评测思想被移植至其他标准化文档的续写评测中,如建筑结构设计规范或施工安全标准,形成了跨领域的评测范式迁移。更有研究者将其用于对比不同开源模型在特定规范知识上的表现差异,为模型选型提供了实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务