模型续写评测基准(Model Continuation Benchmark)
收藏资源简介:
基于《GB 55017-2021 工程勘察通用规范》第2~6章条文构建的模型续写评测数据集,包含194条续写样本,用于量化模型复现规范原文的能力。
A model continuation evaluation dataset constructed based on the provisions of Chapters 2 to 6 of GB 55017-2021 General Code for Engineering Investigation, which includes 194 continuation samples and is designed to quantify the capability of models to reproduce the original text of the code.
数据集概述
模型续写评测基准(Model Continuation Benchmark) 是一个基于《GB 55017-2021 工程勘察通用规范》第 2~6 章条文构建的模型续写评测数据集与评测脚本。该数据集将规范条文拆分为 context → gold 续写对,用于量化评估大模型复现规范原文的能力。
核心功能
- 数据标注:194 条续写样本,包含章节、条文号、条目类型、拆分规则、质量标记等 16 个字段
- 自动评测:调用 OpenAI 兼容 API 让模型续写,输出编辑距离、编辑相似度、完全匹配率
- 质量筛选:
use_for_eval标记进入主评测的样本,quality_flag标注样本质量,支持按子集评估 - 可视化报告:一键生成 PNG 报告(指标卡片 + 按章节得分条形图 + 最优样例对照)
- 可复现:
.env配置模型参数,--dry-run/--limit支持预览与冒烟测试
数据字段说明
| 字段 | 含义 |
|---|---|
id |
样本编号(如 gb55017_ch2_001) |
standard / chapter / article |
规范名、章节、条文号 |
item_no / item_type |
条目序号与类型(条文引导 / 分项补全 / 条款半句) |
full_text |
完整条文原文 |
context / gold |
续写上文 / 标准续写答案 |
split_rule |
拆分为 context/gold 的规则 |
use_for_eval |
是否进入主评测(是/否) |
quality_flag |
样本质量标记(OK / 偏短 / 结构性引导等) |
评测指标
edit_similarity = 1 - Levenshtein(pred, gold) / max(len(pred), len(gold))
edit_similarity:字符级编辑相似度,1.0 为完全一致exact_match_rate:完全匹配比例- 结果同时按
chapter和quality_flag分组汇总
环境配置
数据集依赖 Python 环境,需安装 pandas、openpyxl、pillow 等库,并通过 .env 文件配置模型 API 参数(API_URL / API_KEY / MODEL_NAME)。支持通过命令行参数选择评测子集、限制样本数量、预览提示词、读取已有预测列等。
使用场景
该数据集适用于 AI 模型评测研究,特别是评估大模型在开放式续写任务中对规范原文的复现能力。需要注意的是,规范条文续写是开放式任务,模型自由发挥与原文逐字对齐难度较高,实测平均编辑相似度约 10%,建议结合语义相似度等指标综合评价。





