taskweft-fbd-editscore-train
收藏资源简介:
该数据集名为 taskweft-fbd-editscore-train,旨在提供意图(intents)及其对应的 IEC 61131-3 功能块图(Function Block Diagrams)的映射关系。数据集采用 EditScore 格式组织:每个意图对应一个根行,每个根行包含三个候选功能块图,分别代表参考图(rank1)、编译通过但行为错误图(rank3)以及编译器拒绝图(rank5)。每个候选图附带来自编译器和执行器的得分。所有数据由模板和种子构造而成,标签真实可靠,且可重新生成。数据集包含三个分割:训练集(3375行)、测试集(375行,每第十个种子留出)、评估集(1250行,完全留出的家族和块类型),总计5000行。模板分为四种类型(write、write_then_read、run_print、write_then_count),每种各1250行。数据以 Parquet 格式存储,可通过四个配置(fbd、fbd_root、fbd_candidates、fbd_scores)访问,每个配置均包含训练、测试和评估分割。该数据集适用于文本生成任务,尤其侧重工业控制领域的意图与功能块图生成。
This dataset, named taskweft-fbd-editscore-train, aims to provide a mapping between intents and their corresponding IEC 61131-3 Function Block Diagrams. The dataset is organized in EditScore format: each intent corresponds to a root row, and each root row contains three candidate function block diagrams representing the reference diagram (rank1), the compilation-passed but behavior-incorrect diagram (rank3), and the compiler-rejected diagram (rank5). Each candidate diagram is accompanied by scores from the compiler and executor. All data is constructed from templates and seeds, with reliable and reproducible labels. The dataset includes three splits: training set (3375 rows), test set (375 rows, holding out every tenth seed), and evaluation set (1250 rows, holding out entire families and block types), totaling 5000 rows. Templates are divided into four types (write, write_then_read, run_print, write_then_count), each with 1250 rows. The data is stored in Parquet format and can be accessed via four configurations (fbd, fbd_root, fbd_candidates, fbd_scores), each containing train, test, and evaluation splits. This dataset is suitable for text generation tasks, especially for intent-to-function block diagram generation in industrial control domains.
数据集概述
基本信息
- 数据集名称: taskweft-fbd-editscore-train
- 许可证: MIT
- 任务类型: 文本生成(text-generation)
- 相关标签: IEC 61131-3、功能块图(Function Block Diagram)、PLCopen、TaskWeft、EditScore
- 来源: 基于 v-sekai-fabric/taskweft-fbd-teacher 生成
数据集内容
该数据集包含意图(intents)及其对应的 IEC 61131-3 功能块图(Function Block Diagram),以 EditScore 格式组织。每个目标意图对应一行数据,每行包含三个候选项:
- rank1: 参考图(reference diagram)
- rank3: 能编译但执行错误行为的图
- rank5: 编译器拒绝的图
每个候选项附带来自编译器和执行器的评分。数据均由模板和种子构造,因此标签由构造过程保证正确性,且数据集可从种子重新生成。每行在生成前均经过控制验证。
数据划分
| 划分 | 说明 | 行数 |
|---|---|---|
| train | 训练集 | 3375 |
| test | 与训练集同分布,每第十个种子被留出,用于训练后的验证 | 375 |
| evaluation | 完全留出的家族和块类型(如 write_then_count),从未参与训练或调优 | 1250 |
数据配置与结构
数据集包含四个配置(config),均以 parquet 格式存储:
1. fbd_root(每意图一行)
字段包括:key, intent, template_id, seed, frame_id, blocks(参考图使用的块类型与签名), traces(输入轨迹的 JSON 字符串), 以及 EditScore 桩列。
2. fbd_candidates(每行三个候选项)
字段包括:candidate, rank, fbd_text(编译器文本形式), fbd_xml(PLCopen XML), plan_json 和 result_json(编译器的规划与执行器返回结果,若家族有执行器), fbd_sha(构建候选文本的 sha256 值), fbd_path(写入磁盘路径), provenance。未产生的产物以空字符串表示,而非 null。
3. fbd_scores(每行三个评分项)
字段包括:parses, compiles, runs, effect_matches, steps, wall_ms, refusal。
4. fbd(默认配置,连接视图)
将根行与其候选项及各自评分合并显示。
数据集规模与模板分布
- 总行数: 5000
- 模板分布:
- write: 1250
- write_then_read: 1250
- run_print: 1250
- write_then_count: 1250
工具链信息
- 编译器版本: taskweft-fbd-compiler d3279ec
- 数据来源: v-sekai-fabric/taskweft-fbd-teacher




