遇见数据集

koskari

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

Koskari语言语料库是一个从Koskari一致性语料库导出的已验证Koskari语言示例集合,旨在为Koskari编程语言提供机器检查的行为期望,覆盖多个语言处理阶段,包括读取(reader和布局输出)、扩展(宏扩展)、求值(运行时结果)、错误(预期管道失败)和无效(文档化的非法源代码)。数据集包含四个独立配置:1) 语料库配置(默认):包含所有语料库记录,每行对应一个记录,字段包括唯一标识符、特征路径、源代码、各验证阶段的期望输出、文档引用、稳定性标签、维护者标签、模式版本和Git引用;2) 求值配置:包含具有已验证verify.eval期望的记录子集,以扁平化的源代码到求值结果行形式呈现;3) 文档配置:包含源仓库docs/目录中的用户文档页面(Markdown格式);4) 程序配置:包含源仓库examples/目录中的示例Koskari程序(完整的.ki文件及其README)。每个数据行都包含溯源信息,确保可追踪性。数据集适用于编程语言研究、编译器测试、代码生成、语言模型微调等任务,特别适用于需要验证语言行为一致性的场景。

The Koskari Language Corpus is a collection of verified examples of the Koskari language, derived from the Koskari conformance corpus, designed to provide machine-checked behavioral expectations for the Koskari programming language. It covers multiple language processing stages, including reading (reader and layout output), expansion (macro expansion), evaluation (runtime results), errors (expected pipeline failures), and invalid (documented illegal source code). The dataset consists of four independent configurations: 1) Corpus configuration (default): contains all corpus records, each line corresponding to a record, with fields such as unique identifier (corpus_id), feature path, source code, expected outputs for each verification stage (read, expand, eval, error, invalid), references, stability tags, maintainer tags, schema version, and git ref; 2) Evaluation configuration: includes a subset of records with verified verify.eval expectations, presented as flattened source-to-evaluation result lines; 3) Documentation configuration: includes user documentation pages (in Markdown format) from the source repositorys docs/ directory; 4) Program configuration: includes example Koskari programs (complete .ki files and their README) from the source repositorys examples/ directory. Each data row includes provenance information (corpus_id, schema_version, git_ref) for traceability. The dataset is suitable for tasks such as programming language research, compiler testing, code generation, and language model fine-tuning, particularly in scenarios requiring verification of language behavior consistency.

创建时间:
2026-07-04
原始信息汇总

数据集概述:Koskari language corpus

该数据集是从 Koskari conformance corpus 导出的经过验证的 Koskari 语言示例,其数据基于机器检查的语言阶段(读取、展开、评估、错误、无效)提供了可追溯的语料记录。

许可证

  • GNU General Public License v3 (GPL-3.0)

源代码仓库

数据集配置

数据集包含四个配置(config),默认配置为 corpus

1. corpus(默认)

包含每一条语料记录,无论其包含哪些验证阶段,缺失的阶段以 null 表示。

列名 描述
corpus_id 唯一语料记录标识符
feature 特征路径(例如 special/compile/cond, layout/if
source Koskari 源文本
read verify.read 的预期读者输出
expand verify.expand 的预期宏展开
eval verify.eval 的预期评估结果
error verify.error 的预期流水线错误
invalid verify.invalid 的无效来源说明(文本解释)
references 指向 docs/ 下用户文档页面的链接
stability 记录稳定性标签(stable, evolving, experimental
tags 维护者标签(不包含仅训练用的元数据)
schema_version 导出时的语料库模式标识符
git_ref 导出时的短 Git 提交哈希

2. eval

仅包含经过验证的 verify.eval 评估预期的记录子集,用于补全风格的使用,每行包含源文本到评估结果的映射。

列名 描述
corpus_id 唯一语料记录标识符
feature 特征路径
source Koskari 源文本
eval 预期评估结果
schema_version 导出时的语料库模式标识符
git_ref 导出时的短 Git 提交哈希

3. docs

来自源代码仓库 docs/reference/docs/start/ 目录的用户文档页面(Markdown 格式)。每行对应一个页面,其 path 列与 corpus 配置中的 references 列完全匹配。

列名 描述
path 文档相对路径(如 reference/specials/compile-define.md
title 页面标题(第一个 Markdown 标题)
summary 首段纯文本摘要
content 页面的完整原始 Markdown 内容
section 父目录(如 reference/specials
kind 固定为 doc
schema_version 导出时的语料库模式标识符
git_ref 导出时的短 Git 提交哈希

4. programs

来自源代码仓库 examples/ 目录的 Koskari 示例程序(完整的 .ki 文件及 README),提供组合级别的上下文(完整程序而非单一构造片段)。这些行仅为示例,未经验证,不携带机器检查的阶段预期。

列名 描述
path 仓库相对文件路径(如 examples/life/koslife/life.ki
title 文件名主干或 README 标题
summary 模块文档字符串或首行注释(纯文本)
content 文件的完整原始源代码
section 顶级示例组(如 examples/life
kind 固定为 example
schema_version 导出时的语料库模式标识符
git_ref 导出时的短 Git 提交哈希

验证阶段

每条语料记录在语言边界断言行为:

  • read:读者和布局输出
  • expand:外层形式的宏展开
  • eval:运行时结果(包括源代码中 @ 标记的复杂编码)
  • error:预期流水线失败
  • invalid:记录的非法的源代码(可能与 read 预期共存)

只有源语料记录中存在的阶段会在 corpus 配置中以非 null 列形式出现。

溯源信息

每一行都包含 corpus_idschema_versiongit_ref,便于下游用户关联到权威的 YAML 记录和导出版本。

搜集汇总
数据集介绍
koskari 数据集图片
构建方式
Koskari语料库源于Koskari语言的一致性测试集,通过对源仓库中经过机器验证的Koskari语言示例进行结构化导出而构建。数据集按用途划分为四个配置:默认的`corpus`包含所有语料记录,每一行对应一条记录,并涵盖读取、展开、求值、错误及无效等语言阶段的检验预期;`eval`子集筛选出包含已验证求值预期的记录,形成源文本到求值结果的平行数据;`docs`配置提取源仓库中`docs/reference/`与`docs/start/`目录下的Markdown用户文档,每行对应一个页面,其路径与`corpus`中的参考文献直接关联;`programs`配置则收录`examples/`目录下的完整Koskari程序文件,提供组合级别的上下文。每条记录均附有`schema_version`与`git_ref`字段,确保可追溯至权威的YAML源记录和导出版本。
特点
该数据集的核心特色在于其机器验证的严谨性与多阶段行为覆盖。`corpus`配置中的每条记录均包含一个或多个语言阶段的预期输出,这些阶段包括读取、宏展开、运行时求值、管线错误以及非法源码的说明,且缺失的阶段以空值表示,构成一个可程序化检查的断言集合。`eval`子集专为补全任务设计,提供简洁的源-目标对。`docs`与`programs`配置则分别补充了文档解释和完整程序示例,丰富了数据集的语义层次。特别值得注意的是,所有记录均带有稳定性标签(稳定、演进、实验)和维护者标签,便于用户按质量筛选数据。
使用方法
用户可通过Hugging Face Datasets库灵活加载各配置。默认加载`corpus`配置即可获取完整的语料记录,适用于多阶段语言行为的分析与模型训练。若需聚焦于源码到求值结果的映射,可指定加载`eval`配置,其扁平化的结构便于直接用于序列到序列的学习任务。文档检索或知识增强场景下,可加载`docs`配置,利用`path`与`corpus`中的`references`字段实现语料记录与文档内容的精确连接。`programs`配置则适合需要完整程序上下文的任务。所有配置均支持通过`corpus_id`、`schema_version`和`git_ref`字段进行跨配置的数据关联与版本追溯。
背景与挑战
背景概述
Koskari语言语料库是由obriencj团队在近年来构建的,旨在为一种名为Koskari的编程语言提供系统化的机器可验证语言示例集合。该数据集的核心研究问题在于如何通过细粒度的语言阶段划分(如读取、宏展开、求值、错误处理及非法状态)来建立一套严谨的符合性测试框架,从而支持语言规范验证、编译器测试及教育用途。Koskari语料库的出现填补了新兴编程语言领域缺乏高质量、可验证语料资源的空白,为编程语言设计与实现社区提供了一个可追溯、可扩展的基准数据集,其影响力不仅局限于Koskari语言的生态建设,也对语言工程中自动化测试与语料组织的方法论具有示范意义。
当前挑战
Koskari语料库面临的首要挑战在于所解决领域问题的复杂性:编程语言符合性测试需要覆盖从语法解析到运行时行为的完整管道,而Koskari语言本身包含宏展开、复杂编码等高级特性,使得每条语料记录必须精确匹配多个阶段的期望输出,这要求数据集在完整性、准确性与可维护性之间取得平衡。构建过程中的挑战则体现在两个方面:其一,数据来源仅依赖单一GitHub仓库,且语料记录通过YAML格式管理,导出为Parquet时需确保版本一致性,任何模式变更或提交回溯都可能导致引用断裂;其二,文档和示例程序以Markdown及原生源文件形式存在,需跨格式整合并保持引用路径的严格对应,尤其是文档页面可能因篇幅增长而触发HuggingFace视图截断,后续必须引入分块策略以缓解这一限制。
常用场景
经典使用场景
在自然语言处理与编程语言研究的交叉领域,koskari数据集为验证结构化和半结构化语言处理模型提供了标准化的测评基准。该数据集包含Koskari语言的合规性语料,覆盖从源文本读取到宏展开、求值、错误处理及非法语法检测的完整语言处理管线。研究者常利用其精心标注的语料条目,评估解析器、宏展开器及解释器在多个语言阶段上的表现,尤其适合用于验证基于注意力机制的神经符号系统对形式语言语义的捕捉能力。数据集的结构化字段设计,如`feature`路径与多阶段预期输出,使得分量化的性能追踪成为可能,成为形式语言理解与代码智能任务评测的可靠基石。
实际应用
在工业实践中,koskari数据集可用于编程语言工具链的质量保障与自动化测试。开发者可基于其`corpus`配置中的稳定条目,对自定义的Koskari解析器或集成开发环境组件进行回归测试,确保宏展开与求值行为随代码变更保持正确。此外,数据集的`programs`配置提供了完整的示例程序,可作为代码生成模型的训练素材,帮助自动化编程助手学习在Koskari语言约束下生成语法与语义均正确的代码片段。参考文档部分`docs`则链接至语言参考手册,为构建交互式文档生成系统或聊天式编程辅导工具提供了可溯源的知识库。
衍生相关工作
基于koskari数据集的独特性,已衍生出多项聚焦于形式语言合规性验证的开源工具与评估体系。其中,原项目中的`verify`工具集利用该语料实现了自动化的语言阶段断言,可对任意Koskari代码执行从读到求值的全链路校验,该工具随后被适配至其他领域特定语言的质量保障流程中。此外,数据集的`eval`子集催生了一类面向代码完成任务的微调基准,研究者借助其扁平化的源到求值映射,训练序列到序列模型并衡量其对Koskari程序运行时行为的预测准确率。这些工作共同构筑了一个围绕形式语言特性进行机器学习测评的小型生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务