遇见数据集

Mintmark

收藏
github2026-09-05 更新2026-09-11 收录
官方服务:

资源简介:

以土耳其语为先的合成数据集,携带着其铸造地点的印记。

A Turkish-first synthetic dataset that bears the imprint of its construction location.

创建时间:
2026-08-22
原始信息汇总

Mintmark 数据集概述

基本信息

  • 数据集名称:Mintmark
  • 仓库地址:https://github.com/lokomotifai/mintmark
  • 定位:Turkish-first synthetic datasets(土耳其语优先的合成数据集)
  • 发布平台:PyPI 上的 mintmark
  • 当前版本:v0.3.4(项目状态标注为 Version 0.1, pre-release,版本冻结名称为 Mintmark)
  • 许可证:Apache-2.0
  • 支持 Python 版本:CPython 3.12、3.13、3.14

数据集核心特征

  • 完全合成:不摄入任何真实数据,所有值来自种子流(seeded stream)、精选词典或声明的语法,每个字符的来源都可追溯到可读文件。
  • 土耳其语优先:面向土耳其企业场景。
  • 确定性(Deterministic):相同引擎版本、pack digest、recipe、seed、标识符策略与输出格式,产生字节级完全相同的数据文件与标签边车文件。
  • 跨度标注(Span-labeled):每个 span 在放置其表层文本时被记录。
  • 来源清单密封(Provenance manifest):由 MINTMARK.json 绑定引擎、pack digest、recipe、seed、策略、分类法 pin 及每个校验和。

生成路径约束

  • 生成路径中不含任何模型(不写句子、不选名字、不平滑分布)。
  • 铸币时无网络(No network at mint time)。
  • 运行时依赖仅 2 个。
  • 无浮点数、无超越函数调用。

数据集内容示例

demo-run/ 包含以下文件:

  • customer.jsonl:100 条记录,每行一个 JSON 对象
  • transaction.jsonl:100 条记录,每条含渲染后的描述
  • transaction.labels.jsonl:每个描述的 span 偏移
  • MINTMARK.json:来源清单
  • SHA256SUMS:每个输出文件的校验和

单条记录示例(全部字段均为合成数据): json {"customer_id":"CUST-00000000","first_name":"Kaan","last_name":"Kılıç","national_id":"71773625043","email":"kaan.kilic.1256@example.org","phone":"+90 525 886 73 05","il":"Batman","segment":"affluent","balance_kurus":277663,"currency":"TRY"}

标识符引擎(六种)

每种引擎默认 safe 模式,可选 validator 模式:

引擎 无法为真的原因
TCKN 两条公开校验规则被正确计算后,第二条被非零偏移破坏,可见形状不变
VKN 同上,算法在编写前已对两个独立开源实现、200,000 个输入验证
IBAN 校验位在 02 至 98 窗口内偏移,银行代码为 99999,经 TCMB 参与者列表验证为未分配
PAN 16 位数字以 9 开头,无商业卡网络使用该主行业标识符;默认输出被掩码
PHONE 仅格式正确;土耳其编号计划未保留虚构号码段,重合可能被明确记录
EMAIL 仅使用 .exampleexample.com 家族,由 RFC 2606 与 RFC 6761 保留

分类法

  • 18 个标签的封闭分类法(closed taxonomy)。
  • 分类法版本:hushmark-tr v0.1,pin 为 af11b31e4916

确定性声明(精确表述)

相同引擎版本、pack digest、recipe、seed、标识符策略与输出格式,在以下平台产生字节完全相同的数据文件与标签边车文件:Linux x86_64、Linux arm64、macOS arm64 上的 CPython 3.12。

  • 清单中的 provenance 块(创建时间戳与调用行)被排除,清单其余部分均包含。
  • Windows 未声明、未测试。
  • 引擎亦可安装在 CPython 3.13 与 3.14。

Mintmark 保护与不保护的内容

做:

  • 产生不含真实个人信息的数据(因为不摄入任何数据)
  • 提供可让第三方重新推导并检查数据集的记录
  • 针对封闭分类法标注 span
  • 明确说明字节声明覆盖的平台
  • 保持生成的机构为虚构,并与真实机构列表比对扫描
  • 默认输出校验和无效的标识符

不做:

  • 对真实数据进行匿名化或掩码
  • 为任何目的认证数据集或作出合规声明
  • 判断检测器是否足够好
  • 覆盖未观测的平台
  • 保证名称在所有司法管辖区未被占用
  • 防止电话号码与已分配号码重合

Mintmark 家族拓扑

  • mintmark:本仓库即引擎,含生成、标识符、标注、清单、CLI、一个示例 fixture pack。
  • mintmark-banking:第一分支,含客户、账户、卡、交易、投诉、KYC 笔记、支持记录。
  • mintmark-insurance:第二分支,含投保人、保单、理赔、支付、理赔笔记、通话记录。
  • mintmark-hr:第三分支,含员工、职位历史、休假、薪资、绩效与招聘笔记、HR 请求。
  • health:已推迟,其特殊类别密度需更严格的治理审查。

每个 pack 通过带闭合上界的版本范围固定本引擎。

已验证事实(来自公共登记与规范)

事实 来源 结果
VKN 校验位算法 两个独立开源实现(不同语言、不同作者) 200,000 个随机输入零分歧
IBAN 银行代码 99999 未分配 TCMB 支付系统参与者列表,修订版 072025 71 个参与者,代码 0001 至 0807,9xxxx 范围为空
土耳其永久为 UTC+3 IANA 时区数据库 2017 至 2030 单一偏移,夏令时为零
机构拒绝列表 同一 TCMB 列表 70 个条目覆盖全部 71 个参与者

仓库结构

src/mintmark/ engine/ 流、SplitMix64、无偏抽样、定点表、模板 identifiers/ tckn, vkn, iban, pan, phone, email;safe 与 validator 模式 annotate/ 封闭分类法、span 捕获、渲染、边车文件 packs/ 严格 fail-closed 加载、schema、规范 pack digest emit/ 规范 JSONL 与 CSV、原子输出 manifest/ MINTMARK.json、校验和、verify lexicons/ 土耳其语基础词典与机构拒绝列表 minting.py 组合根 cli.py 七个动词、五个退出码、稳定的 JSON 载荷 schemas/ pack 与 manifest JSON Schema,已版本化 packs/example/ 快速入门使用的 fixture pack assets/ 已提交的分布表与拒绝列表 tools/ 离线表生成器、散文 lint、金丝雀检查 tests/ 单元、属性、黄金、对抗、一致性测试

保护约束(确定性成立的原因)

约束 原因
输出数据中无浮点数 浮点文本形式依赖平台的二进制近似格式化
铸币路径中无超越函数调用 libm 结果在不同平台与版本间不同
每个生成点独立流 新增字段不会移动其他字段的值
流派生中使用 NUL 分隔符 防止 pack 名与版本名产生别名流
使用拒绝采样而非取模 取模会过度代表前几个残差
序列化采用声明顺序 既非排序也非插入顺序

项目状态

  • 版本 0.1,预发布。
  • 语义化版本管理的公开接口:CLI 语法、退出码、--json 载荷、库的两个函数、两个 JSON Schema,以及固定种子产生的字节。
  • 改变固定种子输出字节的变更属于主版本事件,即使没有签名移动;主版本为零时由次版本承载(如 0.3.0 所为),补丁版本永不移动字节。
  • 名称已冻结,商标筛查于 2026-08-22 通过,PyPI 命名空间由本项目持有。

文档

文档 内容
docs/determinism.md 声明、每个术语为何狭窄、如何复现已发布数据集
docs/taxonomy.md 十八个标签、pin,以及上游移动时的行为
docs/normative-verification.md 验证了什么、对照哪个来源、何日期、何结果
docs/engineering-notes.md 构建怪癖、环境陷阱

社区契约

  • 贡献在 Developer Certificate of Origin 1.1 下接受,无贡献者许可协议。
  • README.md 为权威版本,README.tr.md 为完整镜像(非摘要),两者结构由测试比对。
搜集汇总
数据集介绍
Mintmark 数据集图片
构建方式
在土耳其金融、保险及人力资源等领域,真实生产数据受KVKK等法规约束难以进入测试与AI验证环境,Mintmark应运而生。该数据集以确定性铸币为核心理念,构建全程不调用任何生成模型,亦不依赖网络。其所有字段值均源自带种子的伪随机流、经过审核的土耳其语词库以及显式声明的语法规则。每个生成站点拥有独立随机流,采用SplitMix64与拒绝采样确保公平性,并以整数定点运算规避浮点与超越函数调用。铸币过程严格遵循包声明、配方与种子,最终输出数据文件、标注侧车、溯源清单及校验和,形成可复现的字节级数据集。
特点
Mintmark以土耳其语优先和可溯源铸币标记为显著特征。其标识符安全模式默认输出经校验和故意破坏的值,确保无法对应真实个人,如TCKN与VKN通过偏移量使校验位失效,IBAN银行代码固定为未分配值99999,电子邮件仅使用RFC保留域名。确定性声明明确限定在相同引擎版本、包摘要、配方、种子与标识策略下,于CPython 3.12及Linux x86_64、Linux arm64和macOS arm64平台产生字节级一致的数据文件。清单MINTMARK.json绑定所有生成参数与校验和,标注跨度在文本渲染时实时捕获,并可由验证器重新切片核对。分类体系为18个封闭标签,截至当前版本固定于特定摘要。
使用方法
用户可通过PyPI安装Mintmark,在离线环境下使用命令行工具快速开始。典型流程为执行mintmark mint命令,指定示例包、配方、种子与输出目录,即可生成包含客户与交易记录的JSONL数据文件、跨度标注侧车、MINTMARK.json溯源清单及SHA256SUMS校验和文件。随后运行mintmark verify对输出目录进行验证,检查清单模式、文件校验和、标识策略、校验和有效性、标注对齐及分类体系固定等属性。第三方可借助mintmark reproduce命令仅凭清单重新铸币并逐字节比对,从而在不信任原始生产者的情况下独立验证数据集的可复现性。
背景与挑战
背景概述
在土耳其金融、电信与公共服务领域,企业因KVKK合规约束而难以将生产数据引入测试、评估或AI试点环境,长期缺乏兼具现实性与隐私安全性的替代数据。Mintmark由lokomotifai团队于2024年发起,作为土耳其语优先的合成数据引擎,以确定性生成、溯源清单与跨度标注为核心,回应了合成数据领域对可复现性与合规性的双重需求。该数据集在PyPI发布后,为土耳其语NLP系统测试与验证提供了可信基准,推动了合成数据治理从模糊承诺向可验证主张的范式转变。
当前挑战
合成数据领域长期面临真实性、隐私性与可复现性难以兼顾的困境:真实数据不可用,而现有合成工具生成的数据缺乏溯源机制,难以验证其是否包含真实个人信息。Mintmark的构建挑战尤为突出,需在无模型、无网络、无浮点运算的约束下,确保跨平台字节级确定性,同时设计校验位无效的标识符引擎,并维护封闭分类体系与清单的严格一致性。此外,土耳其编号计划未预留虚构号码段,使得电话号码的碰撞风险成为固有局限,需在文档中明确披露而非隐匿。
常用场景
经典使用场景
在土耳其金融科技与人工智能研发领域,Mintmark数据集凭借其土耳其语优先的合成数据生成能力,成为构建与评估命名实体识别、序列标注等自然语言处理模型的经典基准。研究者可借助其确定性生成机制,在无需接触真实个人数据的条件下,获得带有精确跨度标签的客户、交易、投诉等文本及结构化记录,从而在安全合规的沙盒中反复训练与验证模型对土耳其语特有实体(如TCKN、VKN、IBAN)的识别与分类性能。
实际应用
在实际应用中,Mintmark广泛服务于土耳其银行、保险及人力资源部门的系统测试与AI试点项目。团队可利用其生成包含客户档案、交易流水、理赔记录等在内的完全虚构数据集,在离线环境中完成软件回归测试、模型鲁棒性评估以及数据管道压力验证。生成的数据附带来源清单与校验和,使第三方能够独立复现相同字节,满足审计与合规审查对数据可追溯性的严苛要求。
衍生相关工作
Mintmark引擎催生了一系列面向垂直领域的衍生数据集仓库,包括专注于银行客户与交易场景的mintmark-banking、覆盖保单与理赔流程的mintmark-insurance,以及处理员工与薪酬信息的人力资源包mintmark-hr。这些工作沿循统一引擎、薄行业包的设计哲学,各行业包仅包含声明式数据与测试,通过固定引擎版本范围确保已发布清单的可复现性,共同构建起一个可扩展、可验证的土耳其语合成数据生态系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务