遇见数据集

pixcell

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

PixCell 数据集是一个经过验证的图像到代码课程数据集,旨在将光子几何重建为仅使用原始 GDSFactory Python 程序。数据集包含高可见度的组件图像、物理足迹和经过审计的程序代码。它由三个配置组成:`depth`(默认配置,包含 4560 个样本,用于监督训练和参数恢复)、`core`(包含 738 个样本,是一个紧凑的 L0 到 L4 课程,包含 547 个锚点和 191 个支持行)和 `references`(包含 4560 个样本,提供目标栅格、校准、谱系和验证器元数据)。`core` 是 `depth/train` 的精确子集,`references` 与 `depth` 共享相同的训练/验证分割,并通过 `opaque_id` 连接。每个样本的字段包括:模型观察字段(`image`、`footprint_um`)、监督目标字段(`code`)、采样和课程字段(`level`、`curriculum_order`、`representation_id`、`leakage_group_id`、`variation_role`、`realization_slot`、`is_core`)以及评估器参考字段(与 `references` 中的匹配行)。数据集不存储每行的提示,训练代码将图像和足迹与所选编程合同结合。采样字段用于组织批次,仅当训练管道明确包含时才可见。图像保留拓扑和轴内比例,足迹提供物理宽度和高度。`references` 配置提供几何评估器使用的规范物理长宽比栅格和校准,不应放入模型提示中。数据集的训练集包含 3468 个样本(来自 738 个核心行,加上 546 个表示的五个额外设置),验证集包含 1092 个样本(每个扩展表示的两个保留设置)。课程分为五个级别:L0(原始目录、构造函数模式、方向和缩放)、L1(放置、变换、对齐、连接、重复和路由)、L2(关系装配、链、分支、数组和径向库)、L3(多区域结构、重复介质、缺陷和循环组织)、L4(耦合器、MMI、干涉仪、谐振器、交叉、光栅、腔体和转换器)。所有发布的样本都经过确定性编译和执行、原始策略检查、结构检查、校准几何比较、足迹一致性和工件哈希的验证。数据集针对单层光子布局的几何重建,光学性能和代工厂鉴定由下游设备评估处理。版本 2.0.0 是破坏性模式发布,使 `depth` 成为默认配置,移除了重复的行指令,并将目标栅格和校准移入 `references`。

The PixCell dataset is a validated image-to-code curriculum dataset designed to reconstruct photonic geometries using only raw GDSFactory Python programs. The dataset contains high-visibility component images, physical footprints, and audited program code. It consists of three configurations: `depth` (default configuration, 4560 samples for supervised training and parameter recovery), `core` (738 samples, a compact L0 to L4 curriculum with 547 anchors and 191 support rows), and `references` (4560 samples providing target grids, calibrations, lineages, and validator metadata). `core` is an exact subset of `depth/train`, and `references` shares the same train/validation split with `depth`, connected via `opaque_id`. Each sample includes fields: model observation fields (`image`, `footprint_um`), supervised target field (`code`), sampling and curriculum fields (`level`, `curriculum_order`, `representation_id`, `leakage_group_id`, `variation_role`, `realization_slot`, `is_core`), and evaluator reference fields (matching rows in `references`). The dataset does not store prompts per row; training code combines images and footprints with a selected programming contract. Sampling fields are used for batch organization and are visible only when explicitly included in the training pipeline. Images preserve topology and in-axis scaling, while footprints provide physical width and height. The `references` configuration provides canonical physical aspect ratio grids and calibrations used by the geometry evaluator, which should not be placed in model prompts. The datasets training set contains 3468 samples (from 738 core rows plus five additional settings per 546 representations), and the validation set contains 1092 samples (two held-out settings per extended representation). The curriculum is divided into five levels: L0 (primitive catalog, constructor patterns, orientation, and scaling), L1 (placement, transformation, alignment, connection, repetition, and routing), L2 (relational assembly, chains, branches, arrays, and radial libraries), L3 (multi-region structures, repeating media, defects, and cyclic organizations), L4 (couplers, MMIs, interferometers, resonators, crossovers, gratings, cavities, and converters). All published samples have been validated through deterministic compilation and execution, primitive policy checks, structural checks, calibration geometry comparisons, footprint consistency, and artifact hashing. The dataset targets geometric reconstruction of single-layer photonic layouts; optical performance and foundry qualification are handled by downstream device evaluation. Version 2.0.0 is a breaking release that makes `depth` the default configuration, removes duplicate row directives, and moves target grids and calibrations into `references`.

创建时间:
2026-07-27
原始信息汇总

PixCell 数据集详情

数据集概述

PixCell 是一个经过验证的图像到代码(image-to-code)课程数据集,用于将光子学几何结构重建为仅使用图元的 GDSFactory Python 程序。数据集的每一行包含一个高可见度的组件图像、其物理尺寸(footprint)以及经过审计的程序代码。

  • 许可证:MIT
  • 语言:英文
  • 任务类别:图像-文本到文本(image-text-to-text)
  • 大小规模:1K < 样本数 < 10K
  • 标签:图像到代码、代码生成、视觉-语言、光子学、GDS、GDSFactory、合成数据、课程学习

数据集配置

配置名称 样本数 用途
depth 4,560(训练集 3,468,验证集 1,092) 默认语料,用于监督训练和参数恢复
core 738 紧凑的 L0 至 L4 课程,包含 547 个锚点和 191 个支撑行
references 4,560(训练集 3,468,验证集 1,092) 目标栅格、校准、谱系和验证器元数据

coredepth/train 的精确子集。referencesdepth 采用相同的训练/验证划分,并通过 opaque_id 进行关联。

训练契约

角色 字段
模型观测 imagefootprint_um
监督目标 code
采样与课程 levelcurriculum_orderrepresentation_idleakage_group_idvariation_rolerealization_slotis_core
评估参考 references 中匹配的行
  • 数据集不存储逐行提示词,训练代码需结合图像和物理尺寸与所选编程契约。
  • references 配置提供几何评估器使用的标准物理纵横比栅格和校准数据,不应放入模型提示词中。
  • opaque_id 是从 v1 源 ID 派生的稳定连接键,非匿名化机制。

数据划分设计

划分 构建方式 样本数
train 738 个核心行加上 546 个表示的五个附加设置 3,468
validation 每个扩展表示的两个预留设置 1,092

验证用于衡量已知表示内的参数恢复能力,每个表示均出现在训练集中。

课程结构

级别 样本数 表示数 内容
L0 177 93 图元目录、构造函数模式、方向和缩放
L1 215 127 放置、变换、对齐、连接、重复和布线
L2 118 99 关系装配、链、分支、阵列和径向组
L3 120 120 多区域结构、重复介质、缺陷和循环组织
L4 108 108 耦合器、MMI、干涉仪、谐振器、交叉、光栅、腔和转换器

验证机制

已发布的行通过以下验证:

  • 确定性编译和执行
  • 仅图元源代码策略
  • 结构检查
  • 校准几何比较
  • 物理尺寸一致性
  • 工件哈希

数据集目标为单层光子学布局的几何重建,光学性能和代工厂认证由下游器件评估处理。

发布清单将每个分片绑定到冻结的源摘要:

core e1c509dca337ce485efcb2b35101a052e06b12331b63a2f21a36c93b3682ea89 depth 676c49134d4d044c7d84426cf8eeecf09302e74ca4aa548956f14b7631a4d80b

源、发布工具和训练配方可在 PixCell v2.0.0 源发布 获取。

版本说明

  • 使用配置 depth 并指定修订版本 v2.0.0 来固定此版本。
  • 原始 core-v1depth-v1 版本仍可在对应的 Hugging Face 修订版本中获取。
  • 版本 2.0.0 为破坏性架构更新:将 depth 设为默认配置,移除重复的逐行指令,并将目标栅格和校准移入 references

引用信息

方法引用

bibtex @misc{agarwal2026pixcell, title = {From Pixels to {PCells}: A Neurosymbolic Approach to Photonic Component Creation}, author = {Aadarsh Agarwal and Kenaish Al Qubaisi and Dirk Englund}, year = {2026}, eprint = {2608.00084}, archivePrefix = {arXiv}, primaryClass = {cs.CV}, doi = {10.48550/arXiv.2608.00084}, url = {https://arxiv.org/abs/2608.00084} }

数据集版本引用

bibtex @dataset{agarwal2026pixcell_dataset, title = {PixCell Dataset: Representation-First Image-to-Code Curriculum}, author = {Aadarsh Agarwal and Kenaish Al Qubaisi and Dirk Englund}, year = {2026}, version = {2.0.0}, url = {https://huggingface.co/datasets/qpaig-mit/pixcell} }

搜集汇总
数据集介绍
pixcell 数据集图片
构建方式
PixCell数据集作为一种图像到代码的课程学习资源,旨在通过深度神经网络将光子器件几何图形精准重建为仅含原语的GDSFactory Python程序。其构建过程融合了合成数据生成与严格的验证流程,每个样本均包含高可见度的组件图像、物理尺寸以及经过审计的程序代码。数据集被划分为三个配置:depth作为默认的监督训练语料,core为精简的L0至L4课程子集,references则提供目标栅格、校准信息及谱系元数据。所有样本均通过确定性编译、执行、结构检查、几何比对与足迹一致性等多项校验,确保了数据的可靠性与可复现性。
特点
PixCell数据集的突出特点在于其精心设计的课程结构与严谨的验证体系。它包含4560个训练样本,其中core子集通过738个关键样本构建了从基础原语到复杂集成光子组件的渐进式学习路径,涵盖了定向耦合器、马赫-曾德尔干涉仪、谐振器等关键器件。每个层级(L0至L4)均针对特定几何构造技能,且所有样本均通过统一渲染管线生成具有最大可见性的图像,并附带物理足迹信息,支持参数恢复任务。此外,数据的划分策略确保了每个表示在训练集中至少出现一次,而验证集则专注于评估未知参数组合的恢复能力,从而为几何重建提供了可靠基准。
使用方法
使用PixCell数据集时,用户可通过HuggingFace的datasets库加载指定配置并锁定版本v2.0.0。模型训练采用图像与足迹作为观测输入,目标代码作为监督信号,而采样过程中的课程层级、表示标识等元数据可辅助批次组织。需要注意的是,references配置中的目标栅格与校准信息仅用于评估,不应纳入模型提示。数据集未提供预构建的提示文本,实际使用时需结合编程契约生成训练输入。为复现实验,可参考随数据集发布的源代码与训练脚本,同时已发布的行模式均经过验证,可直接用于监督微调或参数恢复等下游任务。
背景与挑战
背景概述
PixCell数据集由麻省理工学院量子光子学实验室的Aadarsh Agarwal、Kenaish Al Qubaisi和Dirk Englund于2026年创建,旨在推动光子学领域中图像到代码生成的研究。该数据集提供了一种经过验证的课程式学习资源,将光子器件几何结构重建为仅含基本图元的GDSFactory Python程序。其核心创新在于构建了包含4560个样本的深度配置和738个核心课程样本的层级结构,引入表示优先的评估机制,为视觉语言模型在光子设计自动化中的应用奠定了基准。该数据集填补了光子学领域缺乏标准化图像到代码数据集的空白,对光子集成电路的自动化设计具有重要影响。
当前挑战
PixCell数据集面临的挑战包括:领域内,光子器件几何重建涉及复杂的物理拓扑和多层结构,传统图像到代码方法难以精确捕捉参数化关系和制造约束,且光学性能验证需下游仿真,数据集仅提供几何重建基准。构建过程中,需确保程序的可编译性和可执行性,执行严格的原始图元政策,并校准渲染几何与物理尺寸的差异,如抗锯齿像素导致的边界框误差。此外,数据集设计需防止数据泄露,通过训练契约和引用配置分离,平衡课程学习与评估独立性,同时保持表示的一致性和可扩展性。
常用场景
经典使用场景
PixCell数据集为光子学领域提供了一种全新的图像到代码学习范式,其经典使用场景聚焦于将光子器件的二维几何图像自动转化为仅含基本图元的GDSFactory Python程序。通过将高可见性的组件图像与物理足迹(footprint)作为模型观察输入,监督学习目标为经过审计的代码输出,研究者能够训练视觉-语言模型以精确重建光子拓扑结构。该数据集精心设计的分层课程(L0至L4)覆盖从基本图元操作到复杂集成器件(如耦合器、MMI、干涉仪、谐振器)的递进式学习,为评估模型在参数恢复和结构生成方面的能力提供了标准化的训练与验证协议。
解决学术问题
PixCell数据集解决了光子集成领域中自动化设计的一大关键瓶颈:从几何描述到可制造、可仿真的参数化单元(PCell)代码的直接生成。传统上,这一过程依赖专家手工编写代码,耗时且易错。该数据集通过提供经过验证的、原始图元级别的程序注释,使得机器学习模型能够学习将像素级图像映射为结构化的、可执行的代码,从而推动了神经符号方法在光子器件创建中的应用。其验证机制确保了代码的可编译性和几何一致性,为学术研究提供了可靠的数据基础,促进了视觉-语言模型在科学工程设计中可解释性和可复用性的探索。
衍生相关工作
PixCell数据集催生了多个方向的衍生研究。其一,基于其图像到代码的基准,研究者开发了专门的光子器件代码生成模型,探索了不同的网络架构和训练策略,例如结合Transformer和卷积融合的视觉编码器。其二,该数据集的`references`配置和验证元数据支持了对几何一致性和可执行性的自动评估方法,推动了代码生成领域评估指标的发展,如结构相似度与参数恢复精度。其三,课程学习策略(L0-L4)被借鉴到其他科学领域,用于设计递进式数据集以提升模型学习复杂结构的能力。此外,PixCell的方法论启发了在微电子和超表面等其他光子学分支中构建类似的图像-代码数据集,促进了神经符号编程在物理器件设计中的广泛探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务