遇见数据集

BNCC Dados

收藏
github2026-07-28 更新2026-08-06 收录
官方服务:

资源简介:

巴西国家共同课程基础作为结构化、可验证和可追溯的数据:包含1721个学习成果,其中1580个来自基础教育三个阶段,加上141个来自计算机补充部分(CNE/CEB 2/2022意见)。每条记录都包含能力、组织背景和来源,并对照官方文档进行核对。

Brazil's National Common Curriculum Base as a structured, verifiable and traceable dataset: it contains 1721 learning outcomes, of which 1580 are sourced from three stages of basic education, plus 141 from the computer science supplementary section (CNE/CEB Opinion 2/2022). Each record encompasses competencies, organizational context and source information, and has been verified against official documents.

创建时间:
2026-07-10
原始信息汇总

数据集概述

该数据集将巴西国家通用课程基准(BNCC)以结构化、可验证且可追溯的开放数据形式呈现,涵盖基础教育三个阶段及计算机科学补充内容,总计 1,721 项学习目标(其中 1,580 项来自基础教育三个阶段,141 项来自计算机科学补充内容)。每个记录均包含能力要求、组织背景、来源信息,并与官方文件逐一核对。

核心数据内容

  • BNCC 2018 数据集dados/bncc-2018/):

    • 93 项幼儿教育目标(含各年龄段间的对齐关系)
    • 1,304 项小学阶段能力要求(含主题单元、知识对象、实践领域和语言实践)
    • 183 项中学阶段能力要求(含关联的能力维度)
    • 20 项具有官方 URL 的法律依据,5 个参考特征概览
  • 计算机科学补充数据集dados/computacao-2022/):

    • 141 项学习目标(11 项幼儿教育、104 项小学、26 项中学)
    • 包含各自轴心、知识对象和专属能力维度,并已对照 CNE/CEB 2/2022 号意见书的官方附件进行验证

数据可信度保障

  1. 逐条标注官方来源:每条记录均指明 MEC 工作表的具体选项卡与行号,以及官方认可 PDF 的页码(fonte 字段)。
  2. 自动逐字符校验:在 BNCC 2018 中,1,580 条文本中的 1,576 条与官方 PDF 完全一致,剩余 4 条因官方来源之间存在差异,已在 DECISOES.md 中记录并说明处理方式;计算机科学补充内容中 141 条均与官方附件一致。
  3. 完整性证明:对官方 PDF 及计算机附件中的代码进行全面扫描,结果与数据集中代码完全对应,无缺失或多余。
  4. 可复现的提取流程:可通过 pipeline/ 下的脚本重现与提交数据完全一致的文件,CI 在每次变更时自动执行验证,确保一致性。

数据格式与获取方式

  • 主要格式:JSON(规范源,由 schema/ 目录下 JSON Schema 定义并校验)
  • 衍生格式:SQLite 数据库(derivados/bncc.sqlite)及 CSV 表格(derivados/csv/),由 JSON 自动生成,适配 SQL 查询与电子表格使用

快速使用示例(无需安装任何依赖):

bash git clone https://github.com/bncc-dev/bncc-dados.git cd bncc-dados python3 -c " import json ef = json.load(open(dados/bncc-2018/ensino-fundamental.json)) h = next(x for x in ef[habilidades] if x[codigo] == EF67LP08) print(h[texto]) print(h[fonte][localizador_pdf]) "

也可通过已构建的包直接使用: bash npx -y @bncc/mcp # MCP 服务器,便于 AI 代理调用 npm install @bncc/dados # TypeScript/JavaScript pip install bncc # Python

开源与许可

  • 数据部分dados/):采用 CC BY 4.0 许可。BNCC 规范文本作为官方法令不受版权保护(巴西版权法第 9,610/98 号第 8 条),许可适用于数据的汇编、结构化及整理工作。
  • 代码部分pipeline/):采用 MIT 许可。

数据维护与贡献

  • 数据集由 Profy 维护并作为其首个实际用户。
  • 所有数据更正必须引用官方来源(MEC/CNE 文件,注明页码或定位符),CI 会验证每次变更的可复现性。
  • 当前状态为 稳定,首个版本内容为 dados-2026.07,格式为 schema-v1.0.0,并遵循明确的版本管理策略。
搜集汇总
数据集介绍
BNCC Dados 数据集图片
构建方式
BNCC Dados 数据集以巴西国家通用课程基准(BNCC)的官方文件为唯一数据源,通过一套可复现的自动化流水线进行构建。该流水线利用 Python 脚本从 MEC 官方电子表格及 PDF 文件中提取文本,并借助 pdftotext 与 ghostscript 工具进行解析与标准化处理。所有数据均经过逐字符的自动校验,确保与官方文件的一致性,同时将每条记录的来源定位至具体行号与 PDF 页码,以实现完整可追溯性。此外,数据集还提供 JSON Schema 定义,并生成 SQLite 与 CSV 等衍生格式,供多样化应用场景使用。
特点
该数据集的核心特点在于其高度结构化、可验证性与完整性。它包含 1,721 条学习目标,覆盖基础教育的三个学段及 2022 年计算机科学补充内容,每条记录均附有详尽的组织上下文,如能力领域、实践语言及知识对象。数据集通过自动化测试确保证据与官方文件的一致性,并通过代码扫描验证完整性,确保无遗漏或多余信息。此外,其稳定的版本管理策略与开放的许可协议(CC BY 4.0)为学术研究与教育应用提供了可靠基础。
使用方法
使用者可便捷地集成该数据集。通过 npm 包 @bncc/dados 或 PyPI 包 bncc 实现编程访问,亦可利用 MCP 服务器 @bncc/mcp 为 AI 代理提供课程数据接口。对于无依赖场景,用户可直接克隆仓库,加载 JSON 文件查询具体能力代码及其文本,并追溯来源。衍生格式如 SQLite 和 CSV 支持 SQL 查询与表格处理,便于数据分析。所有数据均遵循严格的格式规范,且版本化策略保障消费的稳定性,适合教育研究、课程开发及智能教学系统等应用。
背景与挑战
背景概述
BNCC Dados 数据集诞生于巴西基础教育课程改革的数字化浪潮之中,由 Profy 团队于2026年7月首次发布,旨在将巴西国家共同课程基础(BNCC)这一官方课程标准转化为结构化、可验证、可追溯的开放数据。该数据集涵盖1,721项学习目标,包括基础教育三个阶段的1,580项及2022年计算机科学补充课程的141项,每一记录均标注了官方法源(MEC表格或PDF页码),并通过持续集成实现字符级校验,保证了数据的完整性与权威性。作为首个全面覆盖BNCC的高质量结构化数据集,它极大地促进了教育技术开发、政策分析与学术研究,成为连接官方课程标准与数字教育应用的桥梁。
当前挑战
该数据集面临的核心挑战在于双重维度的精准性。其一,领域内挑战:原始BNCC文档以PDF和电子表格形式分布,格式复杂、表述冗长,且包含大量跨阶段、跨学科的交织关系,如何将其无损转化为统一的JSON结构并确保语义完整,是教育数据数字化的关键难题;同时,不同年份版本(2018年版与2022年补充)间的协调与冲突解决亦构成挑战。其二,构建过程挑战:从官方源中提取文本时需处理字符级差异,例如4处与官方PDF不一致之处源自官方文档自身矛盾;此外,提取流程需兼顾可复现性,任何环境变动都可能导致数据偏差,而持续验证机制必须严格把关,确保每条记录都能追溯至确切的官方页码,这要求高强度的人工审核与自动化测试的无缝整合。
常用场景
经典使用场景
该数据集将巴西国家通用课程基准(BNCC)转化为结构化的JSON格式,涵盖1,721项学习目标,并标注其能力维度、组织语境及官方来源出处。经典使用场景包括教育研究中的课程映射与对齐分析,如利用其结构化数据自动关联各学段技能代码(如EF67LP08)与其对应的领域实践、知识对象,从而构建课程实施追踪系统,亦可作为教育政策文本挖掘与知识图谱构建的基础语料。
实际应用
在实际应用中,该数据集支撑起了多层级教育数字化转型的基石。教育科技公司可将其集成于自适应学习平台,依据技能代码精准推荐教学资源;学校管理方利用其SQL导出接口实现课程计划与教学大纲的自动化比对;更可服务于师资培训系统,按学段和学科动态生成能力发展图谱。其MCP服务器接口已允许人工智能代理直接查询课程内容,为开发智能备课工具和个性化学习助手提供了即时的数据支撑。
衍生相关工作
围绕该数据集已衍生出一系列富有成效的工具与研究工作。官方维护的Python包(bncc)、TypeScript/JavaScript包(@bncc/dados)及MCP服务器(@bncc/mcp)构成了数据消费的开发生态。后续学术工作包括利用其强一致性数据训练语言模型以进行课程目标自动分类,以及基于其数据地图构建跨年度课程连贯性评估指标。此外,其数据版本化与合法性保障机制亦已成为开放教育数据治理的参考案例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务