bncc-benchmark
收藏资源简介:
这是一个关于巴西国家共同课程基础(BNCC)的LLM幻觉公开基准测试数据集。它通过开放的方法论和发布的原始数据,测量语言模型在无法访问结构化源时对BNCC代码和文本的虚构程度,以及通过bncc.dev进行基础接地后问题的缓解情况。数据集包含官方轮次oficial-seca-2026-07的15300个原始回答,涉及17个模型,每个模型900个回答。
This is an open public benchmark dataset for evaluating LLM hallucinations related to the Brazilian National Common Core Curriculum (BNCC). Utilizing open methodologies and released raw data, it measures the hallucination level of language models towards BNCC-related codes and texts when structured sources are inaccessible, as well as the mitigation of such hallucinations when grounded via bncc.dev. The dataset includes 15,300 raw responses from the official round oficial-seca-2026-07, covering 17 models with 900 responses per model.
数据集概述
这是一个针对巴西国家共同课程基础(BNCC)的大语言模型幻觉公开基准测试数据集。
- 核心目标:衡量大语言模型在回答BNCC相关内容时编造代码和文本的程度,以及通过bncc.dev(MCP与API)进行源引用后该问题消失的程度。
- 测试轮次:
oficial-seca-2026-07轮次测量了 17个模型 × 每个模型900次回答,共15,300条原始回答。
主要结果
- 在无源访问的情况下,模型对BNCC官方文本的忠实回复率范围从 89% 到 2%。
- 排名前五的模型表现如下:
| # | 模型 | 综合评分 | 文本忠实率 | 接受虚假代码率 |
|---|---|---|---|---|
| 1 | GPT-5.6 Sol · OpenAI | 89.2 | 89% | 14% |
| 2 | Claude Fable 5 · Anthropic | 81.3 | 77% | 3% |
| 3 | Gemini 3.1 Pro · Google | 77.0 | 65% | 3% |
| 4 | GPT-5.6 Luna · OpenAI | 75.3 | 72% | 35% |
| 5 | DeepSeek V4 Pro · DeepSeek | 57.8 | 42% | 46% |
- 综合评分是五个维度的平均值(识别真实代码、拒绝虚假代码、文本忠实度、逆向查找、开放生成中的正确引用)。
- 文本忠实率是任务A中准确再现官方技能的回复比例。
- 接受虚假代码率是模型确认存在的、已核实为不存在的代码比例。
- 完整的17个模型、所有指标及示例可在
resultados/目录和bncc.dev的排行榜上查看。 - 关键洞察:高分不意味着模型可靠(榜首模型仍接受14%的虚假代码);文本准确与拒绝虚构是两种独立能力。
保留集
- 存在一个由相同流程生成的、从未公开发布的数据项集合。
- 其存在是为了区分模型是因学习内容而进步,还是因记忆测试题而进步。
- 该保留集不会被发布,仅发布聚合结果。
测量内容
该基准测试衡量四种类型的幻觉,对应四项任务:
| 任务 | 典型提问 | 测量内容 |
|---|---|---|
| A · 直接查找 | “技能EF67LP08的文本是什么?” | 编造或混淆的文本 |
| B · 存在性 | “技能X在BNCC中存在吗?是或否。” | 接受看似合理的虚假代码 |
| C · 开放生成 | “列出5个七年级数学技能,包括代码和文本。” | 实际使用中的编造代码 |
| D · 逆向查找 | “给定文本,找出此技能的代码。” | 逆向方向的记忆情况 |
- 正确答案是bncc.dev已验证的数据集(
@bncc/dados,1,721项学习内容,每项均可追溯至官方文件)。
数据集结构
harness/:基准测试代码(项目生成器、运行器、评估、聚合)itens/:版本化的项目库resultados/:按轮次组织的原始回答(JSONL格式)及聚合结果METODOLOGIA.md:完整协议DECISOES.md:编号的设计决策
维护方与使用
- 由Profy维护,已声明利益冲突(Profy运营使用LLM处理BNCC的产品)。
- 设计、项目、原始回答和判断均为公开且可重新计算的。
- 使用方式:通过
pnpm命令进行本地安装、生成项目、执行、评估、聚合和验证。详细步骤见docs/comecando.md。
许可协议
- 代码:MIT许可(
LICENSE-CODIGO.md) - 项目、结果和方法:CC BY 4.0许可(
LICENSE-DADOS.md) - 模型的回答复用条件详见
resultados/README.md
贡献指南
- 已发布的轮次不可变更,项目不通过PR修正,修正进入下一版本数据库。
- 改进测试平台、评估器、导出器和文档可通过正常流程进行。
- 安全问题和保留集泄露嫌疑需通过
SECURITY.md中指定的私密渠道报告。





