遇见数据集

bncc-benchmark

收藏
github2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

这是一个关于巴西国家共同课程基础(BNCC)的LLM幻觉公开基准测试数据集。它通过开放的方法论和发布的原始数据,测量语言模型在无法访问结构化源时对BNCC代码和文本的虚构程度,以及通过bncc.dev进行基础接地后问题的缓解情况。数据集包含官方轮次oficial-seca-2026-07的15300个原始回答,涉及17个模型,每个模型900个回答。

This is an open public benchmark dataset for evaluating LLM hallucinations related to the Brazilian National Common Core Curriculum (BNCC). Utilizing open methodologies and released raw data, it measures the hallucination level of language models towards BNCC-related codes and texts when structured sources are inaccessible, as well as the mitigation of such hallucinations when grounded via bncc.dev. The dataset includes 15,300 raw responses from the official round oficial-seca-2026-07, covering 17 models with 900 responses per model.

创建时间:
2026-07-13
原始信息汇总

数据集概述

这是一个针对巴西国家共同课程基础(BNCC)的大语言模型幻觉公开基准测试数据集。

  • 核心目标:衡量大语言模型在回答BNCC相关内容时编造代码和文本的程度,以及通过bncc.dev(MCP与API)进行源引用后该问题消失的程度。
  • 测试轮次oficial-seca-2026-07 轮次测量了 17个模型 × 每个模型900次回答,共15,300条原始回答。

主要结果

  • 在无源访问的情况下,模型对BNCC官方文本的忠实回复率范围从 89% 到 2%
  • 排名前五的模型表现如下:
# 模型 综合评分 文本忠实率 接受虚假代码率
1 GPT-5.6 Sol · OpenAI 89.2 89% 14%
2 Claude Fable 5 · Anthropic 81.3 77% 3%
3 Gemini 3.1 Pro · Google 77.0 65% 3%
4 GPT-5.6 Luna · OpenAI 75.3 72% 35%
5 DeepSeek V4 Pro · DeepSeek 57.8 42% 46%
  • 综合评分是五个维度的平均值(识别真实代码、拒绝虚假代码、文本忠实度、逆向查找、开放生成中的正确引用)。
  • 文本忠实率是任务A中准确再现官方技能的回复比例。
  • 接受虚假代码率是模型确认存在的、已核实为不存在的代码比例。
  • 完整的17个模型、所有指标及示例可在resultados/目录和bncc.dev的排行榜上查看。
  • 关键洞察:高分不意味着模型可靠(榜首模型仍接受14%的虚假代码);文本准确与拒绝虚构是两种独立能力

保留集

  • 存在一个由相同流程生成的、从未公开发布的数据项集合。
  • 其存在是为了区分模型是因学习内容而进步,还是因记忆测试题而进步。
  • 该保留集不会被发布,仅发布聚合结果。

测量内容

该基准测试衡量四种类型的幻觉,对应四项任务:

任务 典型提问 测量内容
A · 直接查找 “技能EF67LP08的文本是什么?” 编造或混淆的文本
B · 存在性 “技能X在BNCC中存在吗?是或否。” 接受看似合理的虚假代码
C · 开放生成 “列出5个七年级数学技能,包括代码和文本。” 实际使用中的编造代码
D · 逆向查找 “给定文本,找出此技能的代码。” 逆向方向的记忆情况
  • 正确答案是bncc.dev已验证的数据集(@bncc/dados,1,721项学习内容,每项均可追溯至官方文件)。

数据集结构

  • harness/:基准测试代码(项目生成器、运行器、评估、聚合)
  • itens/:版本化的项目库
  • resultados/:按轮次组织的原始回答(JSONL格式)及聚合结果
  • METODOLOGIA.md:完整协议
  • DECISOES.md:编号的设计决策

维护方与使用

  • Profy维护,已声明利益冲突(Profy运营使用LLM处理BNCC的产品)。
  • 设计、项目、原始回答和判断均为公开且可重新计算的。
  • 使用方式:通过 pnpm 命令进行本地安装、生成项目、执行、评估、聚合和验证。详细步骤见docs/comecando.md

许可协议

贡献指南

  • 已发布的轮次不可变更,项目不通过PR修正,修正进入下一版本数据库。
  • 改进测试平台、评估器、导出器和文档可通过正常流程进行。
  • 安全问题和保留集泄露嫌疑需通过SECURITY.md中指定的私密渠道报告。
搜集汇总
数据集介绍
bncc-benchmark 数据集图片
构建方式
在人工智能与教育深度融合的浪潮中,大型语言模型在知识问答场景中的幻觉问题已成为关键挑战。bncc-benchmark数据集正是为系统评估LLMs在巴西国家通用课程基础上的表现而构建。该数据集以bncc.dev官方验证的1,721个学习目标为基准,每条数据均可追溯至官方文档。构建过程遵循严格的方法论:通过自动化管线生成涵盖四种任务类型的测试项目,包括直接查找、存在性判断、开放式生成和反向查找。所有项目、原始响应和评估结果均以版本化形式公开,确保研究可重复性。
特点
该数据集的核心特色在于其多维度的评估框架与对抗记忆化的设计哲学。数据集的评估维度精细划分为五个层面,涵盖真实代码识别、虚假代码拒绝、文本忠实度、反向查找准确性以及开放式生成中的引用正确性。特别值得注意的是,数据集包含一个永不公开的held-out子集,用以区分模型是真正习得了知识还是仅凭记忆作答。此外,所有模型响应均经规范化处理,并配有自动化CI验证,从机制上杜绝了结果篡改的可能。
使用方法
研究者可通过标准化的pnpm工作流便捷地使用该数据集。首先运行项目安装与预设测试确保环境一致性,随后依次执行测试项生成、模型执行、评估与聚合四个步骤。环境变量中配置的API密钥保证了本地执行的私密性。值得关注的是,所有已发布的测试轮次均为不可变快照,这意味着研究者的改进应当基于下一版本的项目库而非修改现有结果。详细的使用协议与贡献指南分别在对应文档中阐明,为学术合作与工业应用提供了清晰的操作路径。
背景与挑战
背景概述
bncc-benchmark是巴西国家通用课程基准(BNCC)领域内首个聚焦大语言模型幻觉评估的公开基准,由教育科技公司Profy于2026年7月发起并维护。其核心研究问题在于:当LLMs在缺乏结构化数据源支持的情况下,对巴西官方教育标准BNCC中的技能代码与文本进行查询或生成时,能否忠实复现官方内容。该基准通过设计直接查找、存在性判断、开放生成与反向查找四项任务,系统测量模型在编码与文本层面的捏造率。此次评测涵盖17个主流模型,共计生成15,300条原始响应,揭示了即使在顶尖模型中,文本忠实度与虚假代码拒绝率之间亦存在显著脱节,为教育领域LLM可靠性研究提供了关键量化参照。
当前挑战
数据集所解决的首要挑战是LLMs在回答教育标准类事实查询时普遍存在的‘幻觉’现象——模型在缺乏访问权限的情况下,可能杜撰出格式规范但内容虚构的技能代码与文本,严重威胁教育决策的准确性。构建过程中面临方法学困境:一为基准发布后可能被纳入模型训练,导致后续评测结果混淆了真实学习与记忆印记,为此团队设计了永不公开的held-out集合作为对比验证;二为利益冲突的透明化处理,项目维护方Profy自身运营基于LLM的教育产品,通过完全公开所有原始数据、方法及计算流程的自治约束机制予以消除。此外,虚假代码的构建需精准利用官方编号规则中的合法空隙,这依赖于对BNCC数据集(含1,721项技能)的深入解析与验证。
常用场景
经典使用场景
在基础教育课程改革持续推进的背景下,巴西国家通用课程基准(BNCC)作为全国统一的课程标准,其文本的精确性对教育质量评估至关重要。该数据集聚焦于大语言模型在回答关于BNCC的查询时出现的幻觉问题,核心使用场景包括:构建标准化测试集以评估模型对官方教育课程文本的记忆与复现能力;通过四种差异化任务(直接查询、存在性判断、开放生成及反向查找)系统性地量化模型在文本忠实度与代码真实性维度的表现;还可作为基准验证检索增强生成等接地技术对消除幻觉的实际效果。这些任务共同构成了检测模型在教育领域真实文本理解与生成能力的标准化实验场。
衍生相关工作
该数据集催生了一系列沿着评估框架与方法论深化的衍生工作。在评估维度上,基于其四项基础任务的范式,后续研究扩展出面向多语言教育标准对齐的跨课程幻觉评估体系;在数据建设层面,公开的17个模型×900条回答的原始语料库为模型行为分析提供了稀有资源,推动了模型差异归因、幻觉模式分类等分析性研究;在缓解技术方面,围绕接地策略的有效性比较,涌现出针对教育文本的定制化检索增强方案。此外,held-out集合的设计思想被借鉴至医疗、法律等其他知识密集型领域,形成了结构化幻觉基准的方法论脉络,强化了自然语言理解评估中的数据隔离与泛化能力考量。
数据集最近研究
最新研究方向
该基准测试聚焦于评估大型语言模型在巴西国家通用课程基础上的事实幻觉问题,其核心研究前沿在于构建开放、可复现的评估框架以量化模型在无外部知识源接入时对专业领域文本的伪造倾向。通过与bncc.dev的MCP及API地面实况锚定对比,该工作揭示了模型忠实度跨度极大(从89%至2%),并创新性地区分了文本准确性与拒绝虚假编码的两种独立能力,为当前大语言模型在教育和法规等需要严格事实遵守的场景下部署提供了关键风险衡量标准。此外,held-out数据集的引入是针对训练数据污染问题的前沿响应,确保了未来版本评测的区分度与完整性,这一方法论对整个LLM评估社区具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务