遇见数据集

Replication package: A KST-based diagnostic evaluation of curriculum cognition in large language models (K12-Bench)

收藏
Zenodo2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

Replication package for a diagnostic evaluation of curriculum-structure cognition in large language models. Contains: (1) model evaluation outputs for 17,727 curriculum questions across five task families (Locate, Ground, Evidence, Prereq, Neighbor) for GPT-4o, GPT-4o-mini, DeepSeek-V3, and ERNIE-4.5, including prompt-ablation conditions; (2) KST-Adversarial robustness testing data (Neighbor-Complement n=1,800; Prereq-Reverse n=297); (3) a 40-item English cross-lingual mini-benchmark and evaluations; (4) de-identified human baseline data (N=2,235) with a three-teacher answer-key verification and dual-coder error-type annotations (800 items); (5) analysis code reproducing all reported statistics, including reliability, precision/recall scoring decompositions, multiple-comparison-corrected tests, and closure-propagation conditional probabilities. Released under CC-BY-4.0. All human and teacher data are de-identified.

提供机构:
Zenodo
创建时间:
2026-09-30
二维码
社区交流群
二维码
科研交流群
商业服务