遇见数据集

eval_results

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

SakThai Eval Results 是一个存储 SakThai 模型家族评估结果、健康检查报告和基准运行日志的数据集。该数据集由 SakThai 的自动化 cron 工作流(基准测试、健康检查、推理探针)生成,作为 House of Sak 的操作审计追踪。所有结果文件均为机器可读的 YAML(.yaml)格式,而非表格格式(如 JSONL、Parquet、CSV),因此 Hub 数据集服务器不支持预览、查看器、搜索、过滤或统计功能。数据集包含 61 个 YAML 报告文件,总计约 63 个文件条目(含 .eval_results/ 目录、.gitattributes 和 README.md)。每个 YAML 文件遵循一致的字段结构:timestamp(ISO 8601 时间戳)、model(模型标识符,如 Nanthasit/sakthai-context-1.5b-tools)、check_type(检查类型:health、benchmark 或 inference)、status(状态:pass、fail 或 partial)、results(检查特定结果,包括分数、指标、错误计数)、duration_s(耗时秒数)和 errors(错误详情数组,仅当状态不是 pass 时存在)。数据集无分割,不定义 load_dataset() 配置。使用时应通过 huggingface_hub 的 hf_hub_download 函数下载单个 YAML 文件,并用 yaml.safe_load() 解析。数据集许可证为 MIT,语言为英语,最后更新于 2026-08-01。

SakThai Eval Results is a dataset that stores evaluation results, health check reports, and benchmark run logs for the SakThai model family. It is generated by SakThais automated cron workflows (benchmarking, health checks, inference probes) and serves as an operational audit trail for House of Sak. All result files are in machine-readable YAML (.yaml) format, not in tabular formats (such as JSONL, Parquet, CSV), so the Hub dataset server does not support preview, viewer, search, filtering, or statistics. The dataset contains 61 YAML report files, totaling about 63 file entries (including .eval_results/ directory, .gitattributes, and README.md). Each YAML file follows a consistent field structure: timestamp (ISO 8601 timestamp), model (model identifier, e.g., Nanthasit/sakthai-context-1.5b-tools), check_type (check type: health, benchmark, or inference), status (status: pass, fail, or partial), results (check-specific results including scores, metrics, error counts), duration_s (duration in seconds), and errors (array of error details, present only when status is not pass). The dataset has no splits and does not define a load_dataset() configuration. To use, download individual YAML files via the huggingface_hubs hf_hub_download function and parse with yaml.safe_load(). The dataset is licensed under MIT, language is English, and last updated on 2026-08-01.

创建时间:
2026-07-31
原始信息汇总

数据集概述

SakThai Eval Results 是一个用于存储 SakThai 模型家族评估结果、健康检查报告和基准测试运行日志的数据集,由 Nanthasit 创建,属于 House of Sak 项目的一部分。该数据集为 MIT 许可,语言为英文,持续自动更新(最后验证日期为 2026-08-01)。

核心特性

  • 非表格型数据集:所有结果文件均为 YAML 格式(.yaml),而非 JSONL/Parquet/CSV。因此 Hugging Face 数据集查看器不支持预览,load_dataset() 无法使用,需通过 yaml.safe_load() 读取。
  • 状态:活跃,由自动化 cron 工作流自动更新。
  • 规模:包含 61 个 YAML 报告文件,文件树总计 63 个条目(含 .eval_results/.gitattributesREADME.md)。
  • 创建时间:2026-07-30,最后更新:2026-08-01。

数据字段

每个 YAML 文件遵循统一结构:

字段 类型 描述
timestamp string ISO 8601 运行时间戳
model string 模型标识符(如 Nanthasit/sakthai-context-1.5b-tools
check_type string healthbenchmarkinference
status string passfailpartial
results object 检查特定结果(分数、指标、错误计数)
duration_s number 运行耗时(秒)
errors array pass 状态时的错误详情

数据集划分

无数据划分(splits),为扁平 YAML 报告文件集合,未定义 load_dataset() 配置。

基准测试结果(sakthai-bench-v2,500 样本)

以下为各模型在 2026-08-01 的评估结果(严格模式总体分数):

模型 总体 (严格) 选择 参数
sakthai-context-0.5b-merged 40.74 40.74 59.91
sakthai-context-1.5b-merged 43.79 43.79 44.66
sakthai-context-7b-merged 38.78 38.78 45.53
sakthai-plus-1.5b 39.65 39.65 61.66

类别细分(严格分数):

  • irrelevance_no_tools:所有模型均为 100.00
  • irrelevance_tools:0.5b 为 41.33,1.5b 为 97.33,7b 为 79.33,plus-1.5b 为 32.67
  • parallel:0.5b 为 35.77,1.5b 为 0.00,7b 为 0.00,plus-1.5b 为 43.80
  • simple:0.5b 为 21.31,1.5b 为 4.10,7b 为 7.38,plus-1.5b 为 18.85
  • held_out:0.5b 为 10.71,1.5b 为 7.14,7b 为 10.71,plus-1.5b 为 16.07

数据来源

该数据集基于以下源数据集构建:

  • Nanthasit/sakthai-combined-v6、v7、v10、v11
  • Nanthasit/sakthai-irrelevance-supplement
  • Nanthasit/sakthai-coder-browser
  • Nanthasit/hermes-tool-use-rl-env

标签与模型

  • 标签:sakthai、house-of-sak、evaluation、benchmark-results、health-check、model-health、yaml、results-log
  • 相关模型:sakthai-context-0.5b-tools/merged、1.5b-tools/merged、7b-tools/merged、sakthai-coder-1.5b、sakthai-coder-browser、sakthai-vision-7b、sakthai-tts

使用方式

通过 hf_hub_download 下载 YAML 文件,使用 yaml.safe_load() 解析,或使用 list_repo_files 遍历全部 .yaml 文件。

引用格式

bibtex @misc{sakthai-eval-results, author = {Nanthasit}, title = {SakThai Eval Results}, year = {2026}, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/Nanthasit/eval_results}} }

搜集汇总
数据集介绍
eval_results 数据集图片
构建方式
在人工智能模型评估领域,系统化的性能追踪与健康监测是确保模型可靠性的关键环节。SakThai Eval Results数据集由SakThai模型家族的自动化cron工作流生成,汇集了涵盖基准测试、健康检查与推断探针的61份YAML格式报告。这些机器可读的结果日志记录了模型在不同时间点的运行状态与性能指标,构成了House of Sak运营审计轨迹的核心部分。数据集的构建遵循统一的模式,每份YAML文件包含时间戳、模型标识、检查类型、状态、结果对象、运行时长及错误详情等字段,确保了信息的结构化和可解析性。
特点
该数据集的显著特征在于其非表格化的YAML格式,这与HuggingFace Hub上多数数据集形成鲜明对比。它并非为标准的数据行集合,而是时间点报告的汇编,因此无法通过load_dataset()直接加载,也不支持数据集查看器的预览、搜索或统计功能。数据集涵盖多个模型变体,如sakthai-context系列与sakthai-coder等,并详细记录了各模型在irrelevance、parallel、simple等不同任务类别上的选择、参数及严格评分。这些多维度性能数据为模型间的横向比较与纵向趋势分析提供了丰富的素材。
使用方法
使用该数据集需采用针对性的程序化访问策略。研究人员可通过huggingface_hub库的hf_hub_download函数下载特定YAML文件,并借助yaml.safe_load解析内容,以提取模型状态、评分等关键信息。若要获取完整报告集合,可调用list_repo_files枚举仓库文件并过滤YAML后缀。此方法绕过了HuggingFace数据集服务器的局限性,实现了对运营监测数据的有效利用。对于关注模型演化、工具使用能力及健康状态的开发者而言,该数据集提供了独特的实证基础,支持深入的性能分析与故障诊断。
背景与挑战
背景概述
eval_results数据集由SakThai团队于2026年7月创建,隶属于House of Sak项目,旨在系统性地记录与监控SakThai模型家族(涵盖0.5b至7b参数规模的上下文、编码、视觉及语音模型)的评估结果、健康检查报告与基准测试日志。该数据集以YAML格式存储,由自动化cron工作流生成,为模型开发提供了可追溯的操作审计线索,推动了多规模语言模型在工具调用与上下文理解领域的系统性评估与对比研究。
当前挑战
该数据集面临双重挑战:其一,在领域层面,其核心任务为评估语言模型的工具选择与参数生成能力,但当前结果显示各模型在parallel与simple类别上表现不佳,凸显了模型在复杂任务泛化上的瓶颈;其二,在构建过程中,由于数据集采用非表格化的YAML格式,HuggingFace平台的datasets-server无法索引,导致预览、搜索等常规功能不可用,用户必须依赖自定义脚本或直接文件访问,这增加了数据获取与消费的复杂度。
常用场景
经典使用场景
eval_results数据集作为SakThai模型家族自动化评估流程的产物,以YAML格式系统性地记录了各模型在sakthai-bench-v2基准上的性能表现。其核心使用场景在于为多模型对比分析提供结构化数据支撑,研究者可借此剖析不同参数规模(0.5b至7b)及变体(如context与plus系列)在工具选择、参数构造等维度的能力差异,从而深入理解模型架构与任务复杂度之间的内在关联。
解决学术问题
该数据集解决了大规模语言模型评估结果分散、难以复现与横向比较的学术痛点。通过统一的时间戳、模型标识与检查类型字段,它提供了标准化的评估日志,使研究者能够精准追踪模型迭代过程中的性能演变,并基于细粒度的类别得分(如irrelevance_no_tools、parallel)诊断特定能力短板,为模型优化提供数据驱动的实证依据,促进了评估方法论的可信度与可重复性。
衍生相关工作
围绕eval_results数据集,衍生出一系列模型评估与优化相关的后续研究。其在sakthai-bench-v2上的类别化成绩单(如parallel与simple任务的显著得分反差)为分析模型对复杂指令的遵循能力提供了基准,进而催生了对工具调用场景下模型鲁棒性的专题探究。同时,该数据集的长期积累为跨版本模型回归分析奠定了基础,推动了自动化评估工具链的完善及模型改进策略的实证验证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务