The Structured Output Benchmark
收藏资源简介:
SOB测量LLM生成的JSON的值级正确性,而不仅仅是JSON是否有效。我们在一个统一的评估框架下评估模型在三种源模态(文本、图像和音频)上的表现。
SOB measures the value-level correctness of JSON generated by large language models (LLMs), rather than merely verifying whether the JSON is syntactically valid. We evaluate model performance across three source modalities (text, image, and audio) under a unified evaluation framework.
数据集概述
数据集名称: SOB (Structured Output Benchmark) 发布机构: Interfaze AI 数据集地址: https://huggingface.co/datasets/interfaze-ai/sob 数据集论文: https://interfaze.ai/sob_paper.pdf
数据集核心目标
SOB 是一个多源基准测试,用于评估大语言模型(LLMs)生成的结构化输出(JSON)的质量。它评估的是值级别的正确性,而不仅仅是 JSON 格式是否有效。
数据集模态与规模
数据集覆盖三种输入模态,所有模态均在统一的评估框架下进行评测:
| 模态 | 数据集子集 | 记录数 | 加载方式 |
|---|---|---|---|
| 文本 (Text) | test | 5,000 条 | load_dataset("interfaze-ai/sob", split="test") |
| 图像 (Image) | train | 209 条 | load_dataset("interfaze-ai/sob", "image", split="train") |
| 音频 (Audio) | train | 115 条 | load_dataset("interfaze-ai/sob", "audio", split="train") |
评估指标
基准测试使用七项指标,全面衡量结构化输出质量:
- Overall (总体评分): 覆盖度调整后的综合得分,聚合文本、图像、音频三个模态的结果。
- Val. Acc. (值准确率): 值级别的正确性。
- Faithful. (忠实度): 模型输出是否忠实于输入源信息。
- JSON Pass (JSON通过率): 生成有效 JSON 的比例。
- Path Rec. (路径召回率): JSON 路径的召回情况。
- Str. Cov. (结构覆盖率): 对预期输出结构的覆盖程度。
- Type Saf. (类型安全性): 数据类型的正确性。
- Perfect (完美响应): 完美响应率(仅聚合文本和图像模态)。
排行榜(截至数据集发布时)
综合排名前五 (Overall 分数):
| 排名 | 模型 | Overall | Val. Acc. | Faithful. | JSON Pass | Path Rec. | Str. Cov. | Type Saf. | Perfect |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.4 | 0.870 | 0.798 | 0.869 | 0.993 | 0.988 | 0.981 | 0.993 | 0.469 |
| 2 | GLM-4.7 | 0.861 | 0.804 | 0.868 | 0.965 | 0.959 | 0.957 | 0.965 | 0.508 |
| 3 | Qwen3.5-35B | 0.861 | 0.801 | 0.863 | 0.969 | 0.962 | 0.960 | 0.969 | 0.500 |
| 4 | Gemini-2.5-Flash | 0.860 | 0.796 | 0.856 | 0.972 | 0.967 | 0.961 | 0.972 | 0.498 |
| 5 | Qwen3-235B | 0.857 | 0.786 | 0.854 | 0.978 | 0.970 | 0.968 | 0.978 | 0.463 |
各模态最佳模型:
- 文本: GLM-4.7 (0.830)
- 图像: Gemma-4-31B (0.672)
- 音频: Gemini-2.5-Flash (0.237)
完整的实时排行榜请参阅:interfaze-ai/sob-leaderboard
使用方法
1. 安装 bash git clone https://github.com/JigsawStack/sob && cd sob uv venv && source .venv/bin/activate make install
2. 运行推理
- 支持多种后端:OpenRouter、OpenAI、Anthropic、Gemini、vLLM(本地部署)。
- 示例(运行文本模态,5条记录): bash python -m sob.run --provider openrouter --modality text --model-id google/gemma-4-31b-it --sample-size 5
3. 评估
- 对生成的响应文件进行评测: bash python evaluate.py data/text_responses/response_google_gemma-4-31b-it.jsonl
数据来源与许可证
- 数据集许可证: MIT License。
- 源数据许可证:
- HotpotQA: CC-BY-SA-4.0
- AMI Meeting Corpus: CC-BY-4.0
- olmOCR-bench / olmOCR: ODC-BY / Apache-2.0




