相关数据集
ByteDance/AncientDoc
AncientDoc是一个专为中文古籍文档理解设计的全面基准数据集。它包含从OCR到知识推理的多任务评估,旨在推动多模态大型模型在古籍场景下的识别、理解和推理能力的研究。数据集包含2973页文献,涵盖从战国时期到清朝的多个重要历史时期,分为14类文献类型。任务类型包括页面级OCR、文言文翻译、基于推理的问答、基于知识的问答和语言变体问答。
Hugging Face2025-09-08 更新1360
ByteDance/FullStackBench
FullStack Bench是一个多语言的全栈编程基准测试数据集,涵盖了广泛的应用领域和16种编程语言,包含3K个测试样本。该数据集旨在推动代码大语言模型在真实世界代码开发场景中的能力。数据集还包含SandboxFusion,一个用于评估不同编程任务的代码沙箱执行工具。
Hugging Face2024-12-04 更新500
ByteDance/MTVQA
--- language: - multilingual - ar - de - vi - ja - ko - fr - ru - it - th license: cc-by-nc-4.0 size_categories: - 10K<n<100K task_categories: - visual-question-answering - image-to-text tags: - multi
Hugging Face2024-05-30 更新400
ByteDance/ComTQA
ComTQA数据集是一个视觉表格问答基准数据集,包含9070个问答对和1591张图片。数据来源于FinTabNet和PubTables-1M。具体分布如下:PubTables-1M贡献了932张图片和6232个问答对,FinTabNet贡献了659张图片和2838个问答对。数据集的使用方法包括从原始网站下载数据,并根据提供的注释文件提取相应的图片。
Hugging Face2024-10-16 更新920
ByteDance/PatchEval
PatchEval是一个基准测试,旨在系统评估LLMs和代理在自动漏洞修复任务中的表现。它包含1,000个来自2015年至2025年报告的CVE漏洞,覆盖65个CWE类别,涉及Go、JavaScript和Python三种编程语言。其中230个CVE配备了Docker化的沙盒环境,支持通过概念验证(PoC)和单元测试进行运行时补丁验证。每个漏洞实例都是一个JSON对象,包含CVE ID、描述、CWE
Hugging Face2025-12-26 更新490



