登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Table_S4_gpt4omini_llm_results_240802
Table_S4_gpt4omini_llm_results_240802
收藏
Figshare
2024-10-17 更新
2026-04-28 收录
信息提取
大型语言模型评估
数据链接:
https://figshare.com/articles/dataset/Table_S4_gpt4omini_llm_results_240802/27246492
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Table S4: the results of information extraction using GPT-4o-mini in 20240802.
应用场景:
创建时间:
2024-10-17
相关数据集
OSVBench
操作系统验证
大型语言模型评估
OSVBench是一个用于评估大型语言模型(LLMs)在生成操作系统内核验证任务相关完整规范代码方面的基准。该基准将规范生成问题定义为在语法和语义的限定范围内进行程序合成问题,并为LLMs提供编程模型。LLMs需要理解提供的验证假设和潜在的语法和语义空间,然后在操作系统的高级功能描述的指导下,为可能存在错误的操作系统代码实现生成完整的规范。该基准建立在真实的操作系统内核Hyperkernel之上,
arXiv
2025-04-30 更新
65
0
AUEB-NLP/greek-bar-bench
法律推理
大型语言模型评估
GreekBarBench 是一个用于评估大型语言模型(LLM)在五个不同法律领域内进行复杂法律推理能力的基准数据集。该数据集由希腊律师资格考试(2015-2024年)中的法律问题组成,要求模型在开放书籍格式下,结合案件事实、法律问题以及相关法律条文进行推理,并提供包含明确引用的案件事实和法律条文的自由文本答案。数据集旨在评估复杂的法律推理能力,包括多跳推理和法律条文的准确应用。
Hugging Face
2025-06-06 更新
13
0
smalleval/mmlu-nano
大型语言模型评估
多任务语言理解
# SmallEval: Browser-Friendly LLM Evaluation Datasets 🚀 [](https://cloudcode.ai) SmallEval is a curated
Hugging Face
2025-01-20 更新
9
0
open-llm-leaderboard/details_TheBloke__llama-30b-supercot-SuperHOT-8K-fp16
大型语言模型评估
多领域知识
--- pretty_name: Evaluation run of TheBloke/llama-30b-supercot-SuperHOT-8K-fp16 dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [TheBloke/llama-30b-supercot-Sup
Hugging Face
2023-08-27 更新
14
0
open-llm-leaderboard/details_BEE-spoke-data__smol_llama-81M-tied
大型语言模型评估
多任务基准测试
该数据集是在评估模型BEE-spoke-data/smol_llama-81M-tied在Open LLM Leaderboard上的表现时自动创建的。数据集包含64个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于计算和
Hugging Face
2023-11-18 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广