登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
"\u6570\u636e\u96c6"
"\u6570\u636e\u96c6"
收藏
DataCite Commons
2025-05-10 更新
2025-05-17 收录
模型评估
性能分析
数据链接:
https://ieee-dataport.org/documents/shujuji
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
"\u4e0d\u540c\u6a21\u578b\u7684\u6548\u679c"
应用场景:
提供机构:
IEEE DataPort
创建时间:
2025-05-10
相关数据集
open-llm-leaderboard/details_jondurbin__airoboros-l2-13b-3.0
模型评估
自然语言处理
该数据集是在模型[jondurbin/airoboros-l2-13b-3.0](https://huggingface.co/jondurbin/airoboros-l2-13b-3.0)的评估过程中自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集是从2次运行中创建的,每次运行的结果都存储为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个
Hugging Face
2023-10-24 更新
19
0
PosIR-Benchmark-v1
文本检索
模型评估
PosIR是一个用于评估检索模型对段落中相关信息位置敏感性的基准数据集。该数据集旨在解决现代检索模型中普遍存在的位置偏差问题,即模型倾向于过度重视段落开头的信息而忽视后面出现的语义相关内容。研究结果表明,密集嵌入模型和ColBERT风格的晚期交互模型对位置偏差非常敏感,而传统的BM25和完整交互的重新排序模型则表现出更高的鲁棒性。数据集为每个领域提供了两个不同的测试集,通过比较模型在'Head'集
Hugging Face
2025-09-07 更新
4
0
OALL/details_Triangle104__DeepSky-T100
模型评估
自然语言处理
这个数据集是在评估模型Triangle104/DeepSky-T100时自动创建的。数据集由136个配置组成,每个配置对应一个评估任务。数据集由1次运行组成,每个运行都可以在各个配置的特定分割中找到,分割的名称使用运行的的时间戳。train分割始终指向最新的结果。还有一个额外的配置results存储了所有运行的综合结果。README还提供了一个使用Python中的datasets库从运行中加载详细
Hugging Face
2025-02-06 更新
2
0
open-llm-leaderboard-old/details_ignos__Mistral-T5-7B-v1
自然语言处理
模型评估
该数据集是在Open LLM Leaderboard上对模型ignos/Mistral-T5-7B-v1进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,用于计算和显示Open LLM
Hugging Face
2023-12-18 更新
19
0
Appendix D. Model evaluation.
模型评估
Model evaluation.
DataCite Commons
2020-09-03 更新
3
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广