登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
ibm-research/BFCL-FC-robustness
ibm-research/BFCL-FC-robustness
收藏
Hugging Face
2025-03-06 更新
2025-04-12 收录
数据链接:
https://hf-mirror.com/datasets/ibm-research/BFCL-FC-robustness
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cdla-permissive-2.0 ---
应用场景:
提供机构:
ibm-research
相关数据集
ibm-research/nestful
编程语言
数学推理
NESTFUL是一个用于评估大型语言模型(LLM)在嵌套API调用序列上的性能的基准数据集。该数据集包含超过1800个嵌套序列,主要来自数学推理和编码工具两个领域。数学推理部分来源于MathQA数据集,而编码部分来源于StarCoder2-Instruct数据集。数据集中的所有函数调用都是可执行的。每个样本包含用户查询、可用的工具目录、地面真实函数调用序列以及执行这些函数调用后的最终答案。
Hugging Face
2025-05-22 更新
33
0
ibm-research/otter_uniprot_bindingdb
蛋白质-药物相互作用
生物信息学
--- license: mit --- # Otter UB Dataset Card UB is a dataset comprising entities (Proteins/Drugs) from Uniprot (U) and BindingDB (B) ## Dataset details #### Uniprot Uniprot comprises of 573,227 pr
Hugging Face
2023-06-26 更新
13
0
ibm-research/justrank_judge_scores
大型语言模型评估
排行榜创建
JuStRank Judge Scores数据集是关于LLM评估者和奖励模型对63个系统在Arena Hard v0.1基准的500个问题所给出的质量评分的原始数据集。这些评分用于评估LLM评估者在系统级排名中的性能和行为,并用于创建JuStRank排行榜。
Hugging Face
2025-06-08 更新
10
0
ibm-research/POBS
社会调查
自然语言处理
Preference, Opinion, and Belief Survey (POBS)是一个综合性的评估大型语言模型主观倾向的基准数据集,包括偏好、观点和信仰,跨越有争议的、社会的、文化的和个人领域。该数据集由IBM研发,能够系统地、无需参考基准地评估LLM的主观性,帮助组织、研究人员和实践者在部署前审计模型的中立性、一致性和隐含偏见。
Hugging Face
2025-07-22 更新
15
0
ibm-research/SocialStigmaQA-JA
语言模型社会偏见评估
生成式AI伦理审计
SocialStigmaQA-JA数据集是一个用于测试大型语言模型社会偏见的日语版本数据集,包含了大约10K个经过精心翻译的提示,旨在系统地测试社会偏见和模型的鲁棒性。该数据集从93个美国中心主义偏见列表和手 curated问答模板构建而成,这些模板涉及社会情境。数据集特别关注每个模板的两个方面:带有偏见的答案选择和提示风格。
Hugging Face
2025-01-09 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广