登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
ScaleAI/mhj-wmdp-bio
ScaleAI/mhj-wmdp-bio
收藏
Hugging Face
2024-09-19 更新
2025-04-12 收录
数据链接:
https://hf-mirror.com/datasets/ScaleAI/mhj-wmdp-bio
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cc-by-nc-4.0 ---
许可协议:CC BY-NC 4.0(知识共享署名-非商业性使用4.0国际公共许可协议)
应用场景:
提供机构:
ScaleAI
相关数据集
ScaleAI/fortress_public
语言模型安全评估
对抗性测试
该数据集包含用于评估大型语言模型(LLM)的安全性和公共安全的风险和安全的对抗性提示及其相关量表。数据集由一个训练集组成,包含500个样本,数据集大小为1268259字节。数据集的目的是通过对抗性提示和量表来评价LLM在国家安全和公共安全方面的前沿风险。
Hugging Face
2025-08-05 更新
45
0
ScaleAI/SciPredict
科学实验预测
自然语言处理
SciPredict是一个基准测试数据集,用于评估AI系统在物理、生物和化学领域预测实验结果的能力。该数据集包含405个问题,这些问题来源于2025年3月后发表的实证研究,覆盖了33个子领域。数据集结构包括问题数量(405个问题,5,716行包含模型响应)、领域分布(物理9个子领域,化学10个子领域,生物14个子领域)和问题格式(多选题、自由格式、数值题)。关键字段包括科学领域、具体领域、问题格式
Hugging Face
2026-01-15 更新
18
0
ReJ dataset
幽默生成
文本分析
该数据集是基于用户评分的Reddit笑话集合,旨在为幽默生成能力提供一个基准。该数据集经过筛选,仅包含根据用户点赞数量判断为高质量的笑话,并且还包含了一个清洁过程,以移除那些可能妨碍幽默理解的干扰因素。该数据集的规模为156个笑话,是从Reddit上抽取的子样本。其任务是评估幽默生成的质量。
arXiv
16
0
ScaleAI/MultiChallenge
对话评估
语言模型基准测试
--- license: cc-by-4.0 task_categories: - text-generation - question-answering language: - en tags: - multi-turn - evaluation - benchmark - llm pretty_name: MultiChallenge size_categories: - n<1K data
Hugging Face
2026-03-31 更新
26
0
ScaleAI/SWE-bench_Pro
软件缺陷修复
代码补丁验证
--- dataset_info: features: - name: repo dtype: string - name: instance_id dtype: string - name: base_commit dtype: string - name: patch dtype: string - name: test_patch
Hugging Face
2026-02-23 更新
18
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广