登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Question-based Assessment: Human vs. ChatGPT
Question-based Assessment: Human vs. ChatGPT
收藏
kaggle
2023-08-28 更新
2024-03-08 收录
人工智能评估
性能比较
数据链接:
https://www.kaggle.com/datasets/mujtabamatin/question-based-assessment-human-vs-chatgpt
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Bridging the Gap: Human and ChatGPT Performance in Question-based Evaluation
应用场景:
创建时间:
2023-08-28
相关数据集
MTCMB
中医药
人工智能评估
MTCMB是一个多任务基准框架,用于评估大型语言模型(LLM)在中医药知识、推理和安全方面的能力。它包含12个子数据集,涵盖了五个主要类别:知识问答、语言理解、诊断推理、处方生成和安全评估。该基准集整合了真实世界案例记录、国家执业医师资格考试和经典文本,为中医药能力模型提供了一个真实和全面的测试平台。初步结果表明,当前的大型语言模型在基础知识方面表现良好,但在临床推理、处方规划和安全合规方面仍存在
arXiv
2025-06-02 更新
155
0
Energy Decision Benchmark (EDB-P)
能源管理
人工智能评估
能源决策基准(EDB)是一个用于评估受监管能源领域AI系统操作准备情况的可重复基准。它解决了大多数AI基准关注通用能力,但关键基础设施需要系统在监管约束下安全运行的空白。
github
2026-01-23 更新
17
0
Reve-AI-Halfmoon_t2i_human_preference
人工智能评估
图生成
.vertical-container { display: flex; flex-direction: column; gap: 60px; } .image-container img { max-height: 250px; /* Set the desired height */ margin:0; object-fit:
魔搭社区
2025-11-12 更新
8
0
WITNESS’ Truly Innovative and Effective AI Detection (TRIED) Benchmark
人工智能评估
检测工具评估
WITNESS开发的“真正创新和有效的人工智能检测”(TRIED)基准是一个新的框架,用于评估检测工具的真正影响和创新能力。该数据集基于一线经验、欺骗性AI案例和全球咨询,旨在解决AI检测工具在现实世界场景中的局限性,如可解释性、公平性、可访问性和上下文相关性等方面的挑战。通过采用TRIED基准,利益相关者可以推动创新,保护公众信任,加强人工智能素养,并为更强大的全球信息可信度做出贡献。
arXiv
2025-04-30 更新
19
0
ecnu-icalk/PsychEval
心理咨询
人工智能评估
PsychEval是一个综合性基准测试,旨在评估大型语言模型(LLMs)在心理咨询场景中的表现。与现有基准测试不同,PsychEval强调纵向、多会话的咨询过程和多疗法能力。数据集包含6-10次会话的完整咨询周期,分为三个阶段:案例概念化、核心干预和巩固。数据集支持不同治疗方法(如CBT、SFBT)的评估,并包含大量专业技能的标注(677种元技能和4577种原子技能)。此外,PsychEval引入
Hugging Face
2026-01-13 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广