登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Notes from workshop on AI evaluating the impact of AI on insurance
Notes from workshop on AI evaluating the impact of AI on insurance
收藏
Figshare
2019-09-15 更新
2026-04-29 收录
保险科技
人工智能评估
数据链接:
https://figshare.com/articles/dataset/Notes_from_workshop_on_AI_evaluating_the_impact_of_AI_on_insurance/9845048
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Notes from workshop on AI evaluating the impact of AI on insurance
应用场景:
创建时间:
2019-09-15
相关数据集
ETHICS
伦理学
人工智能评估
该数据集名为ETHICS,包含了五个子数据集,分别代表不同的伦理学领域:正义、义务论、美德伦理学、功利主义和常识伦理学。这些道德判断经过精心挑选,以体现人类共有的价值观。该数据集旨在通过不同的伦理框架评估人工智能对人类共同价值观的理解能力。规模上,多个子数据集包含的例子数量不一,其中正义、美德伦理学和功利主义各有100个例子,其他子数据集则有50个。该数据集的任务是评估在各种伦理场景中的道德判断。
arXiv
91
0
R2-AVSBench
自然语言处理
人工智能评估
R2-AVSBench是一个新的评估基准,设计用于包含更多具有语言多样性和推理密集性的参考。它旨在更好地评估模型在跨引用场景中的性能。该数据集由 Mohamed Bin Zayed University of Artificial Intelligence, National University of Singapore, University of Science and Technology
arXiv
2025-08-06 更新
40
0
WITNESS’ Truly Innovative and Effective AI Detection (TRIED) Benchmark
人工智能评估
检测工具评估
WITNESS开发的“真正创新和有效的人工智能检测”(TRIED)基准是一个新的框架,用于评估检测工具的真正影响和创新能力。该数据集基于一线经验、欺骗性AI案例和全球咨询,旨在解决AI检测工具在现实世界场景中的局限性,如可解释性、公平性、可访问性和上下文相关性等方面的挑战。通过采用TRIED基准,利益相关者可以推动创新,保护公众信任,加强人工智能素养,并为更强大的全球信息可信度做出贡献。
arXiv
2025-04-30 更新
25
0
TeleEgo
人工智能评估
第一人称视角
TeleEgo是一个用于评估第一人称视角人工智能助手在现实世界场景下能力的长期、流式、全模态基准数据集。数据集包含来自多个参与者的同步视频、音频和文本数据,每个参与者贡献超过14小时的记录。所有数据流都精确地对齐到一个统一的全球时间线上,并丰富了手动编辑的语音转录和视觉叙述,以确保高质量和语义清晰。TeleEgo定义了12个诊断子任务,涵盖三个核心能力:记忆(回忆过去的事件)、理解(解释当前时刻)
arXiv
2025-10-28 更新
75
0
WiseEdit-Benchmark
图像编辑
人工智能评估
WiseEdit是一个知识密集型的基准数据集,旨在评估认知和创造力指导下的图像编辑能力。它将基于指令的编辑分解为三个阶段:Awareness(感知)、Interpretation(解释)和Imagination(想象),并提供了1,220个双语测试案例以及基于GPT-4o的自动评估流程。数据集围绕任务深度和知识广度构建,包括四种任务类型和三种知识类型,强调文化常识、自然科学和时空逻辑的编辑要求。评
Hugging Face
2025-12-08 更新
32
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广