登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
DAMO-NLP-SG/HyperlinkMRC
DAMO-NLP-SG/HyperlinkMRC
收藏
Hugging Face
2023-06-21 更新
2024-03-04 收录
数据链接:
https://hf-mirror.com/datasets/DAMO-NLP-SG/HyperlinkMRC
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: mit ---
许可证:MIT许可证(MIT License)
应用场景:
提供机构:
DAMO-NLP-SG
原始信息汇总
数据集概述
许可证信息
许可证类型
: MIT
相关数据集
DAMO-NLP-SG/Multi-Source-Video-Captioning
视频字幕生成
影视内容分析
MSVC数据集是一个视频字幕生成数据集,旨在全面评估视频-LLMs的视频字幕生成能力。该数据集从MSVD、MSRVTT和VATEX中采样了1500个视频,每个视频都带有多种人类注释的标题,涵盖了视频的不同方面。传统的评估方法依赖于生成字幕与真实字幕之间的精确匹配统计,这在捕捉视频内容的丰富性方面存在局限性。因此,MSVC采用了类似于VideoChatGPT的ChatGPT辅助评估方法,通过GPT-
Hugging Face
2024-06-17 更新
27
0
DAMO-NLP-SG/CMM
多模态模型评估
结构缺陷检测
多模态诅咒(CMM)数据集是一个经过精心策划的基准,旨在评估大型多模态模型(LMMs)在视觉、音频和语言模态中产生的幻觉漏洞。该数据集包含了来自WebVid、AudioCaps、Auto-ACD和YouTube的1200个精心挑选的视频/音频/视频-音频样本,以及针对每个样本的2400个探针问题。这些问题旨在评估模型对真实存在和非存在物体或事件的感知准确性和抗幻觉能力。
Hugging Face
2025-05-15 更新
16
0
DAMO-NLP-SG/LongCorpus-2.5B
文本生成
文本预训练
我们收集了一个2.5B的训练数据集,用于长上下文持续预训练,该数据集来自多个领域。数据集的构成如下:书籍占40%,Arxiv占20%,通用文本占20%,代码占10%,问答占5%,摘要占5%。我们还策划了一个包含250百万个tokens的测试数据集,其构成与训练数据集相似,但排除了问答和摘要数据,以确保测试数据的独立性。测试数据集中书籍、Arxiv、通用文本和代码的tokens分布比例为4:2:2:
Hugging Face
2024-01-19 更新
15
0
DAMO-NLP-SG/multimodal_textbook
视觉语言预训练
教学视频
Multimodal-Textbook-6.5M是一个用于视觉语言预训练的多模态教材,包含6.5M个从教学视频中提取的关键帧和0.8B个文本(ASR文本)。这些数据和文本覆盖了数学、物理、化学等多个基础学科,提供了丰富的知识和连贯的上下文,用于图像和文本的对齐。
Hugging Face
2025-03-17 更新
18
0
DAMO-NLP-SG/Mistral-7B-LongPO-512K-tokenized
自然语言处理
语言模型
该数据集包含了文本数据的多个特征字段,如选中的输入ID、注意力掩码、标签等,以及被拒绝的对应字段。数据集分为训练集,总大小约为77亿字节,包含2451个样本。
Hugging Face
2025-02-17 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广