登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
caskcsg/Litelong_Nextlong_64k
caskcsg/Litelong_Nextlong_64k
收藏
Hugging Face
2025-09-19 更新
2026-01-03 收录
数据链接:
https://hf-mirror.com/datasets/caskcsg/Litelong_Nextlong_64k
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
caskcsg
相关数据集
caskcsg/LongBench-Pro
上下文评估
双语基准
LongBench Pro是一个更真实、更全面的双语长上下文评估基准数据集,包含1,500个样本,完全基于真实的自然长文档构建。它涵盖11个主要任务和25个次要任务,评估现有基准测试中所有长上下文能力。数据集采用多样化的评估指标,支持对模型能力的细粒度测量,并提供平衡的英文和中文双语样本。此外,LongBench Pro引入了多维分类法,支持在不同操作条件下对模型进行全面评估,包括上下文要求(全局
Hugging Face
2025-12-14 更新
28
0
caskcsg/Libra-Emo
视频分析
情绪识别
Libra-Emo是一个大规模的多模态细粒度数据集,用于负面情绪检测。它包括视频片段、字幕、情绪标签和相应的解释。数据集是单语言的(英语),并遵循CC BY 4.0许可证发布。数据集的大小在10K到100K样本之间,分为训练集和测试集。特征包括视频、字幕、标签和解释。README提供了详细的下载、解压和使用数据集的说明,以及用于预测和评估的脚本。该数据集专为视频分类任务设计,特别是用于识别负面情绪
Hugging Face
2025-05-25 更新
19
0
caskcsg/LongMagpie_singledoc_longcontext_dataset
自然语言处理
指令数据生成
LongMagpie是一个自合成框架,用于自动生成大规模长上下文指令数据。该框架利用已对齐的长上下文大型语言模型(LLMs)自动生成上下文相关的查询,通过收集这些文档-查询对和模型的响应,LongMagpie能够产生高质量的指令,无需人工干预。实验表明,LongMagpie在长上下文任务上取得了领先性能,同时在短上下文任务上也保持了竞争力。
Hugging Face
2025-08-02 更新
14
0
caskcsg/NExtLong-512K-dataset-subset
自然语言处理
机器学习
NExtLong数据集是一系列通过负文档扩展方法合成的长上下文数据集,用于训练大型语言模型。这些数据集完全由合成数据组成,来源于fineweb-edu和Cosmopedia v2两个短文本数据集。数据集有不同的规模,包括64K、128K和512K合成数据,以及用于特定模型微调的子集和变体。
Hugging Face
2025-08-02 更新
25
0
caskcsg/Litelong_Nextlong_128k
--- license: apache-2.0 ---
Hugging Face
2025-09-19 更新
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广