登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
caskcsg/Litelong_Nextlong_128k
caskcsg/Litelong_Nextlong_128k
收藏
Hugging Face
2025-09-19 更新
2026-01-03 收录
数据链接:
https://hf-mirror.com/datasets/caskcsg/Litelong_Nextlong_128k
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
caskcsg
相关数据集
caskcsg/LongMagpie_64k_dataset
长上下文指令生成
自合成框架
LongMagpie数据集是一个自动生成的长上下文指令数据集,用于训练长上下文大型语言模型。该数据集由LongMagpie框架自动生成,无需人工标注。数据集包含从fineweb-edu数据集中提取的上下文、LongMagpie生成的查询和答案。数据集分为单文档和多个文档版本,并提供了用于训练长文本和平衡长文本和短文本性能的版本。
Hugging Face
2025-08-02 更新
35
0
caskcsg/Libra-Emo
视频分析
情绪识别
Libra-Emo是一个大规模的多模态细粒度数据集,用于负面情绪检测。它包括视频片段、字幕、情绪标签和相应的解释。数据集是单语言的(英语),并遵循CC BY 4.0许可证发布。数据集的大小在10K到100K样本之间,分为训练集和测试集。特征包括视频、字幕、标签和解释。README提供了详细的下载、解压和使用数据集的说明,以及用于预测和评估的脚本。该数据集专为视频分类任务设计,特别是用于识别负面情绪
Hugging Face
2025-05-25 更新
19
0
caskcsg/NExtLong-64K-dataset
自然语言处理
上下文学习
NExtLong数据集是通过负文档扩展方法合成的,包含多个数据集,如NExtLong-64K-dataset、NExtLong-512K-dataset等,这些数据集完全由合成数据组成,用于训练能够处理长上下文的语言模型。
Hugging Face
2025-08-02 更新
13
0
caskcsg/NExtLong-512K-dataset-subset
自然语言处理
机器学习
NExtLong数据集是一系列通过负文档扩展方法合成的长上下文数据集,用于训练大型语言模型。这些数据集完全由合成数据组成,来源于fineweb-edu和Cosmopedia v2两个短文本数据集。数据集有不同的规模,包括64K、128K和512K合成数据,以及用于特定模型微调的子集和变体。
Hugging Face
2025-08-02 更新
25
0
caskcsg/LongMagpie_singledoc_longcontext_dataset
自然语言处理
指令数据生成
LongMagpie是一个自合成框架,用于自动生成大规模长上下文指令数据。该框架利用已对齐的长上下文大型语言模型(LLMs)自动生成上下文相关的查询,通过收集这些文档-查询对和模型的响应,LongMagpie能够产生高质量的指令,无需人工干预。实验表明,LongMagpie在长上下文任务上取得了领先性能,同时在短上下文任务上也保持了竞争力。
Hugging Face
2025-08-02 更新
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广