登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Comparison of accuracy for the highest number of tokens available.
Comparison of accuracy for the highest number of tokens available.
收藏
Figshare
2020-06-08 更新
2026-04-28 收录
长文本理解
模型准确率评估
数据链接:
https://figshare.com/articles/dataset/Comparison_of_accuracy_for_the_highest_number_of_tokens_available_/12447026
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Comparison of accuracy for the highest number of tokens available.
应用场景:
创建时间:
2020-06-08
相关数据集
LongBench
长文本理解
多任务学习
LongBench是一个专为长上下文理解设计的双语多任务基准数据集,由清华大学和中国科学院自动化研究所创建。该数据集包含21个子数据集,覆盖6种任务类别,平均长度为6,711英文单词和13,386中文字符。数据集内容涵盖了单文档问答、多文档问答、摘要、少样本学习、合成任务和代码完成等关键长文本应用领域。LongBench的创建过程涉及从原始数据集中提取、构建和标注,以适应长上下文评估。该数据集的应
arXiv
2023-08-28 更新
863
0
Abzu/long-context-qa-df
问答系统
长文本理解
--- configs: - config_name: default data_files: - split: train path: data/train-* dataset_info: features: - name: chunk dtype: string - name: chunk_idx dtype: int64 - name: pro
Hugging Face
2023-10-19 更新
38
0
THUDM/LongBench-v2
长文本理解
推理能力
LongBench v2是一个旨在评估大语言模型在处理需要深度理解和推理的长上下文问题上的能力的数据集。它包含503个具有挑战性的多项选择题,上下文长度从8k到2M单词不等,涵盖六个主要任务类别:单文档问答、多文档问答、长上下文学习、长对话历史理解、代码库理解和长结构化数据理解。数据集的难度较高,即使是人类专家在短时间内使用搜索工具也难以正确回答。数据集通过自动和手动审查过程确保高质量和高难度,人
Hugging Face
2024-12-20 更新
33
0
tau/zero_scrolls
自然语言处理
长文本理解
ZeroSCROLLS是一个针对长文本的自然语言理解零样本基准测试。它包含了多种任务,如摘要、问题回答和文本生成。数据集中的文本较长,涵盖了政府报告、电视剧剧本、会议记录、学术文章、故事书等多种来源。每个任务都有其独特的特点,例如GovReport数据集包含了政府发布的报告和手写的摘要,而SummScreenFD数据集则是关于电视剧剧本的摘要。ZeroSCROLLS旨在测试模型在没有特定任务训练的
Hugging Face
2025-07-20 更新
208
0
leideng/longbench-view
长文本理解
多任务评估
--- task_categories: - question-answering - text-generation - summarization - text-classification language: - en - zh tags: - Long Context size_categories: - 1K<n<10K configs: - config_name: 2wikimqa
Hugging Face
2026-04-11 更新
34
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广