登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
timaeus/TinyStoriesV2-GPT4-10k
timaeus/TinyStoriesV2-GPT4-10k
收藏
Hugging Face
2024-10-18 更新
2025-04-12 收录
叙事文本生成
语言模型评估
数据链接:
https://hf-mirror.com/datasets/timaeus/TinyStoriesV2-GPT4-10k
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cdla-sharing-1.0 ---
应用场景:
提供机构:
timaeus
相关数据集
IDEA-CCNL/Ziya-Writing-Eval-Chinese
中文写作评估
语言模型评估
姜子牙写作任务中文评估数据集(Ziya-Writing-Eval-Chinese)用于评估大语言模型在中文写作任务上的水平,通常采用Side-by-Side评测。该评测集包含了多个写作子任务,分为应用写作和创意写作两大类。应用写作包括公文、通知、报告、论文、征稿、函件和申请书等;创意写作包括书信、作文、文案、小说、视频脚本、攻略、广告、剧本和童话等。
Hugging Face
2024-01-03 更新
125
0
SANSKRITI
印度文化
语言模型评估
SANSKRITI是一个全面的文化基准数据集,旨在评估语言模型对印度丰富文化多样性的理解能力。该数据集包含21,853个精心策划的问答对,涵盖28个州和8个联邦属地,是测试印度文化知识最大的数据集。它覆盖了印度文化的16个关键属性,包括仪式和庆典、历史、旅游、美食、舞蹈和音乐、服装、语言、艺术、节日、宗教、医药、交通、体育、夜生活和名人,全面展现了印度的文化图景。通过提供广泛、丰富和多样化的数据集
arXiv
2025-06-18 更新
22
0
KoGEM
语言模型评估
韩语能力测试
该数据集名为KoGEM,包含了1500多道多选题,覆盖了五大类别和16个子类别,旨在评估大型语言模型和人类在韩语语言能力方面的表现。该数据集基于韩国官方的职能能力考试,并包含了用于评估的众包人类表现数据。规模上,数据集包含了1500组问答对,其任务是对语言能力进行评估。
arXiv
16
0
WebGen-Bench
网站生成
语言模型评估
WebGen-Bench是一个用于评估LLMs在从零开始生成交互式和功能性网站的数据集。
github
2025-05-08 更新
32
0
open-llm-leaderboard/details_ParasiticRogue__Merged-RP-Stew-V2-34B
语言模型评估
多领域知识
该数据集是在模型 ParasiticRogue/Merged-RP-Stew-V2-34B 在 Open LLM Leaderboard 上的评估运行期间自动创建的。数据集由 63 个配置组成,每个配置对应一个评估任务。数据集是从 1 次运行中生成的,每次运行在每个配置中表示为特定的分割,使用运行的时间戳命名。train 分割始终指向最新的结果。一个额外的配置 results 存储了所有运行的聚合
Hugging Face
2024-04-15 更新
17
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广