官方服务:
资源简介:
A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
应用场景:
提供机构:
xu zhaopan相关数据集
IDEA-CCNL/Ziya-Writing-Eval-Chinese
姜子牙写作任务中文评估数据集(Ziya-Writing-Eval-Chinese)用于评估大语言模型在中文写作任务上的水平,通常采用Side-by-Side评测。该评测集包含了多个写作子任务,分为应用写作和创意写作两大类。应用写作包括公文、通知、报告、论文、征稿、函件和申请书等;创意写作包括书信、作文、文案、小说、视频脚本、攻略、广告、剧本和童话等。
Hugging Face2024-01-03 更新1250
cldixon/cspan-booknotes
CSPAN Booknotes聊天数据集是从CSPAN节目的公共档案中开发的一个独特数据集。该数据集包括主持人Brian Lamb与超过800位嘉宾之间的对话转录。数据集包含三个部分:节目信息、对话转录和相关节目推荐。对话转录是核心部分,包含大约200个对话轮次的完整对话。这个数据集适用于评估语言模型,特别是在总结和文本生成任务上。
Hugging Face2025-10-03 更新130
allenai/signal-and-noise datasets/allenai/signal-and-noise
本研究使用30个基准测试对60M到32B参数的375个开放权重语言模型进行评估,共计200M个评估基准结果。该数据集旨在帮助研究人员了解语言模型在不同规模下的性能表现,以及如何通过提高信噪比来提高评估基准的质量。
arXiv2025-08-19 更新90
open-llm-leaderboard/details_ParasiticRogue__Merged-RP-Stew-V2-34B
该数据集是在模型 ParasiticRogue/Merged-RP-Stew-V2-34B 在 Open LLM Leaderboard 上的评估运行期间自动创建的。数据集由 63 个配置组成,每个配置对应一个评估任务。数据集是从 1 次运行中生成的,每次运行在每个配置中表示为特定的分割,使用运行的时间戳命名。train 分割始终指向最新的结果。一个额外的配置 results 存储了所有运行的聚合
Hugging Face2024-04-15 更新170
open-llm-leaderboard/details_Josephgflowers__Tinyllama-1.5B-Cinder-Test-2
--- pretty_name: Evaluation run of Josephgflowers/Tinyllama-1.5B-Cinder-Test-2 dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [Josephgflowers/Tinyllama-1.5B-Ci
Hugging Face2024-04-05 更新120



