Specifications, test viewpoints, ChatGPT's test cases and prompts
收藏NIAID Data Ecosystem2026-05-02 收录
相关数据集
RepLiQA
RepLiQA是一个评估数据集,包含上下文-问题-答案三元组,上下文涉及虚构的实体,如人物或地点,不真实存在。该数据集旨在测试大型语言模型(LLMs)在提供文档中查找和使用上下文信息的能力。与现有问答数据集不同,RepLiQA的非事实性确保模型性能不受LLMs记忆训练数据中事实的能力影响,可以更自信地测试模型利用提供上下文的能力。数据集涵盖17个主题或文档类别,每个文档附带5个问题-答案对。此外,
github2024-06-19 更新321
cabusar/gutenberg-txt-fr
--- license: unknown task_categories: - text-classification - question-answering - text2text-generation language: - fr tags: - rag --- This dataset is not yet refined enough to do other things than t
Hugging Face2024-03-30 更新190
YurtsAI/gpt4o-multineedle-3needles-haystack-dataset_iter1
--- dataset_info: features: - name: context dtype: string - name: context_length dtype: int64 - name: depth_percent dtype: int64 - name: gpt4o_response dtype: string - name
Hugging Face2024-08-05 更新100
生成式人工智能(大语言模型)服务备案评估测试题
测试题的来源主要由公司自行采集和构建,针对业务场景与风险图谱进行系统性设计,涵盖数据安全、内容合规、伦理对齐等多个维度。同时,公司会结合公开基准、行业最佳实践及真实用户反馈,持续扩展和更新测试集,以全面提升评估的覆盖面和实效性。
安徽省数据知识产权登记平台2025-09-01 更新250



