tlizzo/cTOFU
收藏资源简介:
该数据集包含多个配置,主要针对英语(en)和西班牙语(es)的问答数据,用于机器学习和自然语言处理任务。数据集包括问题、答案、扰动答案(如列表形式的扰动答案)、语言信息(当前语言和源语言)、来源数据集和子集信息、是否机器翻译的标志以及翻译方法。配置变体涉及遗忘(forget)、保留(retain)、保留扰动(retain_perturbed)、真实作者(real_authors)、世界事实(world_facts)、完整(full)和保留部分(holdout)等,可能用于模型训练、评估或数据增强场景,例如模拟数据遗忘、多语言翻译或问答系统测试。每个配置有训练分割,包含不同数量的示例和字节大小,但未提供具体内容描述或应用背景。
This dataset includes multiple configurations primarily focused on English (en) and Spanish (es) question-answer data for machine learning and natural language processing tasks. It contains features such as question, answer, perturbed answer (e.g., as a list of perturbed answers), language information (current language and source language), source dataset and subset details, a flag for machine translation, and translation method. Configuration variants involve forget, retain, retain_perturbed, real_authors, world_facts, full, and holdout, likely used for model training, evaluation, or data augmentation scenarios, such as simulating data forgetting, multilingual translation, or question-answering system testing. Each configuration has a train split with varying numbers of examples and byte sizes, but no specific content description or application context is provided.



