SANSKRITI
收藏资源简介:
SANSKRITI是一个全面的文化基准数据集,旨在评估语言模型对印度丰富文化多样性的理解能力。该数据集包含21,853个精心策划的问答对,涵盖28个州和8个联邦属地,是测试印度文化知识最大的数据集。它覆盖了印度文化的16个关键属性,包括仪式和庆典、历史、旅游、美食、舞蹈和音乐、服装、语言、艺术、节日、宗教、医药、交通、体育、夜生活和名人,全面展现了印度的文化图景。通过提供广泛、丰富和多样化的数据集,SANSKRITI为评估和改进语言模型的文化理解能力设定了新的标准。
SANSKRITI is a comprehensive cultural benchmark dataset designed to evaluate language models' capacity to comprehend India's rich cultural diversity. It contains 21,853 carefully curated question-answer pairs, covering 28 states and 8 Union Territories of India, making it the largest dataset available for testing Indian cultural knowledge. It encompasses 16 core attributes of Indian culture, including rituals and celebrations, history, tourism, cuisine, dance and music, traditional attire, languages, arts, festivals, religions, traditional medicine, transportation, sports, nightlife, and public figures, comprehensively portraying India's multifaceted cultural landscape. By offering a broad, rich and diverse dataset, SANSKRITI sets a new standard for evaluating and enhancing the cultural comprehension capabilities of language models.




