FaMTEB是一个大规模的波斯语文本嵌入基准,由Sharif University of Technology创建。该数据集包含63个数据集,涵盖7个任务,包括分类、聚类、成对分类、重排、检索、摘要检索和语义文本相似度。数据集由现有数据、翻译数据和通过大型语言模型生成的新合成数据组合而成,为波斯语语言模型提供了多样化的评估框架。
ELAB数据集是由Sharif University of Technology的研究团队创建的,旨在评估波斯语大型语言模型(LLMs)在安全、公平性和社会规范方面的对齐程度。该数据集包括翻译数据、合成生成的新数据和自然收集的新数据,涵盖了有害内容、禁止内容、公平性相关内容和遵守社会规范的内容,为评估波斯语LLMs提供了全面的框架。