five

Linguini|语言模型数据集|语言推理数据集

收藏
arXiv2024-09-19 更新2024-09-20 收录
语言模型
语言推理
下载链接:
https://github.com/facebookresearch/linguini
下载链接
链接失效反馈
资源简介:
Linguini数据集由Meta等机构创建,旨在评估语言模型的语言推理能力,不依赖于预先的语言知识。数据集包含894个问题,分为160个问题,涵盖75种低资源语言,主要从国际语言学奥林匹克竞赛中提取。数据集的创建过程涉及从2003年到2023年的国际语言学奥林匹克竞赛中筛选问题,排除包含图像或解释的问题。数据集的应用领域主要是评估和提升语言模型的语言推理能力,解决跨语言的推理问题。
提供机构:
Meta、伦敦大学学院、巴斯克大学
创建时间:
2024-09-19
原始信息汇总

Linguini 🍝: A benchmark for language-agnostic linguistic reasoning

数据集下载

  • 下载链接: 最新版本数据集
  • 格式: zip 压缩包
  • 密码: linguisticreasoning
  • 注意事项:
    1. 请勿将数据重新托管为纯文本格式,以免被网络爬虫抓取。
    2. 在评估模型时,请确保数据集内容未包含在训练数据中。

许可证

  • 许可证类型: CC-BY-SA
  • 许可证文件: LICENSE
AI搜集汇总
数据集介绍
main_image_url
构建方式
Linguini数据集的构建基于国际语言学奥林匹克(IOL)的问题,涵盖了从2003年到2023年的160个问题,涉及75种(主要是)极低资源语言。这些问题被精心挑选,排除了仅出现一次的类别、包含图像的问题以及仅提供解释的问题。最终,数据集包含了894个问题,分为三个类别:序列转换、填空和数字转写。每个问题都要求模型进行元语言意识和演绎推理,而不是依赖于预先的语言熟练度。
特点
Linguini数据集的显著特点在于其语言无关性,即模型不需要预先了解测试语言的知识。所有解决语言谜题所需的信息都包含在上下文中。此外,该数据集涵盖了广泛的极低资源语言,为评估模型的多语言推理能力提供了独特的平台。尽管所有分析的模型在准确性上均低于25%,但开放模型与封闭模型之间存在显著差距,表明封闭模型在语言推理任务中具有明显优势。
使用方法
使用Linguini数据集时,研究人员可以通过零样本到少样本(0-5个上下文示例)的方式评估各种开放和封闭的大型语言模型(LLMs)。为了最大化每个任务的上下文候选数量,采用了留一法交叉验证方案。每个推理任务都包含相同格式的示例(如‘翻译’、‘匹配字母’),但排除了相同语言的上下文示例,以避免语言污染。评估主要使用精确匹配(准确性)作为主要标准,同时辅以chrF作为软性指标,以更全面地评估模型的表现。
背景与挑战
背景概述
Linguini数据集由Meta、University College London和University of the Basque Country的研究人员共同创建,旨在评估语言模型在无需预先语言知识的情况下进行语言推理的能力。该数据集基于国际语言学奥林匹克(IOL)的问题,涵盖了75种(主要是)极低资源语言的160个问题,共894个问题。Linguini的推出填补了现有语言模型评估数据集在语言推理方面的空白,为研究者提供了一个新的工具来衡量模型在多语言环境下的推理能力。
当前挑战
Linguini数据集面临的挑战主要集中在两个方面:首先,如何在不依赖预先语言知识的情况下,确保模型能够有效地进行语言推理。这要求模型具备高度的元语言意识和演绎推理能力。其次,构建过程中遇到的挑战包括如何从国际语言学奥林匹克的问题中筛选出适合的数据,并确保这些问题的多样性和代表性。此外,数据集还需要解决模型在处理极低资源语言时的性能问题,以及如何避免训练数据对测试结果的污染。
常用场景
经典使用场景
Linguini数据集的经典使用场景在于评估语言模型的语言无关性语言推理能力。通过包含来自国际语言学奥林匹克竞赛的894个问题,该数据集覆盖了75种(主要是)极低资源语言。模型在解决这些语言难题时,不需要预先掌握特定语言知识,因为所有必要的信息都包含在问题上下文中。这种设计使得Linguini成为评估模型在多语言环境下推理能力的理想工具。
实际应用
Linguini数据集在实际应用中具有广泛的前景,特别是在多语言教育和跨文化交流领域。通过使用Linguini进行模型训练和评估,可以开发出更适用于多语言环境的智能教育工具和跨文化交流平台。此外,该数据集还可用于开发支持低资源语言的翻译和理解系统,促进全球语言多样性的保护和利用。
衍生相关工作
Linguini数据集的发布激发了大量相关研究工作,特别是在多语言推理和低资源语言处理领域。例如,一些研究者利用Linguini数据集开发了新的多语言推理模型,这些模型在处理低资源语言时表现出色。此外,Linguini还促进了跨学科合作,吸引了语言学家和计算机科学家的共同参与,推动了语言学和人工智能的交叉研究。
以上内容由AI搜集并总结生成
用户留言
有没有相关的论文或文献参考?
这个数据集是基于什么背景创建的?
数据集的作者是谁?
能帮我联系到这个数据集的作者吗?
这个数据集如何下载?
点击留言
数据主题
具身智能
数据集  4099个
机构  8个
大模型
数据集  439个
机构  10个
无人机
数据集  37个
机构  6个
指令微调
数据集  36个
机构  6个
蛋白质结构
数据集  50个
机构  8个
空间智能
数据集  21个
机构  5个
5,000+
优质数据集
54 个
任务类型
进入经典数据集
热门数据集

diegopdlv5/test_dataset_0049c

该数据集主要包含音频数据,分为训练集,共有135个样本,总大小为51580253字节。下载大小为51573551字节。

hugging_face 收录

(주)동구바이오제약 2024년 기업정보 | 직원수, 근무환경, 복리후생 등

(주)동구바이오제약 기업소개 - 업력 : 42년차, 기업형태 : -, 업종 : 완제 의약품 제조업 | (주)동구바이오제약의 직원수, 연봉, 채용, 근무환경, 복리후생, 재무정보 등이 궁금하시다면, 사람인에서 더 많은 정보를 확인해보세요.

www.saramin.co.kr 收录

Chinese-Poetry-Corpus

本语料库收集自互联网,包含了从先秦到当代的古诗词数据,以CSV格式进行存储。经过去重后,包含诗词共计1014508首。古诗词按朝代进行划分,存储于文件夹下,命名规则为朝代.csv。每首诗词数据包含五个字段,分别为标题、朝代、作者、体裁、内容。

github 收录

中国近海台风路径集合数据集(1945-2024)

1945-2024年度,中国近海台风路径数据集,包含每个台风的真实路径信息、台风强度、气压、中心风速、移动速度、移动方向。 数据源为获取温州台风网(http://www.wztf121.com/)的真实观测路径数据,经过处理整合后形成文件,如使用csv文件需使用文本编辑器打开浏览,否则会出现乱码,如要使用excel查看数据,请使用xlsx的格式。

国家海洋科学数据中心 收录

中国1km分辨率逐月降水量数据集(1901-2024)

该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2024.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。

国家青藏高原科学数据中心 收录