ETCSANS|语言学数据集|历史研究数据集
收藏数据集概述:电子文本语料库的句法标注新苏美尔语(ETCSANS)
数据集描述
- 名称:电子文本语料库的句法标注新苏美尔语(ETCSANS)
- 目的:提供新苏美尔时期(公元前2100-2000年)经济和社会研究的工具。
- 特点:首个提供句法标注的苏美尔语文本数据集,填补了句法和语义分析资源的空白。
- 合作机构:多伦多大学、法兰克福歌德大学和加州大学洛杉矶分校。
- 项目背景:作为CDLI和MTAAC项目的一部分,旨在改善对苏美尔文本的访问。
数据集内容
- 核心语料库:包含24,460个句法标注文本,覆盖约22%的新苏美尔文本数据。
- 子语料库:
- 交易子语料库:22,276文本,1,742,634词。
- 平行子语料库:1,572文本,46,321词。
- 皇家子语料库:612文本,9,133词。
- 扩展语料库:包含47,476文本,1,775,582词,提供自动形态学和命名实体标注。
数据集使用
- 句法标注:主要基于手动标注或翻译,依赖于Universal Dependencies模型。
- 未来计划:计划通过CDLI进行众包审核过程,以改进和验证标注。
已知问题
- 版本0.1/扩展:从形态学格式转换为句法格式,运行标注器。
- 版本0.1/核心:交易子语料库仅提供部分标注,需补充基于形态学的预标注。
- 皇家子语料库:包含来自ETCSRI语料库的形态学标注,存在转录和分词差异。
历史版本
- v.0.1a:2021年12月8日,初始转换交易子语料库。
- v.0.1:2021年12月4日,整合语料库仓库。
支持与资助
- 资助:MTAAC项目。
- 学生支持:GSoC。
- 部分支持:LiODi。

中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
CHARLS
中国健康与养老追踪调查(CHARLS)数据集,旨在收集反映中国45岁及以上中老年人家庭和个人的高质量微观数据,用以分析人口老龄化问题,内容包括健康状况、经济状况、家庭结构和社会支持等。
charls.pku.edu.cn 收录
Fruits-360
一个高质量的水果图像数据集,包含多种水果的图像,如苹果、香蕉、樱桃等,总计42345张图片,分为训练集和验证集,共有64个水果类别。
github 收录
Wind Turbine Data
该数据集包含风力涡轮机的运行数据,包括风速、风向、发电量等参数。数据记录了多个风力涡轮机在不同时间点的运行状态,适用于风能研究和风力发电系统的优化分析。
www.kaggle.com 收录
LibriSpeech
LibriSpeech 是一个大约 1000 小时的 16kHz 英语朗读语音语料库,由 Vassil Panayotov 在 Daniel Povey 的协助下编写。数据来自 LibriVox 项目的已读有声读物,并经过仔细分割和对齐。
OpenDataLab 收录