Background/Aims: Present-day Iran has long represented a natural hub for the expansion of human genes and cultures. That being so, the overlapping of prehistoric and more recent demographic eve
TCQL数据集是由北京语言大学等机构创建,专注于将自然语言转换为Corpus Query Language (CQL)。该数据集包含9362条记录,涵盖多种语言现象和查询类型,旨在支持语言学研究和详细文本分析。创建过程涉及自动生成和手动标注,利用了中文和英文的标注语料库。TCQL数据集的应用领域广泛,主要用于解决自然语言与CQL之间的转换问题,提高与富语言标注文本库交互的效率和可访问性。
St. Lawrence Island Yupik数字语料库是由伊利诺伊大学香槟分校语言学系创建的,旨在数字化和保存St. Lawrence Island Yupik语言的书面文本。该数据集包含90个Yupik语言文本,涵盖了从初级读物到宗教文本的广泛内容。创建过程中,研究团队采用了扫描、图像处理和光学字符识别等技术。数据集的应用领域包括语言学研究、自然语言处理以及Yupik语言的教育和复兴,旨在