遇见数据集

cladsu/COSER-2024

收藏
Hugging Face2024-03-05 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是西班牙农村口语和声音语料库(COSER)的一部分,包含了230份经过专家手动注释和分段的访谈转录。这些访谈来自西班牙农村地区,参与者平均年龄为74岁,通常接受过较少的教育且地理流动性较低。访谈内容涵盖了各种方言和口语表达,转录中包含了多种标记,如笑声、哭泣、其他语言的使用等。数据集还详细描述了转录中的各种注释方法,如语音标记、同时说话、交叉对话等。

该数据集是西班牙农村口语和声音语料库(COSER)的一部分,包含了230份经过专家手动注释和分段的访谈转录。这些访谈来自西班牙农村地区,参与者平均年龄为74岁,通常接受过较少的教育且地理流动性较低。访谈内容涵盖了各种方言和口语表达,转录中包含了多种标记,如笑声、哭泣、其他语言的使用等。数据集还详细描述了转录中的各种注释方法,如语音标记、同时说话、交叉对话等。

提供机构:
cladsu
原始信息汇总

数据集卡片 for Dataset Name

数据集详情

数据集描述

El Corpus Oral y Sonoro del Español Rural - COSER (http://www.corpusrural.es/) 包含1,772次半结构化访谈(共1,910小时录音),时间跨度从1990年到2022年。受访者来自农村地区,平均年龄为74岁,通常接受的教育较少且地理流动性较低。受访者中男女比例均衡,其中47.8%为男性,52.2%为女性。目前,该语料库已记录了西班牙领土(半岛和两个群岛)的1,415个飞地。

在此语料库中,我们收集了230次半结构化访谈,这些访谈经过手动注释、审查和分段。

数据集结构

语音发射

  • Risa ([RISA]): 用于标记单个人的笑声,无论是采访者还是受访者。
  • Risas ([RISAS]): 用于标记多人的笑声。
  • Risa en habla ([Rndo: ]): 受访者在讲述时笑。可以先标记,然后写入相应片段,或先选择片段再点击此工具。
  • Llanto en habla ([Llndo: ]): 受访者在讲述时哭泣。使用方法与“risa en habla”相同。
  • Otra lengua ([L-Otra: ]): 用于标记受访者使用非西班牙语语言的片段。选择标记后,写入原始语言片段,或选择片段后点击该标记。在这种情况下,不应进行西班牙语的等效转换。
  • Exclamaciones ([EXCL]): 建议不使用此标记。例如,如果受访者说“ay”或“ah”等感叹词,最好用感叹号转录:“¡Ay!”,“¡Ah!”。
  • Asentimiento ([Asent]): 用于表示口头语言中用于同意的任何发射。如果受访者或采访者说“uhum”,“aham”,“hum”等,不转录,而是使用此标记。如果说是“sí”,则不使用此标记,而是转录。每次使用此标记时,都应加上句点(“.”),因为它算作任何干预:“I1: Mi hijo no vive aquí, por eso ya no hago matanza” / “E1: [Asent]. ¿Y desde cuándo?”。
  • Tos ([TOS]).
  • Carraspeo ([CARRASP]).
  • Chasquido ([CHASQ]).
  • Onomatopeya ([ONOMAT]): 用于标记拟声词。在这种情况下,拟声词不包含在标记内:转录拟声词,然后在其后加上此标记。例如:“[…] y de repente, el libro hizo pum, [ONOMAT] y se cayó”。
  • Respiración ([RESPIR]).
  • Otras ([OTRAS-EM]): 用于表示受访者用于思考接下来要说什么的任何发射。在口头语言中,我们经常这样做:“Y mi hijo, pues, e…/a…/mm, estudió medicina”等。这不转录,而是使用此标记:“Y mi hijo, pues [OTRAS-EM] estudió medicina”。不要将“e”或“a”延长与感叹词“eh”和“ah”混淆,因为后者确实需要转录,而不需要标记:“Mi hijo estudió medicina, eh”。

同时说话 (HS:E/I:)

通常情况下,受访者和采访者会“重叠”,同时说话。对于这些情况,我们使用此标记。它指示谁打断了主要话语(无论是受访者还是采访者)。

交叉对话 (HCruz)

有时,新的成员会出现在对话中。例如,一次采访有一个受访者和两个采访者。他们正在交谈,突然,受访者的亲属出现,受访者不再与采访者交谈,而是与他交谈。这就是交叉对话。为了标记这一点,我们需要选择构成交叉对话的每个干预,并点击该图标。我们也可以插入“交叉对话”标记,并在其中写入每个片段。

去歧义

任何可能因方言发音而混淆的单词都应去歧义。方言变体首先转录,然后是标准形式,根据约定(x=y),(方言形式=标准形式)。当方言形式涉及缩减时,可以使用(0=y)。例如,canta(0=r)lo,但应注意,如果缩减形式涉及重音变化,则不正确。例如,cárce(0=l) o cantá(0=r)lo,不是正确的等效,因为编辑后的结果将是cárce o cantálo。

数据集来源

230次审查的访谈可以从COSER网站(https://corpusrural.fe.uam.es/coser/descargas.php)下载,点击2022年5月版本的链接。文件为XML格式,区分两个父节点:头部和访谈。在头部,我们有关于访谈的数据:省、飞地、访谈日期、访谈持续时间、受访者数据(无姓名)、采访者姓名、进行转录的人员以及访谈中讨论的主题。

在访谈部分,我们有轮次,其属性为id(标记轮次编号)和mp3(轮次持续时间)。轮次的第一个子节点始终是该轮次说话人的引用,可以是受访者(I)或采访者(E)。轮次的其余子节点是单词(w)、标点符号(punct)、专有名词(NP - 匿名)、语言标记,如发射、不可理解或“lit”(可能是谚语、流行语、诗句等的再现)。

数据收集和处理

为了生成可操作和可访问的数据库以进行NLP任务,从XML格式的文件中转换为csv格式,以收集所有信息。为此,使用了xml.etree、pandas、BeautifulSoup4和RegEx库。使用xml.etree访问文件路径并解析以访问数据。然后,使用BeautifulSoup读取xml文件内容以提取轮次属性和每个轮次中的文本。使用pandas生成一个数据框,在其中添加数据。

由于文本显示特殊字符和换行符、制表符或不适当的空间;已清理文件,访问csv并应用相应的正则表达式以获得可访问的数据集。

搜集汇总
数据集介绍
cladsu/COSER-2024 数据集图片
构建方式
COSER-2024数据集源自《农村西班牙语有声口语语料库》(Corpus Oral y Sonoro del Español Rural),该语料库收录了1990年至2022年间采集的1772次半结构化访谈,总计1910小时录音。本数据集从中精选230次经专家手动标注、审核并分割的访谈录音。原始音频以XML格式存储,包含访谈元数据(如省份、地点、时长、受访者信息等)及逐轮对话的详细标注。为便于自然语言处理任务,研究团队利用xml.etree、BeautifulSoup4和Pandas等工具将XML文件解析并转换为CSV格式,随后通过正则表达式清洗文本中的特殊字符、换行符和多余空格,最终构建出结构清晰、可直接用于机器学习的语料资源。
特点
该数据集的核心特色在于其精细的语料标注体系。标注涵盖多种口语现象,如笑声、咳嗽、清嗓、弹舌等非语言发声,以及重叠言语和交叉对话,均以专用标签标识。方言变体与标准形式通过“方言=标准”的格式进行消歧,例如“cantá=cantar”,确保语音学与形态学变体的可识别性。人名被匿名化以保护隐私,数字则采用文字转录(如“cincuenta_y_tres”),仅年份等特殊情况保留数字形式。此外,语料中保留了谚语、诗歌引用等文化元素,为方言学和社会语言学研究提供了丰富素材。这些特点使数据集成为分析西班牙农村口语变异与交际动态的珍贵资源。
使用方法
用户可通过Hugging Face平台直接加载该数据集,适用于多种自然语言处理任务,如方言识别、语音转写、对话分析及语法变异研究。具体使用时,可借助Pandas等工具读取CSV文件,提取对话轮次、说话者角色(受访者I或采访者E)及标注标签。数据集支持细粒度查询,例如筛选特定方言消歧实例或分析重叠言语模式。研究者亦可将音频与转录文本结合,用于语音-文本对齐模型训练。建议在使用前阅读原始XML架构说明,以充分理解层级结构(如头部信息与访谈内容的分隔),从而高效定制数据预处理流程。
背景与挑战
背景概述
COSER-2024数据集源自《西班牙乡村口语有声语料库》(Corpus Oral y Sonoro del Español Rural, COSER),由Inés Fernández-Ordóñez领衔的团队自1990年至2022年间持续构建,收录了1772场半结构化访谈,总计1910小时录音,覆盖西班牙半岛及两大群岛的1415个乡村聚落。该数据集的核心研究问题聚焦于西班牙乡村西班牙语的口语变异、方言语法及社会语言学特征,尤其关注高龄(平均74岁)、低教育水平、低地理流动性的受访者群体。作为语料库语言学与方言学领域的重要资源,COSER-2024通过专家手动标注与分割的230场访谈转录,为自然语言处理(NLP)任务提供了高度规范的语音与文本数据,推动了濒危方言的数字化保护与跨学科研究。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,乡村西班牙语口语的方言变体、音韵缩减(如-d、-r、-l结尾辅音脱落)及词形融合(如‘cantá’歧义为‘cantada’或‘cantar’)导致自动语音识别与词性标注任务异常困难,需依赖精细的消歧规则(如‘x=y’标记)来区分同音异义词;2)构建过程中,230场访谈的转录与标注需人工处理重叠话语(如‘HS:E/I’标记)、笑声、咳嗽等非言语发声,以及匿名化敏感个人信息,耗时且易引入主观偏差;3)数据规模有限(仅230场),且XML格式转换为CSV时需应对特殊字符、换行符及不规则空格,清洗过程依赖正则表达式与多库协同(如xml.etree、BeautifulSoup),增加了技术复杂度与可复现性风险。
常用场景
经典使用场景
COSER-2024作为西班牙语乡村口语语料库的核心子集,其经典使用场景聚焦于方言学与历史语言学的交叉研究。该数据集收录了230场经过专家手工标注和分段的半结构化访谈,涵盖1990至2022年间西班牙本土1415个乡村地点的语音材料,受访者平均年龄74岁且教育程度较低,具有高度的地理稳定性和语言保守性。研究者可借助其中精细的语音学标注(如笑声、咳嗽、重叠语轮)和方言变体消歧标记(如“cantá=cantada”),系统追踪西班牙语在孤立乡村社群中的共时变异与历时演变,尤其适用于分析音位脱落(如/d/弱化)、形态简化(如过去时态第一人称单数“ha=he”)及句法残留现象。
解决学术问题
该数据集解决了西班牙语方言研究中长期存在的两大核心学术问题:其一,弥补了乡村口语语料系统性匮乏的空白,传统语料库多聚焦于城市标准语或书面语,而COSER-2024通过230份经严格标注的访谈,提供了反映语言底层生态的鲜活样本;其二,为语言变异与变化理论提供了实证基础,利用其详尽的口语标记(如“habla simultánea”处理重叠语轮)和消歧规则(如“to=todos”量化词缩减),学者可精准量化语音、形态和词汇层面的地理分布模式,揭示西班牙语内部因社会隔离而催生的方言分化机制,进而验证语言接触、经济变迁对乡村语言系统侵蚀的假设。
衍生相关工作
COSER-2024衍生的经典工作主要体现在方言语法与语料库方法论的双重创新上。Fernández-Ordóñez(2010)基于该语料库的早期版本,系统论述了西班牙乡村口语中动词时态、代词系统和从属连词的地域差异,奠定了“方言语法”学派的理论框架。后续研究者借助其标注规范(如“desambiguación”消歧策略),开发了自动化方言变体识别算法,例如利用“l’=le”等合音规则训练序列标注模型。此外,数据集催生了跨语种比较研究,如对比西班牙乡村方言与拉丁美洲农村西班牙语在“pérdida de -d final”现象上的异同,推动了罗曼语历史语言学的计量革命。其XML架构和开放许可(CC-BY)更成为构建多模态乡村语音语料库(如声音文件与文本对齐)的模板。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务