遇见数据集

regicid/LRFAF

收藏
Hugging Face2024-03-13 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: corpus data_files: "corpus.csv" default: true - config_name: data_aggregated data_files: - split: full path: "data_aggregated/results_rappeurs.csv" - split: filtered path: "data_aggregated/results_rappeurs_filtered.csv" --- Corpus de 37 000 textes de rap français issus du site genius.com, en croisant des catégories Wikipédia/Wikidata avec l'API de Genius. En sus des lyrics, le fichier contient les métadonnées suivantes : artiste, date, album (à ajouter), nombre de vues, contributeurs, URL et sous-genre (renseignés à l'aide de topic modelling, grâce à l'outil Bunka de Charles de Dampierre). La variable "ranking" est le classement au sein du topic que renvoie Bunka, il peut être pris comme un proxy du point auquel le titre correspond au topic. Un ranking NA peut être pris comme un indice de forte incertitude sur le topic, et l'on peut légitimement vouloir exclure ses chansons dans ses analyses. Pour une explication du nom du corpus, veuillez-voir l'article associé. Pour ceux qui n'aimeraient pas Huggingface, voici un lien de téléchargement direct : <https://huggingface.co/datasets/regicid/LRFAF/resolve/main/corpus.csv?download=true>. Ce corpus n'a pas de licence. C'est une zone grise juridique, mais je considère que les données n'appartiennent ni à Genius, ni à moi. Leur seul ayant droit est les artistes eux-même, qui, s'ils se sentent lésés, peuvent légitimement me demander de retirer ce jeu de données. C'est l'interprétation qu'a faite la Cour Suprême des Etats-Unis dans leur récente décision Genius vs. Google :[https://www.reuters.com/legal/us-supreme-court-lets-google-win-stand-against-genius-suit-over-song-lyrics-2023-06-26/]. Il va de soi que ce corpus est destiné à un usage pour la recherche, et non à un usage commercial. Si une personne en fait un usage commercial, il pourra lui arriver des bricoles et je n'y suis pour rien. Les fréquences annuelles des mots et groupes de mots (jusqu'à 3 mots) sont explorables graphiquement dans l'application interactive Gallicagram, en choisissant le corpus "Rap". https://shiny.ens-paris-saclay.fr/app/gallicagram

配置项: - 配置名称:corpus 数据文件:"corpus.csv" 为默认配置 - 配置名称:data_aggregated 数据文件: - 划分集:full 路径:"data_aggregated/results_rappeurs.csv" - 划分集:filtered 路径:"data_aggregated/results_rappeurs_filtered.csv" --- 本语料库包含37000条法语说唱文本,数据源自Genius(Genius)网站,通过将维基百科(Wikipedia)/维基数据(Wikidata)分类与Genius(Genius) API进行关联整合得到。除歌词外,该数据文件还包含以下元数据:艺术家、发行日期、专辑(待补充)、播放量、贡献者、链接URL以及子流派(子流派信息通过Charles de Dampierre开发的Bunka工具结合主题建模(topic modelling)生成)。 变量"ranking"代表Bunka生成的主题内排名,可作为衡量歌曲标题与对应主题匹配程度的代理指标。若ranking值为NA(不可用),则表明该歌曲的主题分类存在较高不确定性,研究者在分析中可酌情将此类歌曲排除。如需了解本语料库命名的详细说明,请参阅配套研究论文。 对于不愿使用Huggingface(Huggingface)平台的用户,此处提供直接下载链接:<https://huggingface.co/datasets/regicid/LRFAF/resolve/main/corpus.csv?download=true>。 本语料库未附带任何开源许可证,处于法律灰色地带。本人认为,数据所有权既不属于Genius(Genius),也不属于本人,唯一的合法权利人是相关艺术家。若艺术家认为自身权益受损,可正当要求本人移除该数据集。这一解读参考了美国最高法院在2023年6月26日针对*Genius vs. Google*一案的最新判决:[https://www.reuters.com/legal/us-supreme-court-lets-google-win-stand-against-genius-suit-over-song-lyrics-2023-06-26/]。 不言而喻,本语料库仅用于学术研究,严禁商用。若有人将其用于商业用途,由此产生的一切法律后果与本人无关。 单词及多词组合(最多3个词)的年度词频可通过交互式应用Gallicagram进行可视化探索,选择"Rap"语料库即可。访问地址:https://shiny.ens-paris-saclay.fr/app/gallicagram

提供机构:
regicid
原始信息汇总

数据集概述

数据集配置

  • 配置名称: corpus

    • 数据文件: corpus.csv
    • 默认: 是
  • 配置名称: data_aggregated

    • 数据文件:
      • split: full
        • 路径: data_aggregated/results_rappeurs.csv
      • split: filtered
        • 路径: data_aggregated/results_rappeurs_filtered.csv

数据集内容

  • 来源: 37,000篇法语说唱文本,源自genius.com,结合Wikipedia/Wikidata类别与Genius API交叉分析。
  • 包含信息: 歌词、艺术家、日期、专辑(待添加)、浏览次数、贡献者、URL、子类别(通过Charles de Dampierre的Bunka工具进行主题建模确定)。
  • 特殊变量: "ranking"表示在主题内的排名,可作为歌曲与主题对应程度的代理。NA值表示对主题的高度不确定性,可能需要在分析中排除这些歌曲。

数据集使用

  • 目的: 仅供研究使用,非商业用途。
  • 法律声明: 数据集无明确许可证,数据所有权归艺术家所有。如艺术家感到权益受损,可要求撤回数据集。

附加信息

  • 可视化工具: 可通过Gallicagram应用程序探索单词和短语(最多3个单词)的年频率,选择“Rap”作为数据集。
搜集汇总
数据集介绍
regicid/LRFAF 数据集图片
构建方式
LRFAF数据集汇聚了来自法国说唱音乐领域的37,000篇文本,其构建过程融合了多源数据整合与自然语言处理技术。数据源自Genius.com平台,通过交叉引用维基百科与Wikidata的分类体系,并借助Genius应用程序接口(API)进行采集。在歌词主体之外,数据集还系统性地收录了艺术家、发行日期、专辑信息、浏览量、贡献者、统一资源定位符(URL)等元数据。尤为值得一提的是,子标签的标注并非依赖人工,而是基于主题建模技术,利用Charles de Dampierre开发的Bunka工具自动生成,从而实现了对音乐风格的量化归类。
使用方法
LRFAF数据集以CSV格式发布,用户可通过HuggingFace平台直接加载,或使用提供的直链下载文件。数据集默认配置名为“corpus”,对应的数据文件为“corpus.csv”。该资源无明确许可证,属于法律灰色地带,但构建者明确指出其仅限非商业性研究用途。使用者需尊重艺术家的合法权益,若艺术家提出异议,构建者将配合移除相关数据。在分析实践中,建议根据“排名”变量筛选样本,剔除缺失值以保证主题归类的可靠性。
背景与挑战
背景概述
在自然语言处理与音乐文化研究的交叉领域,法语说唱文本语料库的匮乏长期制约着对法语嘻哈语言演变、社会议题隐喻及流派分类的量化分析。2023年,由法国研究机构主导,依托Genius.com平台与Wikidata/Wikipedia的分类体系,通过交叉引用Genius API与主题建模工具Bunka,构建了包含37,000首法语说唱歌词的多模态数据集LRFAF。该数据集的核心研究问题聚焦于法语说唱中的词汇频率动态、亚文化主题聚类及歌词与艺术家社会背景的关联性。其影响力体现在为计算语言学、社会语言学和数字人文研究提供了首个大规模、带元数据(艺术家、日期、子流派、排名指标)的法语说唱语料基准,尤其通过Gallicagram交互式应用实现了词汇历时演变的可视化,推动了法语非正式语体与口语文体的计算分析。
当前挑战
该数据集面临多重挑战:首先,在领域问题层面,法语说唱歌词中大量使用俚语、变体拼写及文化隐喻,现有自然语言处理工具(如分词器、词性标注器)难以准确解析其语义与语用特征,导致下游任务(如情感分析、主题建模)的鲁棒性不足。其次,构建过程中,数据来源Genius.com的歌词版权归属存在法律灰色地带,美国最高法院在Genius诉Google案中未明确界定歌词抓取的合法性,使得数据集在法律合规性与开放共享之间陷入两难。此外,子流派分类依赖Bunka主题建模输出的“ranking”指标,该指标对主题匹配不确定性较高的歌曲(ranking为NA)需手动排除,增加了预处理的主观偏差。最后,语料库仅覆盖法语单一语言,缺乏跨语言对比基准,限制了其在国际说唱文化比较研究中的泛化能力。
常用场景
经典使用场景
该数据集汇集了来自Genius平台的37,000首法语说唱歌曲文本,并辅以艺术家、发行日期、专辑、观看次数、贡献者信息、URL及通过主题建模标注的子类型等丰富元数据。其经典使用场景在于为计算语言学与数字人文领域提供大规模、结构化的法语口语语料,支持对当代法语诗歌韵律、俚语演变、社会议题在音乐文本中的映射进行系统性量化分析。研究者可借助“ranking”变量筛选出与主题高度相关的歌曲,构建纯净的子语料库,从而深入探索法语说唱作为一种文化表达媒介的语言特征与语义网络。
解决学术问题
该数据集有效弥合了法语非正式语体大规模标注语料匮乏的学术空白,解决了传统语料库难以捕捉口语化、地域化及社群特定表达的问题。通过跨学科整合Genius API与Wikidata分类体系,它使得研究者能够探究说唱文本中的主题聚类(如暴力、身份认同、社会批判)与时间维度的语言变化规律,为语用学、社会语言学和计算文体学提供了可复现的实证基础。其意义在于推动法语数字人文研究从单一文本分析转向数据驱动的宏观模式识别,尤其为边缘化群体的语言实践研究开辟了新路径。
实际应用
在实际应用中,该数据集可服务于多模态文化分析系统,例如将歌词文本与音频特征、社交媒体趋势进行关联挖掘,以预测法语说唱流派的流行周期或区域差异。教育技术领域可基于其构建语言学习工具,通过高频词组(如二元组、三元组)的年度频率可视化(如Gallicagram应用),帮助非母语学习者掌握当代法语口语中的隐喻与习语。此外,文化产业从业者可利用子类型标注进行市场细分,识别具有潜力的新兴亚风格,优化内容推荐算法。
数据集最近研究
最新研究方向
在法语说唱文化数字人文研究的浪潮中,LRFAF数据集凭借其涵盖37,000首文本的庞大规模与细粒度元数据标注,成为解析当代法语歌词语言演变与社会镜像的关键资源。该数据集通过融合Genius平台API与维基百科/维基数据分类体系,创新性地引入主题建模工具Bunka进行亚流派标注,并构建了曲目主题相关性排名指标,为计算文体学与音乐社会学的交叉研究提供了可量化的分析框架。近期研究聚焦于利用该语料库追踪法语说唱中非正式词汇的历时频率变化,结合Gallicagram交互式可视化工具揭示特定词组的年代分布模式,同时通过排名变量过滤高不确定性样本以提升语义聚类精度。这一工作不仅呼应了美国最高法院对歌词版权的判例精神,更在学术伦理层面确立了非商业性研究使用的合法性边界,为数字人文学者处理灰色地带数据提供了方法论范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务