kew-data
收藏数据链接:
官方服务:
资源简介:
kew-data是一个艺术家信息数据库,包含从Wikidata提取的艺术家名称和主页URL,数据大小为9MB,涵盖约162,000个主页URL,采用CC BY-SA 4.0许可证,用于在kew播放器中提供可点击的艺术家链接。
kew-data is an artist information database that houses artist names and homepage URLs extracted from Wikidata. With a total size of 9 MB, the dataset contains approximately 162,000 homepage URLs and is licensed under CC BY-SA 4.0. It is designed to provide clickable artist links within the kew player.
创建时间:
2026-07-10
原始信息汇总
数据集概述:kew-data
- 数据集大小:9MB
- 主页URL数量:162,000条
- 数据许可协议:WIKIDATA CC BY-SA 4.0
数据集内容
- 包含从维基数据(Wikidata)提取的艺术家姓名及其主页URL。
- 数据集以二进制文件
artists.db形式提供,用于在 kew 播放器的曲目视图中为拥有维基百科主页的艺术家提供可点击的链接。 - 参考文件
artists.tsv包含在仓库中,但不被 kew 直接使用。
数据来源
- 数据提取自维基数据(Wikidata),数据集来源为:https://dumps.wikimedia.org/wikidatawiki/entities/latest-all.json.bz2
- 维基数据依据知识共享署名-相同方式共享4.0国际许可协议(CC BY-SA 4.0)授权:https://creativecommons.org/licenses/by-sa/4.0/
数据集用途
- 帮助艺术家获得经济支持,并为听众提供联系艺术家的途径。
- 作为 kew 播放器的可选依赖项,安装后(版本 4.2.0 及以上)可启用可点击的艺术家链接。
- 即使不安装此数据集,kew 也能正常运行(可通过设置
useartistsdb=0跳过)。
数据复现
- 可通过提供的脚本和
/data文件夹中的.tsv文件复现artists.db二进制文件。 - 复现命令:
python make_binary_db.py artists.tsv artists.db(需使用 Python 3.14.5)。 - 复现后的 SHA256 校验值应为:
d77f09e0aeaf14b445642aaa13ba195e5b10c09ba799e02d785102a7355d86c9
数据处理脚本
- extract_from_wikidata.py:从 bz2 文件中提取艺术家数据。
- keep_only_matching_urls.py:过滤掉不包含艺术家姓名字词的域名URL(通常认定为错误数据)。
- apply_corrections.py:根据
corrections.tsv中的信息清洗数据。 - verify_urls.py:验证URL是否有效。
- make_binary_db.py:从
artists.tsv生成artists.db二进制文件。
数据更新与维护
- 不接受添加其他艺术家或独立艺术家的请求,旨在保持数据库较小。
- 若发现错误主页或失效链接,请在 https://codeberg.org/ravachol/kew-data 提交问题。
许可证
- 数据集代码(如脚本)根据 GPLv2+ 授权。
- 维基数据部分根据 CC BY-SA 4.0 授权。
搜集汇总
数据集介绍

构建方式
在数字音乐生态中,艺术家与听众之间的直接联系至关重要。kew-data数据集正是为弥补这一鸿沟而构建,它从维基数据(Wikidata)的公开转储文件中提取艺术家姓名及其对应的官方网站地址。构建流程涉及多个脚本:首先通过extract_from_wikidata.py从庞大的bz2压缩文件中筛选出相关条目,随后利用keep_only_matching_urls.py过滤掉不包含艺术家姓名关键词的域名以降低错误率,再经apply_corrections.py基于人工校正表清洗数据,最后通过verify_urls.py验证URL的有效性。处理后的数据以TSV格式存储,并通过make_binary_db.py编译为轻量级的SQLite二进制文件artists.db,整个流程严谨且可复现。
特点
该数据集的核心特色在于其精炼与专注。整个数据库体积仅为9MB,却涵盖了162,000个艺术家的主页链接,保持了小巧与高效。数据来源严格遵循维基数据的CC BY-SA 4.0许可,确保了法律合规性。其设计紧密服务于kew音乐播放器,在艺术家曲目视图中为每一个拥有维基百科主页的艺术家提供可点击的链接字段,从而增强了探索体验。值得注意的是,数据集专门面向已收录于维基百科的艺术家,而非独立音乐人,这种选择性保证了链接的权威性和稳定性。此外,数据集的构建脚本完全开源,用户可依据提供的SHA256哈希值(d77f09e0aeaf14b445642aaa13ba195e5b10c09ba799e02d785102a7355d86c9)精确复现相同的二进制文件,体现了高度的透明与可信。
使用方法
使用kew-data数据集极为简便。首先,用户需通过git clone命令从Codeberg仓库获取代码和数据,随后在项目目录下执行make install即可完成安装。安装后,kew播放器(版本4.2.0及以上)将自动启用可点击的艺术家链接功能。对于那些无需此数据库的用户,可在kew的配置文件kewrc中将useartistsdb设置为0以禁用它,播放器仍可正常运行。若用户发现链接错误或失效,可通过项目主页提交问题(issue)报告。对于希望自行复现数据二进制文件的用户,需确保使用Python 3.14.5环境,运行python make_binary_db.py artists.tsv artists.db命令,并通过sha256sum校验生成的artists.db文件以确保一致性。该数据集被推荐为kew的可选依赖,为音乐爱好者和艺术家之间搭建了便捷的桥梁。
背景与挑战
背景概述
kew-data数据集由开发者ravachol创建,旨在增强音乐播放器kew的功能性,为听众与音乐艺术家之间搭建经济与文化的桥梁。该数据集于kew 4.2.0版本后引入,核心内容是从维基数据(Wikidata)中提取的逾16.2万条艺术家主页URL,容量仅9MB,以轻量级设计服务于艺术家信息的可点击链接功能。数据的构建遵循CC BY-SA 4.0协议,通过系列清洗与验证脚本处理维基数据转储文件,确保链接的准确性与可靠性。kew-data在开源音乐播放生态中开辟了独特的数据应用场景,虽为可选组件,却凸显了数据驱动下用户与创作者互动的潜力,对小型音乐应用的数据整合与艺术家推广范式具有参考价值。
当前挑战
kew-data所解决的领域问题在于如何为音乐播放器提供精准的艺术家数据链接,以填补现有应用在艺术家信息交互上的空白。其挑战包括:从海量维基数据中高效提取高质量艺术家条目,同时过滤URL中不包含艺术家名称的噪声链接,以平衡数据覆盖与准确性;脚本验证过程需应对不断变化的网络链接稳定性,避免死链或错误导向;此外,数据集维护者明确缺乏扩展至独立艺术家的资源,需在有限人工干预下保持数据精简与可信。构建路径中,从原始bz2转储解析到二进制数据库生成,每一步依赖严格版本与校验和确认,增加了复现与更新的复杂度,要求对数据流水线的持续审计与优化。
常用场景
经典使用场景
在音乐信息检索与数字音乐播放器领域,kew-data数据集的核心用途是为终端用户提供可交互的艺术家主页链接功能。通过整合来自Wikidata的结构化数据,该数据集将艺术家名称与其官方或维基百科列出的主页URL一一对应,并嵌入至kew音乐播放器的曲目视图中。当用户欣赏音乐时,点击艺术家字段即可直接跳转至其个人网站,这一设计巧妙地在本地播放体验与网络资源之间架起了桥梁,极大地丰富了用户的探索路径,尤其适用于希望深度了解艺术家背景信息的乐迷群体。
解决学术问题
从学术研究角度看,kew-data数据集解决了音乐信息系统中‘艺术家-网络资源’关联数据的可获取性与结构化整合问题。传统音乐播放器往往局限于本地元数据,缺乏与外部权威知识库(如Wikidata)的实时连接,而该数据集通过提取、清洗和验证Wikidata中的艺术家主页信息,构建了一个轻量、可靠且可复现的映射库。这不仅为音乐数据关联领域提供了标准化参考,也为后续研究者在知识图谱对齐、实体链接质量评估以及小规模数据集的精炼方法上奠定了实践基础,推动了数字音乐生态中开放数据重用理念的落地。
衍生相关工作
以kew-data为基础,可以衍生出多个方向的工作。例如,围绕其数据清洗流程中涉及的URL验证、域名过滤和语义校正脚本,可以提炼出一套可迁移的‘小规模开放数据处理管线’,用于其他维基数据子集的精炼。此外,由于数据集仅包含维基百科上已列出的艺术家,针对未被收录的独立艺术家的‘缺失链接’问题,可触发构建补充性数据源或众包扩展机制的研究。同时,该数据集与kew播放器的集成方式也为其他开源音乐软件(如mpd、ncmpcpp)提供了插件化功能设计的参考范例,促进音乐播放器社区内数据驱动的用户体验创新。
以上内容由遇见数据集搜集并总结生成




