遇见数据集

kwcluster-variables

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集名为kwcluster,用于搜索查询中单词的角色分类。每个单词被标记为以下类别之一:公司名称、游戏、支付方式、区域、条件或普通词。标记回答的问题是:该单词是否应为网站上的独立页面设置。数据集主要用于语义聚类工具[kwcluster]和基于其训练的模型[Krasovskiy/kwcluster-variables-1.5b]。数据格式为JSON,包含token(单词)、label(标签)、source(来源,如手动标注、验证事实等)和context(上下文,最多五个相关查询,以竖线分隔)。上下文是必需的,因为单词在脱离查询时含义不明。数据集包含多个文件:train.jsonl(6811行,训练集)、test_frequent_words.jsonl(45行,高频词测试集)、test_rest.jsonl(1156行,其余测试集)、top300_hand_labeled.jsonl(300行,手动标注的高频词)、providers.txt(71个游戏工作室)、payment-methods.json(48种支付方式)、aglc-operators.json(53个阿尔伯塔监管机构运营商)。数据按单词划分,一个单词完整属于训练集或测试集。README强调了三项重要事项:1)训练样本的类别分布必须反映真实搜索查询分布,其中普通词约占82%,否则会导致模型误判;2)高频词(前300个)覆盖了80%的查询,其标注质量至关重要,因此手动标注了300个高频词并修正了118个错误;3)测试集上的指标不能反映真实行为,因为指标平等对待所有单词,而实际效果由少数高频词决定。标签来源包括手动标注(300个高频词,在真实查询上下文中标注)、已验证事实(如运营商网站地图中的游戏目录、许可证号、阿尔伯塔监管机构注册表、国家字典)以及一个语料库(1100万查询观察,86247个唯一查询,129个国家,半年数据)。数据集的局限性:支付方式和条件类别样本较少(55和38个),多语言(如德语、西班牙语)导致这些类别难以衡量,实际项目中支付方式通过参考表而非模型处理;仅覆盖赌场领域,主要为英语;除高频词外,标签并非人工确认,但字段source说明了来源。

The dataset is called kwcluster and is used for classifying the role of words in search queries. Each word is labeled with one of the following categories: company name, game, payment method, region, condition, or common word. The dataset answers the question: should the word be a separate page on the website? It is primarily used for the semantic clustering tool [kwcluster] and the model trained on it [Krasovskiy/kwcluster-variables-1.5b]. The data format is JSON, containing token (word), label (tag), source (origin, e.g., manual labeling, verified facts, etc.), and context (up to five related queries, separated by vertical bars). Context is required because words are ambiguous without queries. The dataset includes multiple files: train.jsonl (6811 rows, training set), test_frequent_words.jsonl (45 rows, high-frequency word test set), test_rest.jsonl (1156 rows, remaining test set), top300_hand_labeled.jsonl (300 rows, manually labeled high-frequency words), providers.txt (71 game studios), payment-methods.json (48 payment methods), aglc-operators.json (53 Alberta regulated operators). Data is split by word, with each word fully belonging to training or test set. The README emphasizes three important points: 1) The class distribution of training samples must reflect the real search query distribution, where common words account for about 82%, otherwise the model will misclassify; 2) High-frequency words (top 300) cover 80% of queries, so their labeling quality is crucial; thus 300 high-frequency words were manually labeled and 118 errors were corrected; 3) Metrics on the test set do not reflect real behavior because they treat all words equally, while actual performance is determined by a few high-frequency words. Label sources include manual labeling (300 high-frequency words, labeled in real query context), verified facts (e.g., game directories from operator site maps, license numbers, Alberta regulator registry, country dictionary), and a corpus (11 million query observations, 86,247 unique queries, 129 countries, half a year). Limitations: The payment method and condition categories have few samples (55 and 38), and multilingualism (e.g., German, Spanish) makes these categories difficult to measure; in practice, payment methods are handled via reference tables rather than the model; only covers the casino domain, mostly in English; except for high-frequency words, labels are not human-confirmed, but the source field indicates the origin.

创建时间:
2026-08-23
原始信息汇总

数据集概述:kwcluster-variables

基本信息

  • 许可证:Apache-2.0
  • 语言:英语
  • 任务类型:文本分类
  • 标签:SEO、关键词研究、实体分类
  • 数据规模:1K<n<10K 条样本

数据集内容

该数据集包含搜索查询中的词语及其角色分类,标签包括:公司名称、游戏、支付方式、地区、优惠条件或普通词汇。每条数据包含词语(token)、标签(label)、来源(source)及上下文(context),格式为 JSON。

文件 行数 说明
train.jsonl 6811 训练集
test_frequent_words.jsonl 45 高频词测试集
test_rest.jsonl 1156 其余测试集
top300_hand_labeled.jsonl 300 手工标注的高频词
providers.txt 71 工作室/开发商列表
payment-methods.json 48 支付方式列表
aglc-operators.json 53 阿尔伯塔监管机构运营商注册表

数据按词语划分,同一词语不会同时出现在训练集和测试集中。

标签来源

  • 手工标注:高频词300个,根据真实查询上下文进行标注
  • 可验证事实:来自网站地图中的游戏目录、许可证注册表、阿尔伯塔监管机构注册表、国家/地区参考
  • 语料库:1100 万条搜索查询观测数据,86,247 条唯一查询,覆盖 129 个国家,跨度半年

重要注意事项

  • 普通词汇在真实搜索查询中约占82%,数据集需反映这一分布
  • 高频词对结果影响极大:前50个词涉及66%的关键词,前300个涉及80%
  • 传统评估指标可能具有欺骗性,必须结合实际工具运行效果进行评估

数据集局限性

  • 支付方式和优惠条件的样本较少(55和38条)
  • 仅覆盖单一领域(赌场),主要使用英语
  • 除高频词外,标签为推断而非人工确认,source 字段标明来源

附带资源

该仓库还包含完整的语义聚类工具,包括代码模块、参考表(监管机构、支付系统、国家、游戏类型等)、实验记录、分组基准数据集及正负样本对(16,219 和 36,090 对),并支持在 Colab 上运行。

搜集汇总
数据集介绍
kwcluster-variables 数据集图片
构建方式
该数据集以搜索引擎查询中的关键词为对象,标注其语义角色,涵盖公司名、游戏名、支付方式、地区、条件词或普通词等类别。构建过程融合了多种策略:对高频词汇进行人工标注,依据真实查询的上下文语义进行判断;借助可验证的事实来源,如游戏目录、监管机构注册表等,对部分实体进行自动标注;并辅以大规模查询语料库,涵盖11百万条观测数据,确保数据的真实性和覆盖面。数据以JSON格式存储,每条记录包含单词、标签、来源及上下文信息,其中上下文(多达五条查询)被视为关键信息,用以消解歧义。数据集按单词进行划分,确保同一单词不会同时出现在训练集和测试集中。
特点
该数据集的核心特点在于对查询关键词的细致分类和上下文依赖的强调。其标签体系不仅区分了常规词与实体,还细化了实体类型,如支付方式、游戏公司等,能够支撑精细化的语义聚类任务。数据集特别重视高频词的重要性,因高频词对搜索流量的覆盖率极高,故对前300个高频词进行了精确的人工标注,并纠正了118个由自动化方法产生的错误标签。此外,数据集还附带了多个参考资源,如游戏开发者名单和支付方式列表,这些资源本身即可作为辅助工具。值得注意的是,数据集的类别分布与真实查询核心的分布一致,普通词占比较高,这有助于训练出更贴合实际应用的模型。
使用方法
此数据集面向利用语言模型进行关键词语义分类与聚类的场景,尤其适用于搜索引擎优化(SEO)工具的开发。使用者可基于‘token’与‘label’字段对模型进行微调,使其能够识别查询中单词的语义角色。同时,上下文信息为模型提供了必要的语境,以处理一词多义的情况。数据集被划分为训练集和测试集,其中测试集进一步分为高频词集和其余部分,便于评估模型在不同词频上的性能。须留意,模型应结合附带的参考词典(如支付方式、运营商列表)使用,优先采用精确匹配以提升鲁棒性。性能评估时,应依据真实查询核心的类别分布进行加权计算,而非仅依赖简单的准确率,以更准确地反映模型的实际应用效果。
背景与挑战
背景概述
该数据集由Krasovskiy等人于近期构建,旨在解决搜索引擎优化(SEO)中关键词聚类与实体分类的核心问题。研究团队基于对11百万次搜索查询的观察,从86,247个独特查询中提炼出词汇级别的语义角色标签,涵盖公司名、游戏名、支付方式、地区等类别。数据集的创建源于对现有关键词聚类工具准确性的不足,其标注过程融合了人工标注(300个高频词)与可验证事实(如运营商名录、支付方式清单),并针对单一垂直领域(在线赌场)进行了深度优化。该数据集不仅为kwcluster聚类器提供了训练基础,还支撑了同名1.5B参数模型的训练,其创新之处在于引入上下文信息(真实查询)以消除词汇歧义,显著提升了实体识别的鲁棒性,对SEO领域的关键词研究产生了示范性影响。
当前挑战
该数据集面临的挑战多维且深刻。在领域问题层面,核心难点在于词汇的多义性与上下文依赖性,例如‘quatro’在无查询上下文时易被误判为数字,而‘delta’则可能被理解为字母,这要求模型必须结合真实查询语境进行判断。此外,类别的极度不均衡构成显著障碍,普通词汇占比高达82%,而支付方式与优惠条件仅有55和38个示例,导致模型倾向于过度标注实体,如将‘slots’误判为品牌。在构建过程中,团队遭遇了采样偏差的陷阱,早期版本因负样本不足,模型在验证集上表现良好却在实际应用中崩溃(80%的词汇被误判为实体)。同时,高频词汇的标注至关重要,前50个高频词覆盖了66%的查询流量,但自动构建的列表仅能确认其中39个,迫使团队引入人工标注,且标注过程需处理一词多义的分类冲突(如‘yukon’同时指代加拿大领土与赌场名称),最终通过权衡主要语义来解决。这些挑战共同揭示了关键指标与真实性能之间的差距,促使团队采用基于查询流量的加权评估与工具级端到端验证策略。
常用场景
经典使用场景
该数据集聚焦于搜索引擎查询词中单词的角色分类,涵盖公司名、游戏名、支付方式、地区、优惠条件或普通词汇等实体类型。其经典使用场景在于构建和评估语义聚类模型,为搜索引擎优化(SEO)提供精细化的关键词分类支持。通过上下文感知的标注,该数据集能够训练模型识别查询词中的实体边界,从而显著提升关键词解析的准确性与语义理解深度。
衍生相关工作
该数据集衍生了多项代表性工作,包括训练专门的实体分类模型Krasovskiy/kwcluster-variables-1.5b,以及多个实验版本(如基于gpt-5-mini标注的变体)。这些工作系统比较了不同训练数据分布与评估指标对最终聚类效果的影响,催生了关于加权评估、样本构成优化等方法的讨论,并激励了后续在参考目录驱动分类与低成本标注方面的研究。
数据集最近研究
最新研究方向
在自然语言处理与搜索引擎优化交叉领域,针对查询词中实体角色标注的数据集研发正转向对长尾分布与上下文依赖性的精细化建模。该数据集通过人工标注与权威事实核查相结合的方式,对高频核心词进行精准角色界定,并强调基于真实查询语境的语义理解,以克服词汇多义性与歧义性。当前研究前沿聚焦于如何通过构建平衡的类别分布和引入权重评估机制,缓解模型在实体识别中的过度泛化问题,进而提升语义聚类工具对页面划分策略的实用指导价值。该数据集的方法论和资源库为相关领域提供了一种高鲁棒性的解决方案,其影响在于推动关键词研究从静态词频统计向动态语义角色分析的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务