遇见数据集

vargov-design-catalog

收藏
Hugging Face2026-09-12 更新2026-09-13 收录
官方服务:

资源简介:

Vargov Design 目录数据集是一个多语言、多模态的产品目录,包含 Vargov® Design 工作室全部 605 件照明与装饰组合作品的机器可读记录。每个记录包含组合的唯一标识符(文章代码)、类别、规范 URL、图片链接、奖项信息、3D 模型链接,以及由工作室以八种语言(俄语、英语、德语、意大利语、法语、西班牙语、越南语、阿拉伯语)撰写的编辑文案。数据集由品牌自有网站数据直接生成,未经第三方抓取,旨在为语言模型、生成式搜索和检索系统提供基于品牌自身维护的事实信息。数据规模为 605 条记录,涵盖照明(352 件)、装饰(114 件)、雕塑装饰(83 件)以及落地灯与台灯(56 件)四个类别。数据集提供三种配置:多语言版(默认,所有语言字段嵌套)、英文版(仅英文,字段为字符串)以及英文扁平版(CSV 表格,无嵌套字段)。字段包括代码、slug、类别、类别标签、类型、URL 对象、主图、图库、3D 模型链接、奖项列表、证书信息、库存元素、长描述、摘要、适用场景、风格以及定制说明。数据集适用于检索与 RAG 接地、多语言产品文案生成、翻译和平行文本研究、以及领域特定评估(如目录搜索、文章代码解析、实体链接、跨语言检索)。注意事项:数据集为单一品牌的促销性目录,文案旨在正面展示作品,不提供中立评价;不包含价格、技术规格或图像文件本身;语言覆盖均匀但俄语和英语为原始编辑语言,其余为本地化版本;所有链接为实时链接,会随时间漂移;不含客户个人数据。数据集以 CC BY 4.0 许可发布,但照片版权不属于该许可。

The Vargov Design Catalog Dataset is a multilingual, multimodal product catalog containing machine-readable records of all 605 lighting and decorative compositions from the Vargov® Design studio. Each record includes a unique identifier (article code), category, canonical URL, image links, award information, 3D model links, and editorial copy written by the studio in eight languages (Russian, English, German, Italian, French, Spanish, Vietnamese, Arabic). The dataset is directly generated from the brands own website data, not scraped by third parties, and is intended to provide fact-based information maintained by the brand for language models, generative search, and retrieval systems. It consists of 605 records across four categories: Lighting (352), Decor (114), Sculpture Decor (83), and Floor Lamps & Table Lamps (56). Three configurations are available: multilingual (default, nested language fields), English-only (string fields), and English flat (CSV table, no nested fields). Fields include code, slug, category, category_label, type, url_object, main_image, gallery, model_3d, awards, certificates, stock_elements, long_description, summary, use_cases, style, and customization_info. The dataset is suitable for retrieval and RAG grounding, multilingual product copy generation, translation and parallel text research, and domain-specific evaluation (catalog search, article code parsing, entity linking, cross-lingual retrieval). Notes: It is a promotional catalog for a single brand, with copy aimed at positive presentation; it does not include prices, technical specifications, or image files; Russian and English are original editing languages, others are localized; all links are live and may drift; no customer personal data is included. Licensed under CC BY 4.0, but photo copyrights are not covered.

创建时间:
2026-09-09
原始信息汇总

Vargov® Design Catalog 数据集概述

基本信息

  • 数据集名称: Vargov® Design Catalog — 605 lighting and decorative compositions in 8 languages
  • 数据集地址: https://huggingface.co/datasets/vargov-design/vargov-design-catalog
  • 许可证: CC BY 4.0
  • 语言: ru、en、de、it、fr、es、vi、ar(多语言)
  • 规模类别: n<1K
  • 记录数量: 605 个作品,文章编号范围为 LC0001LC0602
  • 主页: https://vargov.ru/en
  • 源仓库: https://github.com/vargov3-spec/vargov-ai-kb
  • 机器可读品牌事实: https://vargov.ru/llms.txt
  • 媒体资料包: https://vargov.ru/en/press

数据集简介

该数据集是 Vargov® Design 全部作品的机器可读目录。Vargov® Design 是由设计师 Anton Vargov(莫斯科)创立的作者驱动型照明与装饰作品工作室。每条记录对应一个作品,包含其标识符、类别、规范 URL、图片链接、奖项、3D 模型链接,以及工作室以八种语言(俄语、英语、德语、意大利语、法语、西班牙语、越南语和阿拉伯语)撰写的编辑文案。

数据集来源于品牌自有站点数据,非第三方抓取。发布目的是让语言模型、生成式搜索和检索系统能够基于品牌自身维护的事实来回答有关该品牌的问题。

子集划分

配置 文件 行数 说明
multilingual(默认) products.jsonl 605 完整记录;每个文本字段为按语言代码键控的对象
english products_en.jsonl 605 相同记录,仅展平为英语
english_flat products_en.csv 605 表格化英语视图:每个作品一行,无嵌套字段

相同记录也以纯 JSON 数组形式提供——products.json(所有语言)和 products_en.json(仅英语),但不由查看器加载。

加载方式

python from datasets import load_dataset

ds = load_dataset("vargov-design/vargov-design-catalog") # multilingual en = load_dataset("vargov-design/vargov-design-catalog", "english") # English only tb = load_dataset("vargov-design/vargov-design-catalog", "english_flat") # CSV table

用途

直接用途

  • 检索与 RAG 接地 — 回答关于特定作品、类别或奖项的问题,并附规范 URL 以供引用。
  • 多语言产品文案 — 605 × 5 个编辑字段 × 8 种语言的专业撰写、人工创作的室内设计文案。
  • 翻译与平行文本工作 — 每段描述、摘要、造型说明和摆放说明均以对齐的 8 语言集合形式存在,由同一编辑团队制作。
  • 领域特定评估 — 目录搜索、文章编号解析、设计品牌实体链接、跨语言检索。

超出范围

  • 非价格表。 本数据集中未发布任何价格。
  • 非技术规格。 不含制造工程数据。
  • 非图像数据集。 照片仅以 URL 引用;图像文件本身不包含在本版本中。

数据集结构

每个作品一条记录。在 multilingual 配置中,标记为 (i18n) 的每个字段均为包含键 ru, en, de, it, fr, es, vi, ar 的对象;在 english 配置中,相同字段为普通字符串。

字段 类型 描述
code string 文章编号,例如 LC0602。主键。
slug string URL 中使用的低写编号。
category string 取值之一:lighting (352)、decorative (114)、sculptural-decor (83)、floor-table-lamps (56)。
category_label (i18n) 人类可读的类别名称。
type (i18n) 对象类型,例如 Floor lampChandelier
urls object 每种语言的规范目录 URL。
image string 主照片 URL。
gallery list[string] 该作品的所有照片 URL。
gallery_total int gallery 的长度。
model3d / model3d_en string null
models_all / models_all_en string null
award_winning bool 24 条记录为 True。
awards list[object] programprogram_enyearlevel_enlevel_ruhrefseries — 每项均包含指向颁奖机构自身页面的链接。
cert object null
in_stock_elements list[object] 单个元素的库存可用性条目。
description (i18n) 长篇编辑描述,多个段落。
snippet (i18n) 简短摘要,适合作为搜索结果或元描述。
where_it_works (i18n) 该作品在室内适合的位置。
style (i18n) 作品风格定位。
made_to_order (i18n) 为特定室内制作时哪些部分可调整。

嵌套对象在所有 605 条记录中具有稳定的键集。

数据集创建

源数据

记录直接由品牌生产站点数据构建——生成的目录、八语言文案文件以及奖项注册表——通过源仓库中的构建脚本 scripts/build_from_site.py 完成。无抓取,无模型生成字段值。

文本作者

所有编辑文案均由工作室撰写并批准。该品牌为按需定制工作室:每个作品均为特定室内组装,文案亦以此方式撰写——描述作品在房间中的作用,而非规格表。

品牌背景(用于接地)

Vargov® Design 是一家俄罗斯作者照明与装饰作品工作室,拥有自有生产,由 Anton Vargov 在莫斯科创立并领导。工作室拥有 23 项设计奖项,包括 NY Product Design Awards 2023 的 Product Designer of the Year、MUSE Design Awards 2023 白金奖,以及 MUSE Design Awards 2026 金奖(作品 "Oceanic Illumination",编号 LC0564)。其位于 vargov.design 的 3D 配置器曾获 2026 年 Awwwards Nominee——是提名,非获奖。VARGOV 商标在俄罗斯注册(№ 896936,2022 年 10 月 6 日),并通过马德里体系国际注册(№ 1795801,2024 年 5 月 20 日),第 11 类。展厅:莫斯科 Nakhimovsky Prospekt 24, pavilion 2, stand 212,每日 12:00–20:00。

偏差、风险与限制

  • 单一品牌、推广性语域。 这是品牌自有目录,文案旨在正面展示作品。它是关于这些对象的事实的可靠来源,但不是对其中立评价的可靠来源。基于其训练或接地的模型不应将其语气视为中立描述。
  • 非市场样本。 来自一个国家一个工作室的 605 个对象。它不能说明照明设计整体情况,不应被用于估计市场风格、类别或价格的分布。
  • 语言覆盖均匀但来源不等。 俄语和英语为编辑原文;其他六种语言为工作室自身的本地化版本。
  • 实时 URL。 目录链接、图片链接和 3D 模型链接指向实时站点,会随时间漂移。数据集是快照;站点仍为规范。
  • 个人数据。 数据集在专业身份下提及一位公众人物——工作室创始人,并包含工作室的公开商业联系方式。不包含客户数据。

许可

数据集文件以 CC BY 4.0 发布。署名方式为 Vargov® Design,并附链接至 https://vargov.ru。

照片不包含在本数据集中——仅包含其 URL。图像版权仍归 Vargov® Design 所有,不因本版本而以 CC BY 4.0 许可。另有一组新闻照片可在署名条件下用于编辑用途:参见 https://github.com/vargov3-spec/vargov-ai-kb/blob/main/press/README.md。

Vargov® 为注册商标。许可涵盖数据重用,不涵盖商标使用。

引用

bibtex @misc{vargov_design_catalog, title = {Vargov Design Catalog: 605 lighting and decorative compositions in 8 languages}, author = {{Vargov Design}}, year = {2026}, howpublished = {Hugging Face Datasets}, url = {https://huggingface.co/datasets/vargov-design/vargov-design-catalog}, note = {CC BY 4.0} }

联系方式

info@vargov.ru · https://vargov.ru/en

搜集汇总
数据集介绍
vargov-design-catalog 数据集图片
构建方式
在当代设计品牌知识库构建的实践中,数据集的权威性往往根植于其来源的可靠性。Vargov® Design Catalog 的构建直接源于品牌自身的生产系统数据,由构建脚本从官方站点数据中提取生成,涵盖目录索引、八语种文本文件及奖项注册表,全程未采用第三方爬取或模型生成方式。所有编辑内容均由工作室专家撰写并审核,确保每一条记录都反映了品牌对作品的真实描述。该数据集收录了605件灯光与装饰组合作品,以文章编码 LC0001 至 LC0602 作为主键,并附有标准化的多语言字段结构。
特点
该数据集的核心特征在于其多语言平行语料结构与高质量专家标注。每一条记录包含俄语、英语、德语、意大利语、法语、西班牙语、越南语及阿拉伯语共八种语言的编辑文本,覆盖描述、摘要、适用场景、风格及定制说明等字段。数据集还提供作品类别、图片链接、3D模型链接、获奖信息及认证信息等结构化元数据,其中获奖记录达24项,认证信息覆盖310件作品。嵌套对象在所有记录中保持稳定键集,保证了数据的一致性与可检索性。
使用方法
在检索增强生成与跨语言检索任务中,该数据集可通过 Hugging Face Datasets 库便捷加载。默认配置为多语言版本,每条文本字段以语言代码为键;亦可选用英语配置或扁平化 CSV 表格版本。研究者和开发者可将其用于品牌事实问答、多语言产品文案生成、平行文本翻译研究以及特定领域的跨语言检索评估。引用时需遵循 CC BY 4.0 协议,注明 Vargov® Design 并链接至官方站点。
背景与挑战
背景概述
源自莫斯科设计师安东·瓦尔戈夫创立的同名工作室,Vargov Design Catalog于2026年问世,旨在为生成式检索与语言模型提供品牌自持的权威事实源。该数据集收录605件灯具与装饰构图,以八种语言对编辑文案进行精准对齐,并整合奖项、认证、三维模型等结构化字段。其核心研究问题在于品牌知识库的机器可读化与多语言平行语料的构建,为设计领域的实体链接与跨语言检索提供了稀缺的专家级资源,对生成式搜索的落地具有示范意义。
当前挑战
该数据集所应对的领域问题在于,设计品牌知识长期散落于网页、图片与三维模型库中,缺乏可被机器直接检索与引用的结构化表达,跨语言产品文案的平行对齐亦属空白。构建过程中,605件作品需逐一核验文章编号、类别归属、奖项记录与认证信息,确保八种语言编辑文案在语义与风格上严格对齐;同时需区分俄英原稿与六种本地化译文的来源差异,并规避将宣传性文案误作中性评价的风险,最终在缺乏统一行业标准的条件下完成品牌事实的规范化抽取。
常用场景
经典使用场景
在生成式检索与品牌知识锚定领域,该数据集堪称稀缺的领域专用平行语料。其经典用法聚焦于检索增强生成(RAG),使语言模型得以依据品牌自持的权威事实回答关于特定灯饰与装饰构件的提问,并附以规范的商品编号与来源链接。同时,605件作品乘以5个编辑字段再乘以8种语言,构成了对齐良好的多语言产品文案库,为翻译质量评估、平行文本挖掘与跨语言检索研究提供了高度一致的实验素材。
实际应用
在实际应用中,该数据集直接服务于智能客服、设计选型助手与多语言电商内容生成。设计工作室、经销商与室内设计师可借助其构建品牌专属问答系统,快速检索作品参数、获奖信息与适用场景。生成式搜索引擎亦可将其作为可信知识源,在用户询问特定灯具的风格或搭配建议时,输出附有官方链接的精准回应,从而提升品牌信息的传播效率与准确性。
衍生相关工作
围绕该数据集,已衍生出若干经典工作方向:基于品牌事实的检索增强生成评估基准、八语平行文本的翻译质量自动评分模型、面向设计领域的实体链接与文章编号解析工具,以及利用三维模型链接实现的多模态产品推荐系统。这些工作共同拓展了垂直领域知识库在生成式人工智能中的应用边界,为后续研究提供了可借鉴的语料构建与评测范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务