遇见数据集

tea-hypervectors

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集来自加拿大魁北克省加蒂诺的茶叶经销商 Maison de thé Cha Yi 的公开商店,包含166种散装茶叶的英文简介,涵盖乌龙茶、绿茶、白茶、红茶和黄茶系列。数据以Lance格式存储,支持通过LanceDB进行多模态检索。每条记录包含产品文本(标题、描述)、茶叶类别标签(class)、感官与加工标签(氧化程度、烘焙、香气、味道)、产地与海拔元数据(国家、产区、海拔、置信度)、来源URL以及主要产品图像的二进制字节。数据规模为166行,语言为英语,模态包括文本、图像和表格元数据。数据集适用于非商业性教育和研究工作,包括多模态与文本检索、茶叶类型分类、特征工程与元数据增强、全文本/向量/混合搜索原型,以及使用LanceDB演示二进制图像与结构化元数据共存。字段包括id、source_url、image、class、title、description、country、region、oxidation、roast、aroma、taste、elevation_meters、elevation_confidence。注意:数据仅代表单一零售商的小型目录,类别不平衡,标签基于商店分类,内容可能随时间变化。

This dataset consists of English descriptions of 166 loose-leaf teas collected from the public shop of Maison de thé Cha Yi, a tea dealer in Gatineau, Quebec, Canada. It covers oolong, green, white, black, and yellow tea series. The data is stored in Lance format and supports multimodal retrieval via LanceDB. Each record includes product text (title, description), tea category label (class), sensory and processing tags (oxidation, roast, aroma, taste), origin and elevation metadata (country, region, elevation, confidence), source URL, and binary bytes of the main product image. The dataset has 166 rows, language is English, and modalities include text, image, and tabular metadata. It is suitable for non-commercial educational and research purposes, including multimodal and text retrieval, tea type classification (image or text), feature engineering and metadata augmentation, full-text/vector/hybrid search prototyping, and demonstrating coexistence of binary images and structured metadata using LanceDB. Fields include: id, source_url, image, class, title, description, country, region, oxidation, roast, aroma, taste, elevation_meters, elevation_confidence. Note: Data represents only a small catalog from a single retailer, has class imbalance, labels are based on store classification rather than independently verified botanical taxonomy, and content may change over time.

创建时间:
2026-07-29
原始信息汇总

数据集概述:Cha Yi Tea Profiles in Lance Format

基本信息

  • 数据集名称:Canadian loose-leaf tea profiles in Lance format(Cha Yi 茶叶档案)
  • 许可证:CC BY-NC 4.0(知识共享-非商业使用)
  • 语言:英语
  • 数据集规模:166行(n<1K)
  • 任务类别:图像分类、文本分类、文本检索
  • 数据格式:Lance 格式
  • 存储路径data/train.lance

数据集内容

该数据集包含来自加拿大魁北克省加蒂诺茶叶零售商 Maison de thé Cha Yi(https://chayi.ca/)公开店铺的166条散装茶叶英文档案,覆盖乌龙茶、绿茶、白茶、红茶和黄茶五大茶类。每条记录包含产品文本、茶叶类别标签、感官与加工标签、产地与海拔元数据、来源URL以及以字节存储的主产品图片。数据以本地 Lance 表形式提供,并建有基于产品描述的全文本搜索索引 description_fts

数据统计

茶类 行数
红茶 (Black) 51
绿茶 (Green) 65
乌龙茶 (Oolong) 35
白茶 (White) 12
黄茶 (Yellow) 3
总计 166
  • 模态:文本、图像、表格元数据
  • Hub 分割train(完整166行快照)
  • 元数据收集时间:2026年7月26日
  • 快照定稿时间:2026年7月28日

字段结构

字段 类型 描述
id int64 来源店铺的稳定产品标识符
source_url string 对应 Cha Yi 产品页面的直接链接
image binary 规范化 JPEG 产品图片字节
class string 五个茶类之一(black/green/oolong/white/yellow)
title string 英文产品展示标题
description string 英文产品描述及品鉴或冲泡文本
country string(可空) 茶叶原产国(如有)
region string 经审核的种植区域标签
oxidation string 派生氧化度标签
roast string 派生烘焙度标签
aroma list<string> 基于描述的香气片段
taste list<string> 基于描述的味道片段
elevation_meters int64 经审核的代表性种植海拔
elevation_confidence float64 海拔值置信度(0到1)

数据构建方法

数据通过以下流程构建:

  1. 发现五个公开茶类集合中的产品
  2. 以英文(加拿大)语言偏好请求公开产品页面
  3. 保留英文展示文本和类别信息
  4. 派生氧化度、烘焙度、香气和味道标签
  5. 估计并人工审核区域/海拔元数据
  6. 为每款导出茶叶下载并规范化一张 JPEG 图片
  7. 使用 Polars 选择服务模式并附加本地图片字节
  8. 将 Polars DataFrame 导入 LanceDB
  9. description 上构建命名全文本搜索索引

元数据提取过程共发送171次顺序请求,耗时约172秒,所有请求间隔至少1秒。

预期用途

该数据集适用于非商业教育和研究工作,包括:

  • 多模态和文本检索实验
  • 茶叶类型图像或文本分类
  • 特征工程和元数据丰富
  • 全文、向量或混合搜索原型
  • 在 LanceDB 中演示二进制图像与结构化元数据的联合存储

注意事项与局限性

  • 仅代表单一零售商的小型目录,不反映全球茶叶市场
  • 五个类别不平衡(黄茶仅3条)
  • 标签基于店铺集合归属,而非独立验证的植物学或生产分类体系
  • 描述和摄影带有零售用途的编辑和营销视角
  • 价格、库存、描述等可能已随时间变化
  • 英语过滤排除了部分多语言信息
  • 产品图片在构图、光线、包装等方面存在差异
  • 无预定义分割或基准指标
  • 用户应自行定义评估分割策略

许可与归属

  • 数据集整理部分采用 CC BY-NC 4.0 许可证
  • 底层知识产权(茶叶名称、品鉴描述、品牌和摄影)归 Maison de thé Cha Yi 及其各自权利持有人所有
  • 原数据来源:https://chayi.ca/
  • 每条记录包含直接的 source_url 用于溯源
  • 允许用途:非商业教育与研究
  • 建议用户保留归属、链接回原始产品页面,并可考虑购买产品支持商家

引用方式

无正式学术引用格式,建议引用数据集仓库并注明 Maison de thé Cha Yi 为底层产品内容的版权持有人,可使用提供的 BibTeX 条目。

搜集汇总
数据集介绍
tea-hypervectors 数据集图片
构建方式
该数据集源自加拿大魁北克省加蒂诺市的茶叶零售商Maison de thé Cha Yi,通过系统化采集其公共商店前端中的166款散装茶叶档案构建而成。采集过程严格遵循伦理规范,对每款产品的公共页面发起顺序请求,并设置至少一秒钟的间隔以避免对源网站造成负担。后续处理中,运用语言过滤机制排除法语文本,仅保留英语信息,并基于产品描述推导出氧化程度、烘焙程度、香气和风味等感官标签。此外,通过人工核查与估算方式,为每款茶叶补充了产地、海拔及海拔置信度等元数据。最终,利用Polars数据处理库选定服务模式,将标准化JPEG图像字节与结构化元数据整合,并导入LanceDB形成本地可查询的Lance表,同时构建了针对产品描述的全文本搜索索引。
使用方法
使用者可直接从Hugging Face Hub加载Lance数据集,利用Lance Python API进行扫描、筛选和投影操作,例如按茶叶类别过滤或选取特定列而不必读取图像字节。该数据集被设定为单一的'train'拆分,旨在便于数据查看器渲染,而非预设的评估划分,因此研究者在进行模型评估时需自行定义拆分策略,并注意随机行级拆分可能高估泛化能力。适用场景包括多模态检索、茶叶图像或文本分类、特征工程、全文本与向量混合搜索原型,以及演示如何在LanceDB中存储二进制图像与结构化元数据。使用时需遵守非商业许可协议,保留原始来源URL,并考虑支持原商家。
背景与挑战
背景概述
该数据集为超维计算(HDC)领域的研究提供了多模态茶叶档案的独特资源。由研究人员于2026年7月创建,数据源自加拿大魁北克省加蒂诺的茶商Maison de thé Cha Yi的公开店面,涵盖乌龙茶、绿茶、白茶、红茶和黄茶五大类共166种散装茶叶。核心研究问题在于如何利用HDC进行跨模态检索和分类,数据集以Lance格式存储,结合文本、图像和表格元数据,为探索超维向量在语义空间中的表征能力提供了实验基础。其发布在Hugging Face平台,对推动多模态学习与检索技术的边界具有潜在影响。
当前挑战
该数据集所应对的领域挑战主要体现在:多模态检索与分类任务中,如何有效整合异构数据(如JPEG图像与文本描述)以构建统一的超维向量表示;茶叶类别间的不平衡分布(黄茶仅3例)为模型训练与评估带来显著困难,易导致过拟合与偏差。构建过程中,数据采集面临网络请求的时序限制与多语言文本处理的复杂性,需在保持数据质量的前提下剔除法语内容,并手动审查区域与海拔元数据。此外,单一零售商的来源限制和零售导向的文本与图像,可能引入编辑性偏见,妨碍模型学习到普适性的茶叶特征,且缺乏预定义评估标准,增加了结果可比性的挑战。
常用场景
经典使用场景
作为一款专为超维度计算(HDC)研究设计的多模态数据集,tea-hypervectors提供了166条加拿大散装茶叶的详尽档案,涵盖文本描述、标准化JPEG图像与结构化元数据。其Lance格式存储与内建全文检索索引,使其成为多模态检索、文本-图像跨模态匹配及混合搜索原型开发的理想试验场。研究者可利用该数据集探索基于超维向量的高效编码与相似性检索算法,验证HDC在处理异构数据时的表达能力与鲁棒性,从而推动认知计算与向量符号架构在真实世界小规模数据集上的应用研究。
解决学术问题
该数据集直面小样本、多模态、真实世界数据在学术研究中的挑战,解决了缺乏兼具细粒度茶叶分类标签、感官描述与图像信息的公开基准问题。其类别不均衡(仅3例黄茶)与单一零售商来源的特性,为研究标签噪声、域偏移及数据增强策略提供了独特素材。通过提供可追溯的源URL与人工核验的产地、海拔等元数据,它助力于探究多模态特征融合、零样本分类、弱监督学习等难题,并促进对模型泛化能力与偏见来源的深入理解,对计算农业、食品信息学及可解释AI领域具有方法论启示。
实际应用
在实际应用中,该数据集可支撑茶叶电商平台的智能产品推荐与搜索功能,实现基于用户自然语言描述或图像上传的精准茶叶类型识别与相似品匹配。其LanceDB集成示例展示了实时全文本-向量混合查询的可行性,可用于构建轻量级、可部署的垂直领域问答系统。此外,数据集的产地、海拔等metadata为茶叶溯源、品质评估及供应链数字化提供了数据基础,赋能茶行业从种植到销售的智能化管理,同时其非商业许可也鼓励教育机构将其用于数据科学实践教学。
数据集最近研究
最新研究方向
该数据集聚焦于超维计算(HDC)与多模态检索的前沿交叉领域,以加拿大散装茶叶的细粒度档案为实验载体,探索文本、图像与结构化元数据在Lance格式下的高效融合与查询。研究热点集中于利用超维向量实现跨模态语义绑定与联想记忆,推动小样本、低资源场景下的分类与检索模型革新。通过提供包含感官标签、产地海拔等专业注释的166条精炼记录,该数据集为验证HDC在真实世界多模态任务中的鲁棒性提供了独特基准,其LanceDB集成范式亦为构建可扩展的AI湖仓架构提供了实践启示,对推动非传统数据形态的智能处理具有方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务