VK-LSVD
收藏资源简介:
VK-LSVD是由俄罗斯社交巨头VK旗下AI团队与莫斯科国立大学联合构建的工业级短视频推荐数据集,为当前公开规模最大的同类数据集。该数据集包含6个月内1000万用户与2000万视频产生的407亿次交互行为,涵盖内容嵌入向量、多模态反馈信号(如观看时长、点赞、评论)及上下文元数据等丰富特征。数据经过严格匿名化处理,通过分层采样支持定制化子集生成,其全局时间划分机制为研究用户兴趣演化提供了独特优势。该数据集旨在推动序列推荐、冷启动场景及多模态推荐系统的前沿研究,已应用于2025年VK推荐系统挑战赛。
VK-LSVD is an industrial-grade short-video recommendation dataset jointly constructed by the AI team of VK, the Russian social media giant, and Lomonosov Moscow State University, and it is currently the largest public dataset of its kind. This dataset contains 40.7 billion interaction behaviors between 10 million users and 20 million videos over a 6-month period, covering rich features such as content embedding vectors, multimodal feedback signals (e.g., watch duration, likes, comments) and contextual metadata. The data has undergone strict anonymization processing, supports customized subset generation via stratified sampling, and its global temporal partitioning mechanism provides a unique advantage for researching the evolution of user interests. This dataset aims to advance cutting-edge research on sequential recommendation, cold-start scenarios and multimodal recommendation systems, and has been applied to the 2025 VK Recommendation System Challenge.
VK-LSVD 数据集概述
数据集基本信息
- 数据集名称:VK-LSVD (Large Short-Video Dataset)
- 许可证:Apache-2.0
- 任务类别:表格分类、表格回归、图机器学习、其他
- 标签:推荐系统、短视频、片段、检索、排序、用户建模、工业、真实世界
- 数据规模:100亿到1000亿条数据之间
- 语言:英语
- 官方描述:最大的开源工业短视频推荐数据集,包含真实世界的交互数据。
核心数据规模
- 用户数量:10,000,000
- 视频项目数量:19,627,601
- 唯一交互数量:40,774,024,903
- 交互密度:0.0208%
- 总观看时间:858,160,100,084秒
- 点赞数:1,171,423,458
- 点踩数:11,860,138
- 分享数:262,734,328
- 收藏数:40,124,463
- 作者点击数:84,632,666
- 评论打开数:481,251,593
数据时间范围
- 时间跨度:连续六个月的用户交互数据
- 时间顺序:全局时间排序
- 数据划分:训练集/验证集/测试集按时间顺序划分(过去数据用于训练,未来数据用于验证/测试)
数据结构与内容
交互数据
- 数据位置:https://huggingface.co/datasets/deepvk/VK-LSVD/tree/main/interactions
- 数据格式:每周一个文件(week_XX.parquet),文件内按时间戳递增排序
- 关键特性:每个用户-项目对没有重复曝光
- 字段说明:
user_id:用户标识符(uint32)item_id:视频标识符(uint32)place:位置(24个ID,uint8)platform:平台(11个ID,uint8)agent:客户端(29个ID,uint8)timespent:观看时间(0-255秒,uint8)like:用户是否点赞(布尔值)dislike:用户是否点踩(布尔值)share:用户是否分享(布尔值)bookmark:用户是否收藏(布尔值)click_on_author:用户是否打开作者页面(布尔值)open_comments:用户是否打开评论部分(布尔值)
用户元数据
- 数据位置:https://huggingface.co/datasets/deepvk/VK-LSVD/blob/main/metadata/users_metadata.parquet
- 字段说明:
user_id:用户标识符(uint32)age:年龄(18-70岁,uint8)gender:性别(uint8)geo:最常用户位置(80个ID,uint8)train_interactions_rank:用于采样的流行度排名(越低表示交互越多,uint32)
项目元数据
- 数据位置:https://huggingface.co/datasets/deepvk/VK-LSVD/blob/main/metadata/items_metadata.parquet
- 字段说明:
item_id:视频标识符(uint32)author_id:作者标识符(uint32)duration:视频时长(秒,uint8)train_interactions_rank:用于采样的流行度排名(越低表示交互越多,uint32)
嵌入数据
- 数据位置:https://huggingface.co/datasets/deepvk/VK-LSVD/blob/main/metadata/item_embeddings.npz
- 嵌入特性:
- 严格基于内容训练(视频/描述/音频等)
- 不包含协同信号
- 组件有序排列:前n个组件的点积近似于原始生产嵌入的余弦相似度
- 支持1到64维度的选择,以权衡质量和速度/内存
- 字段说明:
item_id:视频标识符(uint32)embedding:项目内容嵌入(float16[64])
隐私保护措施
- 所有分类元数据(
user_id、geo、item_id、author_id、place、platform、agent)都匿名化为稳定的整数ID - ID在不同划分中保持一致
- 不提供反向映射
可配置子集
数据集提供多个预定义的子集,用于快速实验:
| 子集名称 | 用户数 | 项目数 | 交互数 | 密度 |
|---|---|---|---|---|
whole |
10,000,000 | 19,627,601 | 40,774,024,903 | 0.0208% |
ur0.1 |
1,000,000 | 18,701,510 | 4,066,457,259 | 0.0217% |
ur0.01 |
100,000 | 12,467,302 | 407,854,360 | 0.0327% |
ur0.01_ir0.01 |
90,178 | 125,018 | 4,044,900 | 0.0359% |
up0.01_ir0.01 |
100,000 | 171,106 | 38,404,921 | 0.2245% |
ur0.01_ip0.01 |
99,893 | 196,277 | 191,625,941 | 0.9774% |
up0.01_ip0.01 |
100,000 | 196,277 | 1,417,906,344 | 7.2240% |
up0.001_ip0.001 |
10,000 | 19,628 | 47,976,280 | 24.4428% |
up-0.9_ip-0.9 |
8,939,432 | 17,654,817 | 2,861,937,212 | 0.0018% |
命名规则:
urX:X比例的随机用户ipX:X比例的流行项目(按train_interactions_rank)- 负X表示最不受欢迎的部分(例如
−0.9表示底部90%)
数据访问说明
- 测试集将在即将到来的挑战赛后发布
- 提供快速开始代码示例,用于加载小型子集
- 提供实用工具函数,用于根据任务、数据预算和硬件需求组合自定义子集




