TAAC2026/second_round_sample_1000
收藏资源简介:
TAAC2026第二轮演示数据集(1000个样本)是一个包含1000个用户-项目交互记录的样本数据集,专为TAAC2026竞赛设计。数据集采用扁平列布局,所有特征存储为单独的顶级列,而非嵌套结构或数组。数据文件为demo_1000.parquet,包含1000行和142列,文件大小约40 MB。列分为7个类别:ID和标签(5列,包括用户ID、项目ID、标签类型、标签时间和时间戳,无空值)、用户整数特征(54列,包括标量和数组类型的离散用户特征,如年龄、性别和婚姻状况等)、用户密集特征(17列,连续值用户特征,如嵌入和对应对齐信号)、项目整数特征(17列,离散项目特征,如类别、类型和多标签信息)、项目密集特征(4列,连续值项目特征,如嵌入)、领域序列特征(45列,来自4个行为领域的列表序列)。数据集可用于推荐系统任务,支持通过pandas或Hugging Face datasets库加载。
A sample dataset containing 1000 user-item interaction records for the second round of TAAC2026 competition. This dataset uses a flat column layout — all features are stored as individual top-level columns instead of nested structs/arrays. The file is demo_1000.parquet with 1000 rows and 142 columns, approximately 40 MB in size. Columns are divided into 7 categories: ID & Label (5 columns, including user_id, item_id, label_type, label_time, and timestamp, with no null values), User Int Features (54 columns, discrete user features with scalar and array types, such as age, gender, and marital status), User Dense Features (17 columns, continuous-valued user features like embeddings and aligned signals), Item Int Features (17 columns, discrete item features including categories, types, and multi-label information), Item Dense Features (4 columns, continuous-valued item features like embeddings), and Domain Sequence Features (45 columns, list sequences from 4 behavioral domains). The dataset is intended for recommendation tasks and can be loaded using pandas or Hugging Face datasets.




