logo-lab/trl-rbench
收藏资源简介:
TRL-Rbench是TRL-Bench的行级别评估套件,包含两个主要配置:1. row_prediction:包含50个OpenML表格,总计1.1M行数据(训练集887,720行,验证集110,962行,测试集110,983行),涵盖123个手动验证的目标。每行数据以JSON字典形式捆绑特征和目标,使得所有50个表格共享一个配置。2. record_linkage:将16个实体匹配源(包括8个干净的DeepMatcher、4个脏的DeepMatcher和4个WDC LSPM v2大小)统一为一个配置,包含357,833个训练行对、95,817个验证行对和42,835个测试行对。每行存储两个记录作为JSON字典,以及source、family、pair_id和label字段。
语言:英语 许可证:CC BY 4.0 许可证链接:https://huggingface.co/datasets/logo-lab/trl-rbench/blob/main/LICENSES.md 展示名称:TRL-Rbench 标签: - 表格型 - 行级 - 基准测试 - 表征学习 - 实体匹配 - 记录链接 - trl-bench 数据规模类别:100万条<数据量<1000万条 配置项: - 配置名称:行预测(row_prediction) 数据文件: - 训练集:data/row_prediction/train-*.parquet - 验证集:data/row_prediction/validation-*.parquet - 测试集:data/row_prediction/test-*.parquet - 配置名称:记录链接(record_linkage) 数据文件: - 训练集:data/record_linkage/train-*.parquet - 验证集:data/record_linkage/validation-*.parquet - 测试集:data/record_linkage/test-*.parquet # TRL-Rbench 数据集 TRL-Bench的行级评测套件: - **行预测(row_prediction)**:涵盖50张OpenML表格,总计110万行数据(训练集887,720条、验证集110,962条、测试集110,983条),涉及123个人工校验的目标变量。每一行的模式将特征与目标变量以JSON字典形式打包,因此50张表格可共用同一配置。 - **记录链接(record_linkage)**:整合了16个实体匹配数据源(8个干净版DeepMatcher、4个脏版DeepMatcher以及4个WDC LSPM v2规模数据集),统一为单一配置,包含357,833个训练样本对、95,817个验证样本对与42,835个测试样本对。每一行以JSON字典形式存储两条记录,并附带`source`(数据源标识)、`family`(数据源类别)、`pair_id`(样本对ID)与`label`(匹配标签)字段。 ## 数据模式 ### 行预测(row_prediction)模式 python { "openml_id": int32, # 示例值:3、38、458……46980(共50个唯一ID) "dataset_name": string, # 示例值:"kc2" "row_idx": int32, # 原始OpenML CSV中的行索引 "record_json": string, # 存储特征列的JSON字典 "targets_json": string, # 存储目标列的JSON字典 "target_specs_json": string, # 存储包含{名称、角色、任务类型}的JSON列表 "dataset_metadata_json": string, # 完整的dataset.json副本(包含标签列、划分方式与指纹信息) } 若需筛选单张OpenML表格,可使用如下代码: python from datasets import load_dataset import json ds = load_dataset("logo-lab/trl-rbench", "row_prediction") ds_3 = ds.filter(lambda x: x["openml_id"] == 3) print(json.loads(ds_3["train"][0]["record_json"])) ### 记录链接(record_linkage)模式 python { "source": string, # 示例值:"deepmatcher_beer"、"wdc_products_xlarge" "family": string, # 取值范围:"deepmatcher_clean" | "deepmatcher_dirty" | "wdc_products" "pair_id": string, # 格式:f"{source}/{split}/{idx}" "table_a_record_json": string, # 存储左侧记录的JSON字典 "table_b_record_json": string, # 存储右侧记录的JSON字典 "label": int32, # 0代表非匹配对,1代表匹配对 } 论文附录中提及的等价标签列(WDC数据集的`cluster_id`、`identifiers`;Fodors-Zagats数据集的`class`)并未在Parquet文件层移除;若需使用无数据泄露的视图,用户应在执行`json.loads(record_json)`后删除这些键。 ## 快速上手 python from datasets import load_dataset import json # 行预测任务 rp = load_dataset("logo-lab/trl-rbench", "row_prediction") print(rp) sample = rp["train"][0] print(json.loads(sample["record_json"])) print(json.loads(sample["targets_json"])) print(json.loads(sample["target_specs_json"])) # 记录链接任务 rl = load_dataset("logo-lab/trl-rbench", "record_linkage") sample = rl["train"][0] print(sample["source"], sample["label"]) print(json.loads(sample["table_a_record_json"])) print(json.loads(sample["table_b_record_json"])) # 筛选单一数据源 rl_beer = rl.filter(lambda x: x["source"] == "deepmatcher_beer") 各数据源的具体许可证详情请参阅`LICENSES.md`文件。



