遇见数据集

Claim2Vec: Embedding Fact-Check Claims for Multilingual Similarity and Clustering

收藏
Zenodo2026-04-14 更新2026-05-26 收录
官方服务:

资源简介:

This repository contains the train and test data used for the experiments involving Claim2Vec Model - the first multilingual embedding model optimized to represent fact-check claims as vectors in an improved semantic embedding space. MultiClaim - Train 49K Multilingual claim pairs annotated for their similarity using three large language models as similar or dissimilar. All claim pairs belongs to topic group 1. Content: CID_1, CID_2 - Factchecked claim IDs from the original dataset MultiClaimNet CLAIM_1, CLAIM_2 - Claims in their original language Translation_1, Translation_1, Claims in English translation Language_1, Language_2 - Language of the claims Label - 1/0 similar/dissimilar MultiClaim - Test Subset of clusters from MultiClaim from MultiClaimNet discussing topic group 2. This set composed of 42.4K claims grouped into 16K clusters. Preprint: https://arxiv.org/abs/2604.09812 References If you use claim pairs from Claim2Vec research in any publication, project, tool, or in any other form, please cite the following paper: @misc{panchendrarajan2026claim2ve, title={Claim2Vec: Embedding Fact-Check Claims for Multilingual Similarity and Clustering}, author={Rrubaa Panchendrarajan and Arkaitz Zubiaga}, year={2026}, eprint={2604.09812}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2604.09812}, }

提供机构:
Zenodo
创建时间:
2026-04-10
二维码
社区交流群
二维码
科研交流群
商业服务