PandaVT/chinese_verdict_examples
收藏资源简介:
该数据集名为verdicts_200.jsonl,包含了200个来自中国裁判文书网的判决书示例,这些数据经过处理,用于语义检索任务。
This dataset, named verdicts_200.jsonl, contains 200 sample court verdicts sourced from China Judgements Online. All the data have been preprocessed for semantic retrieval tasks.
数据集概述
- 数据集名称: verdicts_200.jsonl
- 数据来源: 中国裁判文书网
- 数据内容: 包含200个来自中国裁判文书网的判决书示例
- 处理目的: 用于语义检索
数据使用示例
-
模型: BGE(使用BAAI/bge-large-zh-v1.5模型)
-
功能: 计算查询与判决书之间的相似度
-
示例代码: python from FlagEmbedding import FlagModel from datasets import load_dataset dataset = load_dataset("FarReelAILab/verdicts") model = FlagModel(BAAI/bge-large-zh-v1.5, query_instruction_for_retrieval="为这个句子生成表示以用于检索相关文章:", use_fp16=True) queries = [撞车后,交警不给出全责的认定书,对方车又不签字,事情就将起来了,我该怎么办, 因为做生意资金不足,借款高利贷,写下凭据到时还不了钱就把90㎡的房子抵押给高利贷方这凭据有没有法律效益?] passages = [dataset[train][11][文书内容], dataset[train][173][文书内容]] q_embeddings = model.encode_queries(queries) p_embeddings = model.encode(passages) scores = q_embeddings @ p_embeddings.T print(scores)
-
输出示例: python [[0.5845 0.4473] [0.4902 0.618 ]]




