遇见数据集

deltacore/trec-ja

收藏
Hugging Face2024-10-16 更新2025-11-01 收录
官方服务:

资源简介:

--- license: cc-by-sa-4.0 --- # 日本語TRECライクな質問分類データセット ## 概要 - [trec-ja.json](./trec-ja.json) このデータセットは、日本語の質問文とその分類ラベルを含む、TRECデータセットを模した質問分類用のデータセットです。日本の文化や地理に関連する質問を含み、自然言語処理や機械学習のタスクに適しています。 ## データセットの特徴 - 質問数: 535 - 言語: 日本語 - 粗粒度ラベル数: 6 - 細粒度ラベル数: 50 ## データ構造 各データポイントは以下の構造を持っています: ```json { "text": "質問文", "coarse_label": 粗粒度ラベル(整数), "fine_label": 細粒度ラベル(整数) } ``` ### ラベルの説明 #### 粗粒度ラベル - 0: 略語 (ABBR) - 1: エンティティ (ENTY) - 2: 説明 (DESC) - 3: 人物 (HUM) - 4: 場所 (LOC) - 5: 数値 (NUM) #### 細粒度ラベル 細粒度ラベルは0から49までの整数で表現されており、各粗粒度カテゴリの下に複数の細粒度カテゴリが存在します。例えば: - 0: ABBR:abb(略語) - 2: ENTY:animal(動物) - 24: DESC:def(定義) - 29: HUM:ind(個人) - 32: LOC:city(都市) - 38: NUM:count(数) ## 使用例 このデータセットは以下のようなタスクに使用できます: 1. 質問分類モデルの訓練と評価 2. 日本語自然言語処理システムの開発 3. 質問応答システムの構築 4. テキスト分類アルゴリズムのベンチマーク ## データの読み込み方法 Pythonを使用してデータを読み込む例: ```python import json with open('japanese_trec_dataset.json', 'r', encoding='utf-8') as f: data = json.load(f) for item in data: print(f"質問: {item['text']}") print(f"粗粒度ラベル: {item['coarse_label']}") print(f"細粒度ラベル: {item['fine_label']}") print("---") ``` ## 注意事項 1. このデータセットは教育および研究目的で作成されました。実際のアプリケーションに使用する場合は、さらなるデータの拡張や検証が必要です。 2. データセットには日本の文化や地理に関する質問が含まれていますが、網羅的ではありません。 3. ラベルの割り当ては主観的な判断に基づいている場合があり、異なる解釈の余地があります。 ## ライセンス このデータセットは[CC BY-SA 4.0](https://creativecommons.org/licenses/by-sa/4.0/)ライセンスの下で公開されています。 ## 謝辞 このデータセットは、オリジナルのTRECデータセットを参考に作成されました。日本語の質問と文脈に合わせて新たに作成されたものです。 ## 連絡先 このデータセットに関するご質問やフィードバックがありましたら、日本テクノトレード株式会社(contact@techno-trade.jp)までお問い合わせください。

---许可协议:CC BY-SA 4.0--- # 仿TREC日语问题分类数据集 ## 数据集概述 - [trec-ja.json](./trec-ja.json) 本数据集为仿照TREC数据集构建的日语问题分类数据集,包含日语问句及其分类标签,涵盖与日本文化、地理相关的问题,适用于自然语言处理与机器学习相关任务。 ## 数据集核心特征 - 问句数量:535条 - 语言:日语 - 粗粒度标签(coarse_label)类别数:6类 - 细粒度标签(fine_label)类别数:50类 ## 数据结构 每个数据点具备如下结构: json { "text": "问句文本", "coarse_label": 粗粒度标签(整数), "fine_label": 细粒度标签(整数) } ### 标签说明 #### 粗粒度标签 - 0: 略语 (ABBR) - 1: 实体 (ENTY) - 2: 描述 (DESC) - 3: 人物 (HUM) - 4: 地点 (LOC) - 5: 数值 (NUM) #### 细粒度标签 细粒度标签以0至49的整数表示,每个粗粒度类别下包含多个细粒度类别,例如: - 0: ABBR:abb(略语) - 2: ENTY:animal(动物) - 24: DESC:def(定义) - 29: HUM:ind(个人) - 32: LOC:city(城市) - 38: NUM:count(数量) ## 使用示例 本数据集可应用于以下任务: 1. 问题分类模型的训练与评估 2. 日语自然语言处理系统的开发 3. 问答系统的构建 4. 文本分类算法的基准测试 ## 数据加载方法 使用Python加载数据的示例代码如下: python import json with open('japanese_trec_dataset.json', 'r', encoding='utf-8') as f: data = json.load(f) for item in data: print(f"问句: {item['text']}") print(f"粗粒度标签: {item['coarse_label']}") print(f"细粒度标签: {item['fine_label']}") print("---") ## 注意事项 1. 本数据集仅用于教育与研究目的,若用于实际应用场景,需进一步扩充数据并完成验证。 2. 数据集包含与日本文化、地理相关的问句,但并未覆盖全部相关领域内容。 3. 标签分配主要基于主观判断,存在不同解读的空间。 ## 许可协议 本数据集采用[CC BY-SA 4.0](https://creativecommons.org/licenses/by-sa/4.0/)许可协议发布。 ## 致谢 本数据集参考原始TREC数据集构建,所有日语问句及上下文均为全新创作。 ## 联系方式 若对本数据集有任何疑问或反馈,请联系日本技贸株式会社(contact@techno-trade.jp)。

提供机构:
deltacore
二维码
社区交流群
二维码
科研交流群
商业服务