Mori-kamiyama/LINE-Reply-gate-dataset
收藏资源简介:
--- language: - ja license: other task_categories: - text-classification pretty_name: LINE Reply Gate Dataset size_categories: - 1K<n<10K --- # LINE Reply Gate Dataset LINE における返信可否と返信タイプの判定を学習・検証するためのデータセットです。 各レコードは、1件の LINE 会話コンテキストを表します。入力は話者ペルソナと会話履歴、出力はその状況で取るべきアクションです。 ## Purpose このデータセットは、以下のような判定タスクを想定しています。 - 返信するべきかを判定する - 返信ではなく相槌やリアクションで十分かを判定する - 既読スルーに近い `ignore` を選ぶべき状況を判定する - 会話履歴とペルソナを使って、返信行動の傾向を分析する ## Record Structure 冗長な raw chat 形式は持たず、学習や分析に必要な要素だけに絞っています。 ### Main fields - `name` - `age_group` - `role` - `personality` - `line_style` - `reply_tendency` - `busy_behavior` - `awkward_behavior` - `reaction_style` - `conversation_turns`: 会話履歴をターン単位で持つ配列 - `num_turns`: 会話ターン数 - `label`: 判定ラベルを表す辞書 - `action`: 主ラベル - `trigger_type`: 補助ラベル 固定長で扱いやすいペルソナ属性は、ネストせずトップレベル列として保持しています。 ### `conversation_turns` `conversation_turns` は以下の形の配列です。 ```json [ {"time": "08:12", "speaker": "さくら", "text": "おはよう"}, {"time": "08:14", "speaker": "たかし", "text": "おはよう。ゆっくり起きてね。"} ] ``` ### `label` `label` は元のラベル辞書を保持します。通常は以下を含みます。 - `action` - `trigger_type` `action` と `trigger_type` は、検索や学習で扱いやすいようにトップレベルにも複製しています。 ## Label Semantics ### `action` - `reply`: 明示的な返信を返すべき状況 - `backchannel`: 短い相槌や軽い反応で十分な状況 - `ignore`: 返信不要、もしくは保留が自然な状況 ### `trigger_type` 会話上のきっかけの種別を表します。例: - `direct_question` - `ambient_reaction` - `stall` ## Suggested Uses - 返信要否の分類モデルの学習 - 会話履歴とペルソナを条件にした行動予測 - ゲーティングモデルの評価用ベンチマーク - `action` / `trigger_type` の分布分析 ## Limitations - データは実会話ログそのものではなく、生成モデルを用いて構成した学習用データです - ペルソナ表現や会話文体には生成由来の偏りが含まれる可能性があります - 会話履歴のパースは現状の書式前提のため、元データのフォーマットが変わると追加整備が必要です - ラベルは会話状況に対する単一の正解を保証するものではなく、運用文脈によっては別判断もありえます ## Source このデータセットは `gpt-oss 120b` を用いて作成した学習用データを元に整形しています。
--- 语言: - 日语 许可协议:其他 任务类别: - 文本分类 数据集展示名称:LINE 回复门数据集(LINE Reply Gate Dataset) 数据规模区间: - 1000条 < 样本数 < 10000条 --- # LINE 回复门数据集 本数据集用于学习与验证LINE平台中的回复必要性及回复类型判定任务。 每条记录代表一则LINE会话上下文,输入包含说话者人设与会话历史,输出为该场景下应采取的对话行动。 ## 任务目标 本数据集面向以下几类判定任务: - 判定是否需要进行回复 - 判定是否仅需使用附和语或轻量反应即可,无需正式回复 - 判定应选择类似已读跳过的`ignore`(忽略)的场景 - 结合会话历史与人设,分析回复行为倾向 ## 记录结构 本数据集不包含冗余的原始聊天格式,仅保留机器学习与分析所需的核心要素。 ### 核心字段 - `name`:姓名 - `age_group`:年龄区间 - `role`:角色定位 - `personality`:性格特质 - `line_style`:LINE聊天风格 - `reply_tendency`:回复倾向 - `busy_behavior`:忙碌状态下的行为模式 - `awkward_behavior`:尴尬场景下的行为模式 - `reaction_style`:反应风格 - `conversation_turns`:以轮次为单位存储会话历史的数组 - `num_turns`:会话轮次总数 - `label`:表示判定标签的字典 - `action`:主标签 - `trigger_type`:辅助标签 为便于处理,人设属性均以扁平化的顶层字段形式存储,不进行嵌套。 ### `conversation_turns` 字段说明 `conversation_turns` 为如下格式的数组: json [ {"time": "08:12", "speaker": "さくら", "text": "おはよう"}, {"time": "08:14", "speaker": "たかし", "text": "おはよう。ゆっくり起きてね。"} ] ### `label` 字段说明 `label` 存储原始标签字典,通常包含以下字段: - `action` - `trigger_type` 为便于检索与模型训练,`action`与`trigger_type`也会被复制至顶层字段中。 ## 标签语义说明 ### `action` 主标签 - `reply`:需进行明确回复的场景 - `backchannel`:仅需简短附和或轻量反应即可的场景 - `ignore`:无需回复,或选择暂缓回复更为自然的场景 ### `trigger_type` 辅助标签 用于表示会话触发的类型,示例包括: - `direct_question`:直接提问 - `ambient_reaction`:环境式反应 - `stall`:拖延/暂缓类触发 ## 推荐应用场景 - 回复必要性分类模型的训练 - 以会话历史与人设为条件的对话行为预测 - 门控模型(gating model)的评估基准测试 - `action`与`trigger_type`标签的分布分析 ## 数据集局限性 - 本数据集并非真实会话日志,而是基于生成模型构建的训练数据 - 人设表述与聊天风格可能存在生成模型带来的固有偏差 - 会话历史的解析依赖当前固定格式,若原始数据格式发生变更,需进行额外适配调整 - 标签并非会话场景下的唯一标准答案,根据实际应用场景的不同,可能存在其他合理判定 ## 数据集来源 本数据集基于使用`gpt-oss 120b`生成的训练数据进行整理得到。



