agrokenga/claude-opus-reasoning
收藏资源简介:
该数据集是一个用于训练和评估对话模型的数据集,包含两个配置:default和sft。default配置具有8250个训练示例,包括文本、消息、被选择回复和被拒绝回复等特征,支持多轮对话和工具调用(如函数调用),适用于偏好对齐和强化学习从人类反馈(RLHF)任务。sft配置类似但仅包含消息特征,适用于监督微调。数据集总大小约为33-34 MB,旨在提升模型在对话生成、工具使用和响应选择方面的能力。
This dataset is designed for training and evaluating dialogue models, with two configurations: default and sft. The default configuration contains 8250 training examples and features such as text, messages, chosen responses, and rejected responses, supporting multi-turn dialogues and tool calls (e.g., function calls), making it suitable for preference alignment and reinforcement learning from human feedback (RLHF) tasks. The sft configuration is similar but includes only messages, tailored for supervised fine-tuning. The total dataset size is approximately 33-34 MB, aimed at enhancing model capabilities in dialogue generation, tool usage, and response selection.




