Mercury
收藏资源简介:
Mercury是一个多语言指令调优数据集,旨在提升英语(EN)、德语(DE)和波斯语(FA)三种语言的AI能力。该数据集专注于改进文本摘要、通用问答和基础代码生成任务的性能。数据集包含200多个示例,涵盖文本摘要、通用问答和基础编码三个领域,格式为指令-响应对,适用于1B参数模型的微调。数据集已用于微调WALL-E 1B模型,显示出在多语言理解、指令遵循准确性和任务特定性能方面的改进。
Mercury数据集概述
数据集基本信息
- 数据集名称: Mercury Dataset
- 许可证: Apache 2.0
- 支持语言: 波斯语 (fa)、英语 (en)、德语 (de)
- 任务类型: 指令微调
- 微调模型: sinamsv0/WALL-E (1B参数)
数据集概览
- 总示例数: 200+
- 语言: 英语、德语、波斯语
- 领域: 文本摘要、通用问答、基础代码生成
- 格式: 指令-响应对
- 许可证: MIT
核心特性
- 三语支持: 提供英语、德语和波斯语的并行示例
- 任务多样性: 涵盖三个不同但互补的领域
- 指令微调就绪: 格式可直接用于大语言模型微调
- 质量导向: 为有效的模型对齐而精心策划的示例
- 紧凑高效: 针对10亿参数模型进行了优化
数据集结构
可用格式
JSON行格式: json { "question": "", "answer": "" }
任务分布
- 文本摘要 (40%)
- 新闻文章
- 技术文档
- 对话记录
- 通用问答 (40%)
- 事实性问题
- 解释性查询
- 比较分析
- 基础代码生成 (20%)
- Python语法解释
- 算法描述
- 简单代码生成
使用方法
通过Hugging Face直接加载
python from datasets import load_dataset dataset = load_dataset("your-username/mercury-dataset") train_data = dataset["train"] test_data = dataset["test"]
用于微调
python from transformers import AutoModelForCausalLM, AutoTokenizer model_name = "sinamsv0/WALL-E" model = AutoModelForCausalLM.from_pretrained(model_name) tokenizer = AutoTokenizer.from_pretrained(model_name) def format_instruction(example): text = f"Instruction: {example[instruction]} " if example[input]: text += f"Input: {example[input]} " text += f"Response: {example[output]}" return {"text": text}
性能表现
该数据集已用于微调WALL-E 10亿参数模型,在以下方面显示出改进:
- 跨英语-德语-波斯语的理解能力
- 指令遵循准确性
- 摘要和编码等特定任务的性能
- 多语言响应生成
语言覆盖
- 英语 (EN): 技术文档、编程
- 德语 (DE): 欧洲市场应用
- 波斯语 (FA): 中东语境、本地化人工智能
贡献指南
欢迎通过以下方式为扩展Mercury数据集做出贡献:
- 添加更多高质量示例
- 扩展到其他语言
- 改进现有翻译
- 添加新的任务类别
相关资源
- WALL-E基础模型
- Hugging Face数据集
- 指令微调指南
许可证信息
本数据集根据Apache 2.0许可证发布。




