遇见数据集

Atomic-Ai/GPT-Deepseek-German

收藏
Hugging Face2026-02-28 更新2026-03-29 收录
官方服务:

资源简介:

--- license: mit task_categories: - text-generation - question-answering language: - de tags: - deepseek - gpt - qa - german - chat size_categories: - 10K<n<100K --- # GPT-Deepseek-German QA Dataset Ein hochwertiger Datensatz mit deutschsprachigen Frage-Antwort-Paaren von DeepSeek und ChatGPT-5 für das Training und Fine-Tuning von Sprachmodellen. ## Übersicht Dieser Datensatz enthält hochqualitative deutschsprachige Konversationsdaten, die aus den KI-Assistenten DeepSeek und ChatGPT-5 generiert wurden. Er eignet sich besonders zum Fine-Tuning von Sprachmodellen im deutschen Sprachraum und für die Entwicklung von Chat-Anwendungen. ## Datensatzstruktur Der Datensatz folgt einem einfachen, strukturierten Format: ``` <user> [Benutzer-Prompt] <End> <AI Assistant> [KI-Antwort] <End> ``` Jedes Frage-Antwort-Paar befindet sich auf einer neuen Zeile. Dieses Format ermöglicht einfache Verarbeitung und ist kompatibel mit standardmäßigen Trainings-Pipelines. ## Verwendungsbeispiel ```python from datasets import load_dataset # Datensatz laden dataset = load_dataset("Atomic-Ai/GPT-Deepseek-German") # Inspizieren print(dataset) print(dataset['train'][0]) ``` ## Datenquellen - **DeepSeek**: KI-generierte deutschsprachige Responses - **ChatGPT-5**: Hochqualitative deutschsprachige Responses ## Verwendungszwecke - Fine-Tuning von Sprachmodellen für deutsche Chat-Anwendungen - Training von Custom-Modellen für spezifische Domains - Erstellung von Conversational AI-Systemen - Evaluation von deutschsprachigen LLMs ## Größe - **Größenkategorie**: 10.000 - 100.000 Einträge - **Sprache**: Deutsch - **Format**: Text (UTF-8) ## Lizenz MIT License - Frei verwendbar für kommerzielle und private Projekte ## Zitierung ```bibtex @dataset{atomic_ai_gpt_deepseek_german, title={GPT-Deepseek-German QA Dataset}, author={Atomic-AI}, year={2024}, publisher={Hugging Face} } ``` ## Hinweise zur Verwendung - Das Datensatzformat ist optimiert für einfaches Parsing und Tokenization - Empfohlen für Modelle ab 7B Parametern - Geeignet für ChatML- oder Custom-Format-Konvertierungen - Kann für Instruction-Tuning und Conversation-Fine-Tuning verwendet werden ## Lizenzinformationen Dieser Datensatz steht unter der MIT-Lizenz und kann frei für kommerzielle und private Zwecke verwendet werden.

--- 许可证:MIT协议 任务类别: - 文本生成 - 问答 语言: - 德语 标签: - DeepSeek - GPT - 问答 - 德语 - 对话 规模类别: - 10K<n<100K --- # GPT-Deepseek-German 问答数据集 本数据集为高质量德语问答配对数据集,由DeepSeek与ChatGPT-5生成,适用于语言模型的训练与微调。 ## 概述 本数据集包含由DeepSeek与ChatGPT-5这两款AI助手生成的高质量德语对话数据,尤其适用于德语区语言模型的微调以及聊天应用的开发。 ## 数据集结构 本数据集采用简洁结构化格式: <user> [用户提示] <End> <AI Assistant> [AI回复] <End> 每条问答配对均单独占一行。该格式便于快速处理,且兼容标准训练流水线。 ## 使用示例 python from datasets import load_dataset # 加载数据集 dataset = load_dataset("Atomic-Ai/GPT-Deepseek-German") # 查看数据集信息 print(dataset) print(dataset["train"][0]) ## 数据来源 - **DeepSeek**:AI生成的德语回复 - **ChatGPT-5**:高质量德语回复 ## 应用场景 - 面向德语聊天应用的语言模型微调 - 针对特定领域的自定义模型训练 - 对话式AI系统的构建 - 德语大语言模型(LLM)的评估 ## 规模信息 - **规模类别**:10000至100000条数据 - **语言**:德语 - **格式**:文本(UTF-8编码) ## 许可证 MIT协议——可自由用于商业与非商业项目。 ## 引用 bibtex @dataset{atomic_ai_gpt_deepseek_german, title={GPT-Deepseek-German QA Dataset}, author={Atomic-AI}, year={2024}, publisher={Hugging Face} } ## 使用注意事项 - 本数据集格式经过优化,便于解析与Token化处理 - 推荐用于参数规模不低于7B的模型 - 适用于ChatML格式或自定义格式的转换 - 可用于指令微调与对话微调 ## 许可证信息 本数据集采用MIT许可证,可自由用于商业与非商业用途。

提供机构:
Atomic-Ai
二维码
社区交流群
二维码
科研交流群
商业服务