OrionLLM/OpenMixedReasoning
收藏资源简介:
--- license: apache-2.0 tags: - biology - medical - code - agent size_categories: - 100K<n<1M ---  # OpenMixedReasoning **OpenMixedReasoning** is a large synthetic reasoning dataset for **general reasoning tasks**, containing **~607k examples**. It is designed for **supervised fine-tuning (SFT)** and focuses heavily on reasoning-rich data across multiple domains. ## Dataset Composition OpenMixedReasoning is composed of the following domains: - **93.5% Code** - **3.3% Medical** - **3.2% Math** This distribution makes the dataset especially useful for training models that need strong **code reasoning**, while still benefiting from additional **medical** and **mathematical** reasoning capabilities. ## Source Datasets OpenMixedReasoning is a merged dataset built from the following sources: - [OrionLLM/OpenMedicalReasoning](https://huggingface.co/datasets/OrionLLM/OpenMedicalReasoning) - [nvidia/OpenCodeReasoning](https://huggingface.co/datasets/nvidia/OpenCodeReasoning) - [unsloth/OpenMathReasoning-mini](https://huggingface.co/datasets/unsloth/OpenMathReasoning-mini) --- OpenMixedReasoning is intended as a practical mixed-domain reasoning dataset for researchers and builders working on compact and capable reasoning models.



