Medical-Reasoning-SFT-Trinity-Mini
收藏资源简介:
# Medical-Reasoning-SFT-Trinity-Mini A large-scale medical reasoning dataset generated using [arcee-ai/Trinity-Mini](https://huggingface.co/arcee-ai/Trinity-Mini), containing over 810,000 samples with detailed chain-of-thought reasoning for medical and healthcare questions. ## Dataset Overview | Metric | Value | |--------|-------| | **Model** | arcee-ai/Trinity-Mini | | **Total Samples** | ~810,374 | | **Estimated Tokens** | ~1.52 Billion | | **Content Tokens** | ~542 Million | | **Reasoning Tokens** | ~977 Million | | **Language** | English | ## Schema Each sample follows the conversational messages format with reasoning content: ```json { "messages": [ { "role": "user", "content": "What are the symptoms of diabetes?", "reasoning_content": null }, { "role": "assistant", "content": "The main symptoms of diabetes include...", "reasoning_content": "Let me think through this systematically. Diabetes affects blood sugar regulation, so I should consider symptoms related to hyperglycemia..." } ] } ``` ### Fields | Field | Type | Description | |-------|------|-------------| | `messages` | list | Array of message objects in the conversation | | `messages[].role` | string | Either "user" or "assistant" | | `messages[].content` | string | The main message content | | `messages[].reasoning_content` | string or null | Chain-of-thought reasoning (assistant messages only) | ## Usage ### Loading with Datasets Library ```python from datasets import load_dataset dataset = load_dataset("OpenMed/Medical-Reasoning-SFT-Trinity-Mini") ``` ### Accessing Samples ```python # Get a sample sample = dataset['train'][0] # Access messages for msg in sample['messages']: print(f"Role: {msg['role']}") print(f"Content: {msg['content'][:100]}...") if msg['reasoning_content']: print(f"Reasoning: {msg['reasoning_content'][:100]}...") ``` ### Filtering by Reasoning ```python # Get samples with reasoning content samples_with_reasoning = dataset['train'].filter( lambda x: x['messages'][-1]['reasoning_content'] is not None ) ``` ## Intended Use This dataset is designed for: - **Fine-tuning medical reasoning models**: Train LLMs to provide detailed, step-by-step medical reasoning - **Chain-of-thought training**: Develop models that show their thinking process - **Medical QA systems**: Build question-answering systems for healthcare applications - **Research**: Study reasoning patterns in medical domain AI ## Limitations and Considerations - This dataset is generated by an AI model and should not be used as a substitute for professional medical advice - Responses may contain inaccuracies and should be validated by medical professionals - Not intended for clinical decision-making without expert review - The reasoning traces reflect the model's approach, not necessarily optimal clinical reasoning ## Citation If you use this dataset, please cite: ```bibtex @dataset{medical_reasoning_sft_trinity_mini, title={Medical-Reasoning-SFT-Trinity-Mini}, author={OpenMed}, year={2025}, publisher={Hugging Face}, url={https://huggingface.co/datasets/OpenMed/Medical-Reasoning-SFT-Trinity-Mini} } ``` ## License Apache 2.0



