遇见数据集

Witness-Data-Factory/rare_disease-1k

收藏
Hugging Face2026-03-27 更新2026-03-29 收录
官方服务:

资源简介:

WITNESS DATA Factory provides synthetic, regulatory‑grade medical text datasets so clinical AI teams can develop and validate models without touching real patient data. Each corpus is generated by a multi‑model medical LLM ensemble, gated by strict consensus and schema versioning, and designed to plug directly into enterprise model governance and documentation workflows. We focus on multi‑domain healthcare (including oncology, cardiology, neurology, endocrinology, radiology, pathology, surgical, pharmacology, and rare disease) to support robust evaluation across diverse clinical scenarios. --- license: cc-by-4.0 task_categories: - text-classification - token-classification - question-answering language: - en tags: - medical - healthcare - synthetic-data - nlp - rare_disease - clinical-ai - hipaa-compliant - medical-nlp - healthcare-ai - electronic-health-records - labeled-data pretty_name: Rare Disease Medical Dataset (1K Free Sample) size_categories: - 1K<n<10K --- # 9-domain synthetic medical catalog: oncology, cardiology, neurology, endocrinology, radiology, pathology, surgical, pharmacology, rare disease. --- # Rare Disease Medical Dataset — 1,000 Record Free Sample > **Enterprise-grade synthetic medical data. Zero PHI. 100% HIPAA-compliant.** [![License: CC BY 4.0](https://img.shields.io/badge/License-CC_BY_4.0-lightgrey.svg)](https://creativecommons.org/licenses/by/4.0/) --- ## 📊 Quality Metrics | Metric | Score | Industry Benchmark | |--------|-------|--------------------| | **Trinity Consensus Score** | 98.0% | 85–92% typical | | **Inter-Annotator Agreement** | 0.97 | 0.75–0.85 typical | | **Macro F1** | 0.97 | 0.80–0.90 typical | | **PHI Present** | None | — | | **Generation Method** | 3-LLM Ensemble | Single model typical | --- ## 🚀 What's Included (Free) - **1,000 clinically-structured synthetic rare disease records** - Full label taxonomy with confidence scores per record - Consensus scores per record (filter by your own threshold) - Structured Parquet format (load with 🤗 `datasets` in one line) - Zero PHI — safe for unrestricted research and commercial use --- ## ⚡ Quick Start ```python from datasets import load_dataset # Load free 1K sample ds = load_dataset("Witness-Data-Factory/rare_disease-1k", split="train") print(ds[0]) # Filter by quality gate high_quality = ds.filter(lambda x: x["consensus_score"] >= 0.97) print(f"Records passing 97% gate: {len(high_quality)}") # Export to pandas df = ds.to_pandas() df.to_csv("rare_disease_sample.csv", index=False) ``` --- ## 🗂 Dataset Schema ```json { "record_id": "uuid-v4", "domain": "rare_disease", "category": "Specific clinical subcategory", "note_type": "Clinical note type", "patient_age": 42, "patient_gender": "Female", "primary_label": "diagnosis", "labels": { "primary": "diagnosis", "category": "Subcategory name", "confidence": 0.972 }, "consensus_score": 0.972, "inter_annotator_agreement": 0.941, "macro_f1": 0.963, "model_scores": { "llama3.3": 0.975, "mistral": 0.968, "qwen2.5": 0.972 }, "passes_quality_gate": true, "generation_method": "Trinity_Ensemble_v2", "phi_present": false, "hipaa_compliant": true } ``` --- ## 💰 Upgrade to Production Scale This 1K sample is your **proof-of-concept dataset**. When you're ready to train production models: | Tier | Records | Price | Per-Record | Best For | Buy | |------|---------|-------|------------|----------|-----| | **Starter** | 10,000 | **$1,999** | $0.20 | Pilot deployment, MVP | [Buy Now →](https://witness-data-factory.onrender.com/pay/rare_disease-10k) | | **Production** | 50,000 | **$7,999** | $0.16 | Model training, Series C+ | [Buy Now →](https://witness-data-factory.onrender.com/pay/rare_disease-50k) | | **Enterprise** | 250,000 | **$29,999** | $0.12 | FDA-track, clinical AI | [Buy Now →](https://witness-data-factory.onrender.com/pay/rare_disease-250k) | | **Strategic** | 1,000,000 | **$99,999** | $0.10 | Multi-year partnerships | [Contact Sales →](mailto:sales@witness-data.ai) | ### 🎁 Multi-Domain Bundles | Bundle | Contents | Price | Discount | |--------|----------|-------|---------| | **3-Domain Bundle** | 50K × 3 domains of choice | **$19,999** | 17% off | | **Complete Collection** | 50K × all 8 specialties | **$49,999** | 22% off | [View All Bundles →](https://witness-data-factory.onrender.com/pay/complete-collection-8x50k) > **Delivery:** Instant checkout → Full dataset delivered within 24 hours. --- ## 🏥 Why WITNESS DATA FACTORY? ### Speed Your research timeline shouldn't wait 3–6 months for custom data generation. Production datasets delivered in **under 24 hours** from purchase. ### Quality - **98.0% consensus** vs. 85–92% industry standard - 3-LLM ensemble eliminates single-model hallucination bias - Every record validated through Trinity quality gates before delivery ### Scale - Proven on **100M+ record PostgreSQL infrastructure** - Billion-record architecture ready for enterprise contracts - Multi-domain coverage: Oncology, Cardiology, Rare Disease, Mental Health, Pediatrics, Radiology, Pathology, Emergency Medicine ### Compliance - **Zero PHI** — 100% synthetic, no de-identification liability - HIPAA-compliant by architecture - CC BY 4.0 license — commercial use permitted --- ## 📚 Citation ```bibtex @dataset{witness_data_factory_rare_disease_2026, title = {Rare Disease Synthetic Medical Dataset}, author = {WITNESS DATA FACTORY}, year = {2026}, publisher = {HuggingFace}, url = {https://huggingface.co/datasets/Witness-Data-Factory/rare_disease-1k} } ``` --- ## 🤝 Contact | Channel | Address | |---------|---------| | Sales & Licensing | [sales@witness-data.ai](mailto:sales@witness-data.ai) | | Technical Support | [support@witness-data.ai](mailto:support@witness-data.ai) | | All Datasets | [huggingface.co/Witness-Data-Factory](https://huggingface.co/Witness-Data-Factory) | --- *Powered by **WITNESS DATA FACTORY** — Medical AI Data Labeling at Scale*

WITNESS DATA Factory 提供符合监管标准的合成医学文本数据集,使临床AI团队无需接触真实患者数据即可开发与验证模型。所有语料库均由多模型医学大语言模型(LLM)集群生成,经过严格的共识校验与模式版本控制,可直接接入企业级模型治理与文档工作流。我们聚焦多领域医疗场景(涵盖肿瘤学、心脏病学、神经病学、内分泌学、放射学、病理学、外科学、药理学与罕见病),以支持在多样化临床情境下开展可靠的模型评估。 --- 许可证:CC-BY-4.0 任务类别: - 文本分类 - Token分类 - 问答任务 语言: - 英语 标签: - 医疗 - 医疗健康 - 合成数据 - 自然语言处理(Natural Language Processing,NLP) - 罕见病 - 临床AI - 符合HIPAA(健康保险流通与责任法案)标准 - 医疗自然语言处理 - 医疗AI - 电子健康档案(Electronic Health Records,EHR) - 带标签数据 展示名称:罕见病医疗数据集(1K免费样本) 样本量范围:1000~10000条 --- # 9个领域合成医疗数据集目录:肿瘤学、心脏病学、神经病学、内分泌学、放射学、病理学、外科学、药理学、罕见病 --- # 罕见病医疗数据集——1000条记录免费样本 > **企业级合成医疗数据。无受保护健康信息(Protected Health Information,PHI)。100%符合HIPAA标准。** [![License: CC BY 4.0](https://img.shields.io/badge/License-CC_BY_4.0-lightgrey.svg)](https://creativecommons.org/licenses/by/4.0/) --- ## 📊 质量指标 | 指标 | 得分 | 行业基准 | |--------|-------|--------------------| | **三位一体共识得分(Trinity Consensus Score)** | 98.0% | 行业常规为85–92% | | **标注者间一致性(Inter-Annotator Agreement)** | 0.97 | 行业常规为0.75–0.85 | | **宏F1值(Macro F1)** | 0.97 | 行业常规为0.80–0.90 | | **含受保护健康信息(PHI)** | 无 | — | | **生成方式** | 3个大语言模型(LLM)集群 | 行业常规为单模型 | --- ## 🚀 免费内容 - **1000条临床结构化合成罕见病记录** - 每条记录均附带完整标签分类体系与置信度得分 - 每条记录均包含共识得分(可按自定义阈值筛选) - 采用结构化Parquet列存格式,可通过🤗 `datasets` 库一键加载 - 无任何受保护健康信息(PHI),可安全用于不限范围的研究与商业用途 --- ## ⚡ 快速上手 python from datasets import load_dataset # 加载免费1K样本 ds = load_dataset("Witness-Data-Factory/rare_disease-1k", split="train") print(ds[0]) # 按质量门槛筛选 high_quality = ds.filter(lambda x: x["consensus_score"] >= 0.97) print(f"通过97%质量门槛的记录数: {len(high_quality)}") # 导出为Pandas数据框 df = ds.to_pandas() df.to_csv("rare_disease_sample.csv", index=False) --- ## 🗂 数据集架构 json { "record_id": "uuid-v4", "domain": "rare_disease", "category": "Specific clinical subcategory", "note_type": "Clinical note type", "patient_age": 42, "patient_gender": "Female", "primary_label": "diagnosis", "labels": { "primary": "diagnosis", "category": "Subcategory name", "confidence": 0.972 }, "consensus_score": 0.972, "inter_annotator_agreement": 0.941, "macro_f1": 0.963, "model_scores": { "llama3.3": 0.975, "mistral": 0.968, "qwen2.5": 0.972 }, "passes_quality_gate": true, "generation_method": "Trinity_Ensemble_v2", "phi_present": false, "hipaa_compliant": true } --- ## 💰 升级至生产级规模 本1K样本仅作为概念验证数据集。当您准备好训练生产模型时: | 套餐级别 | 记录数 | 价格 | 单条记录成本 | 适用场景 | 购买链接 | |------|---------|-------|------------|----------|-----| | **入门级** | 10,000 | **$1,999** | $0.20 | 试点部署、最小可行产品(MVP) | [立即购买 →](https://witness-data-factory.onrender.com/pay/rare_disease-10k) | | **生产级** | 50,000 | **$7,999** | $0.16 | 模型训练、C轮及以上融资阶段企业 | [立即购买 →](https://witness-data-factory.onrender.com/pay/rare_disease-50k) | | **企业级** | 250,000 | **$29,999** | $0.12 | 接受美国食品药品监督管理局(FDA)监管追踪的临床AI项目 | [立即购买 →](https://witness-data-factory.onrender.com/pay/rare_disease-250k) | | **战略级** | 1,000,000 | **$99,999** | $0.10 | 多年期合作项目 | [联系销售 →](mailto:sales@witness-data.ai) | ### 🎁 多领域捆绑套餐 | 套餐 | 内容 | 价格 | 折扣 | |--------|----------|-------|---------| | **3领域套餐** | 自选3个领域,每个领域5万条记录 | **$19,999** | 享17%优惠 | | **完整合集** | 8个专科领域各5万条记录 | **$49,999** | 享22%优惠 | [查看全部捆绑套餐 →](https://witness-data-factory.onrender.com/pay/complete-collection-8x50k) > **交付方式**:结账完成后,完整数据集将在24小时内交付。 --- ## 🏥 为何选择WITNESS DATA FACTORY? ### 交付速度 您的研究进度不应因自定义数据生成而等待3~6个月。购买的生产级数据集可在**24小时内**完成交付。 ### 数据质量 - **98.0%共识得分**,远超行业常规的85–92% - 采用3个大语言模型(LLM)集群,可消除单模型幻觉与偏差 - 每一条记录在交付前均通过三位一体质量门槛校验 ### 部署规模 - 已在**1亿条以上记录的PostgreSQL基础设施**上验证可行 - 支持十亿级记录的架构,可满足企业级合同需求 - 覆盖多领域医疗场景:肿瘤学、心脏病学、罕见病、精神卫生、儿科学、放射学、病理学、急诊医学 ### 合规性 - **无任何受保护健康信息(PHI)** —— 100%合成数据,无需承担去标识化责任 - 架构符合HIPAA(健康保险流通与责任法案)标准 - 采用CC BY 4.0许可证,允许商业使用 --- ## 📚 引用 bibtex @dataset{witness_data_factory_rare_disease_2026, title = {Rare Disease Synthetic Medical Dataset}, author = {WITNESS DATA FACTORY}, year = {2026}, publisher = {HuggingFace}, url = {https://huggingface.co/datasets/Witness-Data-Factory/rare_disease-1k} } --- ## 🤝 联系方式 | 渠道 | 联系方式 | |---------|---------| | 销售与许可咨询 | [sales@witness-data.ai](mailto:sales@witness-data.ai) | | 技术支持 | [support@witness-data.ai](mailto:support@witness-data.ai) | | 全部数据集 | [huggingface.co/Witness-Data-Factory](https://huggingface.co/Witness-Data-Factory) | --- *由**WITNESS DATA FACTORY**提供支持 — 大规模医疗AI数据标注服务*

提供机构:
Witness-Data-Factory
二维码
社区交流群
二维码
科研交流群
商业服务