遇见数据集

Witness-Data-Factory/cardiology-1k

收藏
Hugging Face2026-03-27 更新2026-03-29 收录
官方服务:

资源简介:

WITNESS DATA Factory provides synthetic, regulatory‑grade medical text datasets so clinical AI teams can develop and validate models without touching real patient data. Each corpus is generated by a multi‑model medical LLM ensemble, gated by strict consensus and schema versioning, and designed to plug directly into enterprise model governance and documentation workflows. We focus on multi‑domain healthcare (including oncology, cardiology, neurology, endocrinology, radiology, pathology, surgical, pharmacology, and rare disease) to support robust evaluation across diverse clinical scenarios. --- license: cc-by-4.0 task_categories: - text-classification - token-classification - question-answering language: - en tags: - medical - healthcare - synthetic-data - nlp - cardiology - clinical-ai - hipaa-compliant - medical-nlp - healthcare-ai - electronic-health-records - labeled-data pretty_name: Cardiology Medical Dataset (1K Free Sample) size_categories: - 1K<n<10K --- # 9-domain synthetic medical catalog: oncology, cardiology, neurology, endocrinology, radiology, pathology, surgical, pharmacology, rare disease. --- # Cardiology Medical Dataset — 1,000 Record Free Sample > **Enterprise-grade synthetic medical data. Zero PHI. 100% HIPAA-compliant.** [![License: CC BY 4.0](https://img.shields.io/badge/License-CC_BY_4.0-lightgrey.svg)](https://creativecommons.org/licenses/by/4.0/) --- ## 📊 Quality Metrics | Metric | Score | Industry Benchmark | |--------|-------|--------------------| | **Trinity Consensus Score** | 98.0% | 85–92% typical | | **Inter-Annotator Agreement** | 0.97 | 0.75–0.85 typical | | **Macro F1** | 0.97 | 0.80–0.90 typical | | **PHI Present** | None | — | | **Generation Method** | 3-LLM Ensemble | Single model typical | --- ## 🚀 What's Included (Free) - **1,000 clinically-structured synthetic cardiology records** - Full label taxonomy with confidence scores per record - Consensus scores per record (filter by your own threshold) - Structured Parquet format (load with 🤗 `datasets` in one line) - Zero PHI — safe for unrestricted research and commercial use --- ## ⚡ Quick Start ```python from datasets import load_dataset # Load free 1K sample ds = load_dataset("Witness-Data-Factory/cardiology-1k", split="train") print(ds[0]) # Filter by quality gate high_quality = ds.filter(lambda x: x["consensus_score"] >= 0.97) print(f"Records passing 97% gate: {len(high_quality)}") # Export to pandas df = ds.to_pandas() df.to_csv("cardiology_sample.csv", index=False) ``` --- ## 🗂 Dataset Schema ```json { "record_id": "uuid-v4", "domain": "cardiology", "category": "Specific clinical subcategory", "note_type": "Clinical note type", "patient_age": 42, "patient_gender": "Female", "primary_label": "diagnosis", "labels": { "primary": "diagnosis", "category": "Subcategory name", "confidence": 0.972 }, "consensus_score": 0.972, "inter_annotator_agreement": 0.941, "macro_f1": 0.963, "model_scores": { "llama3.3": 0.975, "mistral": 0.968, "qwen2.5": 0.972 }, "passes_quality_gate": true, "generation_method": "Trinity_Ensemble_v2", "phi_present": false, "hipaa_compliant": true } ``` --- ## 💰 Upgrade to Production Scale This 1K sample is your **proof-of-concept dataset**. When you're ready to train production models: | Tier | Records | Price | Per-Record | Best For | Buy | |------|---------|-------|------------|----------|-----| | **Starter** | 10,000 | **$1,999** | $0.20 | Pilot deployment, MVP | [Buy Now →](https://witness-data-factory.onrender.com/pay/cardiology-10k) | | **Production** | 50,000 | **$7,999** | $0.16 | Model training, Series C+ | [Buy Now →](https://witness-data-factory.onrender.com/pay/cardiology-50k) | | **Enterprise** | 250,000 | **$29,999** | $0.12 | FDA-track, clinical AI | [Buy Now →](https://witness-data-factory.onrender.com/pay/cardiology-250k) | | **Strategic** | 1,000,000 | **$99,999** | $0.10 | Multi-year partnerships | [Contact Sales →](mailto:sales@witness-data.ai) | ### 🎁 Multi-Domain Bundles | Bundle | Contents | Price | Discount | |--------|----------|-------|---------| | **3-Domain Bundle** | 50K × 3 domains of choice | **$19,999** | 17% off | | **Complete Collection** | 50K × all 8 specialties | **$49,999** | 22% off | [View All Bundles →](https://witness-data-factory.onrender.com/pay/complete-collection-8x50k) > **Delivery:** Instant checkout → Full dataset delivered within 24 hours. --- ## 🏥 Why WITNESS DATA FACTORY? ### Speed Your research timeline shouldn't wait 3–6 months for custom data generation. Production datasets delivered in **under 24 hours** from purchase. ### Quality - **98.0% consensus** vs. 85–92% industry standard - 3-LLM ensemble eliminates single-model hallucination bias - Every record validated through Trinity quality gates before delivery ### Scale - Proven on **100M+ record PostgreSQL infrastructure** - Billion-record architecture ready for enterprise contracts - Multi-domain coverage: Oncology, Cardiology, Rare Disease, Mental Health, Pediatrics, Radiology, Pathology, Emergency Medicine ### Compliance - **Zero PHI** — 100% synthetic, no de-identification liability - HIPAA-compliant by architecture - CC BY 4.0 license — commercial use permitted --- ## 📚 Citation ```bibtex @dataset{witness_data_factory_cardiology_2026, title = {Cardiology Synthetic Medical Dataset}, author = {WITNESS DATA FACTORY}, year = {2026}, publisher = {HuggingFace}, url = {https://huggingface.co/datasets/Witness-Data-Factory/cardiology-1k} } ``` --- ## 🤝 Contact | Channel | Address | |---------|---------| | Sales & Licensing | [sales@witness-data.ai](mailto:sales@witness-data.ai) | | Technical Support | [support@witness-data.ai](mailto:support@witness-data.ai) | | All Datasets | [huggingface.co/Witness-Data-Factory](https://huggingface.co/Witness-Data-Factory) | --- *Powered by **WITNESS DATA FACTORY** — Medical AI Data Labeling at Scale*

威世数据工厂(WITNESS DATA Factory)提供合规级别的合成医疗文本数据集,使得临床AI团队无需接触真实患者数据即可开发并验证模型。每个数据集均由多模型医疗大语言模型(Large Language Model,LLM)集群生成,通过严格的共识机制与架构版本控制进行管控,可直接接入企业级模型治理与文档工作流。我们聚焦多领域医疗场景(涵盖肿瘤学、心脏病学、神经病学、内分泌学、放射学、病理学、外科学、药理学与罕见病领域),以支持在多样化临床场景下开展可靠的模型评估。 --- 许可证:CC BY 4.0 任务类别: - 文本分类 - Token分类(Token) - 问答 语言: - 英语 标签: - 医疗 - 医疗健康 - 合成数据(synthetic-data) - 自然语言处理(Natural Language Processing,NLP) - 心脏病学 - 临床AI - 符合HIPAA(健康保险流通与责任法案,Health Insurance Portability and Accountability Act)标准 - 医疗自然语言处理 - 医疗AI - 电子健康档案(Electronic Health Records,EHR) - 带标注数据 友好名称:心脏病学医疗数据集(1K免费样本) 数据规模类别: - 1K<n<10K --- # 9领域合成医疗数据集目录:肿瘤学、心脏病学、神经病学、内分泌学、放射学、病理学、外科学、药理学与罕见病。 --- # 心脏病学医疗数据集——1000条记录免费样本 > **企业级合成医疗数据。无任何受保护健康信息(Protected Health Information,PHI)。100%符合HIPAA标准。** [![License: CC BY 4.0]("https://img.shields.io/badge/License-CC_BY_4.0-lightgrey.svg")]("https://creativecommons.org/licenses/by/4.0/") --- ## 📊 质量指标 | 指标 | 得分 | 行业基准 | |--------|-------|--------------------| | **三位一体共识得分(Trinity Consensus Score)** | 98.0% | 行业典型值为85–92% | | **标注者间一致性(Inter-Annotator Agreement)** | 0.97 | 行业典型值为0.75–0.85 | | **宏平均F1值(Macro F1)** | 0.97 | 行业典型值为0.80–0.90 | | **存在受保护健康信息** | 无 | — | | **生成方式** | 3个大语言模型集群 | 行业典型为单模型生成 | --- ## ⚡ 免费内容一览 - **1000条临床结构化合成心脏病学记录** - 每条记录附带完整的标注分类体系与置信度得分 - 每条记录附带共识得分(可按自定义阈值进行筛选) - 采用结构化Parquet格式(可通过🤗 `datasets` 库一行代码加载) - 无任何受保护健康信息,可安全用于无限制的研究与商业用途 --- ## ⚡ 快速上手 python from datasets import load_dataset # 加载免费1K样本数据集 ds = load_dataset("Witness-Data-Factory/cardiology-1k", split="train") print(ds[0]) # 按质量门槛筛选 high_quality = ds.filter(lambda x: x["consensus_score"] >= 0.97) print(f"通过97%质量门槛的记录数: {len(high_quality)}") # 导出为pandas格式 df = ds.to_pandas() df.to_csv("cardiology_sample.csv", index=False) --- ## 🗂 数据集架构 json { "record_id": "uuid-v4", "domain": "cardiology", "category": "具体临床子类别", "note_type": "临床记录类型", "patient_age": 42, "patient_gender": "Female", "primary_label": "诊断", "labels": { "primary": "诊断", "category": "子类别名称", "confidence": 0.972 }, "consensus_score": 0.972, "inter_annotator_agreement": 0.941, "macro_f1": 0.963, "model_scores": { "llama3.3": 0.975, "mistral": 0.968, "qwen2.5": 0.972 }, "passes_quality_gate": true, "generation_method": "Trinity_Ensemble_v2", "phi_present": false, "hipaa_compliant": true } --- ## 💰 升级至生产级规模 本1000条样本为**概念验证数据集**。当您准备就绪以训练生产级模型时: | 套餐级别 | 记录数量 | 价格 | 单条记录成本 | 适用场景 | 购买链接 | |------|---------|-------|------------|----------|-----| | **入门级** | 10,000 | **$1,999** | $0.20 | 试点部署、最小可行产品(MVP) | [立即购买 →]("https://witness-data-factory.onrender.com/pay/cardiology-10k") | | **生产级** | 50,000 | **$7,999** | $0.16 | 模型训练、C轮及以上融资项目 | [立即购买 →]("https://witness-data-factory.onrender.com/pay/cardiology-50k") | | **企业级** | 250,000 | **$29,999** | $0.12 | 符合FDA监管流程的临床AI项目 | [立即购买 →]("https://witness-data-factory.onrender.com/pay/cardiology-250k") | | **战略级** | 1,000,000 | **$99,999** | $0.10 | 多年期合作项目 | [联系销售 →]("mailto:sales@witness-data.ai") | ### 🎁 多领域捆绑套餐 | 套餐 | 包含内容 | 价格 | 折扣力度 | |--------|----------|-------|---------| | **3领域套餐** | 自选3个领域,每个领域5万条记录 | **$19,999** | 享17%折扣 | | **全品类合集** | 8个专科领域各5万条记录 | **$49,999** | 享22%折扣 | [查看全部捆绑套餐 →]("https://witness-data-factory.onrender.com/pay/complete-collection-8x50k") > **交付方式**:结账完成后,完整数据集将在24小时内交付。 --- ## 🏥 为何选择威世数据工厂? ### 交付速度 您的研究进度不应因自定义数据生成而等待3–6个月。 生产级数据集可在**购买后24小时内**完成交付。 ### 数据质量 - **98.0%的共识得分**,远超行业85–92%的平均水平 - 采用3个大语言模型集群生成,可消除单模型产生的幻觉偏差 - 所有记录在交付前均通过三位一体质量门槛验证 ### 可扩展能力 - 已在**超1亿条记录的PostgreSQL基础设施**上验证可行 - 支持十亿级记录的架构,可满足企业级合同需求 - 覆盖多领域:肿瘤学、心脏病学、罕见病、精神卫生、儿科、放射学、病理学、急诊医学 ### 合规保障 - **无任何受保护健康信息**——100%合成数据,无需承担去标识化责任 - 架构设计符合HIPAA标准 - 采用CC BY 4.0许可证,允许商业使用 --- ## 📚 引用格式 bibtex @dataset{witness_data_factory_cardiology_2026, title = {心脏病学合成医疗数据集}, author = {威世数据工厂}, year = {2026}, publisher = {HuggingFace}, url = {"https://huggingface.co/datasets/Witness-Data-Factory/cardiology-1k"} } --- ## 🤝 联系方式 | 渠道 | 联系方式 | |---------|---------| | 销售与许可咨询 | [sales@witness-data.ai]("mailto:sales@witness-data.ai") | | 技术支持 | [support@witness-data.ai]("mailto:support@witness-data.ai") | | 全部数据集 | [huggingface.co/Witness-Data-Factory]("https://huggingface.co/Witness-Data-Factory") | --- *由威世数据工厂(WITNESS DATA Factory)提供技术支持 — 规模化医疗AI数据标注服务*

提供机构:
Witness-Data-Factory
二维码
社区交流群
二维码
科研交流群
商业服务