登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
医疗数据清洗
医疗数据清洗
收藏
杭州数据交易所
2026-08-04 更新
2026-06-18 收录
数据预处理
患者隐私保护
数据链接:
https://mall.hzdex.cn/data-exchange/110600100191068?from=/data-exchange
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
医疗数据清洗有利于提高数据质量,确保一致性,增强数据的可用性和保护患者隐私
应用场景:
提供机构:
国盛君安(杭州)医疗科技有限公司
创建时间:
2026-08-04
搜集汇总
数据集介绍
背景与挑战
背景概述
该数据集专注于医疗数据的清洗处理,旨在通过提升数据质量、确保数据一致性,增强数据的可用性,并有效保护患者隐私。
以上内容由遇见数据集搜集并总结生成
相关数据集
ammarnasr/the-stack-rust-clean
编程语言
数据预处理
该数据集是从TheStack Corpus中提取的,专门针对Rust编程语言进行了优化。数据集包含了训练、验证和测试三个部分,分别有900,000、50,000和50,000个文件。预处理步骤包括选择Rust作为目标语言,过滤掉不符合条件的文件,并将文件按比例分割为训练、验证和测试集。数据集的Tokenizer使用了Byte Pair Encoding (BPE),并扩展了GPT-2的词汇表。训练
Hugging Face
2023-08-14 更新
61
0
📊 Synthetic TelCo Messy Dataset Churn Prediction
电信客户流失
数据预处理
Synthetic TelCo Dataset for Churn Prediction (Messy Real-World Format)
kaggle
2025-06-14 更新
16
0
South Creek Floodplain Risk Management Study and Plan - Pre-processed Results
洪泛区风险管理
数据预处理
South Creek Floodplain Risk Management Study and Plan - Pre-processed Results
Research Data Australia
11
0
anon8231489123/ShareGPT_Vicuna_unfiltered
数据预处理
共享经济
该数据集来源于ShareGPT对话,经过筛选后保留了约53k条英文对话。清理过程包括移除非英文对话、过多的Unicode字符、重复字符以及包含特定道德化短语的对话。数据集提供了两个版本:一个移除了包含Im sorry, but的对话,另一个保留了这些对话。数据集已准备好用于训练未经过滤的Vicuna模型。
Hugging Face
2023-04-12 更新
53
0
hpprc/wikipedia-20240101
Wikipedia
数据预处理
该数据集是通过`apache_beam`和`mwparserfromhell`对常规Wikipedia数据进行预处理后生成的,目的是为了减少本家预处理时间。数据集包含id、url、title和text四个特征,语言为日语,遵循cc-by-sa-3.0许可证。
Hugging Face
2024-01-22 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广