遇见数据集

个人隐私保护和数据安全法规法律数据集

收藏
魔搭社区2026-07-08 更新2026-07-15 收录
官方服务:

资源简介:

license: MIT License language: - zh tags: - 个人隐私保护 - 隐私法规 - PEFT - 指令微调 ------ ## ❤️AI * 爱心计划 ### 🌄**我的故事** **"因为淋过雨,所以想为他人撑伞"** 我来自大山深处,和链接( https://mp.weixin.qq.com/s/1yPiETQs8DYk123ys6mH4A )里看到的这些孩子一样,少年时期也过得很艰苦。小学六年,每天往返12公里山路,风雨无阻,一走就是三个小时,冬天冻疮爬满手脚,夏天汗水浸透衣衫。那时候对知识充满渴望,如饥似渴的学习, 想改变自己的命运。很努力的学习,一直保持良好的成绩,努力考上省城的大学,后来到沿海一所很美的大学读研,再工作。所以文中这些孩子们的故事,感同身受,也颇有感触。 **每一个,都是曾经的我。** **每一个,都让我想起当年的自己。** 我很努力,也很幸运,**但还有太多孩子,卡在那条山路上,没能走到终点。** ### 💝 "回望"爱心计划 **”源自经历 · 归于初心“** 回望来路,不忘根本;伸手拉一把,让后来者少些坎坷。人到中年,早就褪去了年少轻狂和意气风发,多了些对世事沉浮的沧桑感悟,对越来越多的事物心怀感恩,充满敬畏。 收集,整理并维护每一个数据集十分的不易,需要时间,需要精力,更需要很多很多的资源。我们**不收费,不取财**,但希望得到你的爱心支援,我们会将其通过合适的途径送到真正需要的孩子手中,将每一份关怀送到最温暖的心房里。这将用于: - ✅ 那些贫而有志的学生 - ✅ 那些家境贫寒但是依然善良的孩子 人到中年,近年来,不管从身边的朋友,还是社交媒体上,越来越能感知到其实大部分人都很不容易,很艰辛。所以无论多少,都是心意;无论远近,都是温暖,我们不希望因此带来您生活的负担。 ### 🍎 **我们希望的来自您的爱心支持** - Plan A:8.88 RMB (支付宝 or 微信) - Plan B:6.68 RMB (支付宝 or 微信) 💡微信支付备用地址:https://gitee.com/zhaoyuqiang123/open-mind/raw/master/pay/weichat.png 📅支付宝备注地址: https://gitee.com/zhaoyuqiang123/open-mind/raw/master/pay/alipay.jpg <img src="https://modelscope.cn/datasets/yuqiang01/test-zyq/resolve/master/weichat.png" alt="微信支付" title="微信支付" width="200"> <img src="https://modelscope.cn/datasets/yuqiang01/test-zyq/resolve/master/alipay.jpg" alt="支付宝" title="支付宝" width="200"> ⏳ 因为我们设置了所有的数据集均为**申请下载**,所以你可以:🧭1) **每一次下载捐赠一次**,🧭2)**你也可以多次下载捐赠一次**。因为我们认为,这都是好的,也是可以的。可以在数据集申请下载中备注申请信息(“已捐献爱心”)! 🏷️ 当然在AI大爆发的黄金时代,我们相信,你一定是足够努力拥抱时代的勇敢者与先行者,我们向你致敬。**因此即使我们没有缘分收到你的爱心,我们依然觉得这也是可以的。因为合理,所以我们依然会在你申请后的最迟第4或者5天通过你的申请,你尽可以自由使用**,开始你的AI时代旅程和历程,我们祝福你! ### 💡 特别说明 人民币8.88或6.88元,远比日常的一杯奶茶,或者游戏里的一次充值,或者一次抖音的打赏少的多,不是吗?但是我们不想道德绑架,一切皆是志愿。但我们依然坚定的认为,每一次支持都弥足珍贵,也是为了公开透明,后续会在合适的时间与地方,陆续披露那些充满爱心的您和具体的情况(当然,我们会保护好隐私),所以不必有过多的担心。 请相信,爱是不会消失的,也是不会被绑架的,因为在**”天下熙熙,皆为利来;天下攘攘,皆为利往“**的当下,依然有那么一些人,内心澄澈,清明无畏。 当然,或者您会觉得,这太傻了,什么都改变不了,或者你也会觉得这是在骗人。但是我们相信,改变都是从一点点开始的,从不够买一杯奶茶的钱开始的,从匆忙慌乱的岁月里,有一两个傻傻的但是愿意认真的人开始的。所以,我们选择前行并认真。 # 🎒个人隐私保护法律法规知识专业数据集 ## 📌 数据集简介 本数据集基于个人隐私保护相关的**法律、法规、政策解读**等文件构建。数据经精细化加工与结构化处理,支持精准的知识问答。 ## 📊 数据规模 **数据规模** - **总数据量**:经清洗、去重与专家校验,**共计145条** 高质量知识条目。 | 维度 | 详情 | | ------------ | --------------------------------------- | | **数据总量** | 145条 | | **数据形态** | 指令微调数据(Instruction Fine-tuning) | | **数据格式** | JSONL(主文件)+ JSON(子集) | | **语言类型** | 中文 | | **适用模型** | LLaMA, ChatGLM, Qwen, InternLM 等 | | **数据质量** | 确保准确与逻辑严谨 | ## 📁 目录结构与文件说明 数据集采用模块化设计,适配不同训练与应用场景。 | 文件路径 | 描述 | 格式类型 | | ----------------------------------- | ------------------------------------------------------ | -------- | | **datasets.jsonl** | **全量数据主文件**,包含所有145条知识记录 | JSONL | | **data/alpaca.json** | 适配 Alpaca 格式 | JSON | | **data/sharegpt.json** | 适配sharegpt格式 | JSON | | **data/multilingual-thinking.json** | 双语思维链数据 | JSON | | **data/dataset_info.json** | 元数据文件,包含字段说明、版本信息、分类标签与统计摘要 | JSON | ## 🧩 数据格式与样例 **核心结构** 采用 `instruction`(指令)、`input`(输入)、`output`(输出) 三元组结构,部分条目扩展 `history`(历史脉络)与 `source`(出处)字段。 **数据样例** ```json {"instruction":"简述个人信息处理者处理个人信息的核心原则", "input":"", "output":"个人信息处理者处理个人信息需遵循《个人信息保护法》核心原则,具体要求如下:\n\n1. **合法、正当、必要、诚信原则**:处理行为必须符合法律规定,具有正当目的,限于实现目的所必需的最小范围,不得通过误导、欺诈等方式处理个人信息。\n\n2. **目的特定明确原则**:处理个人信息应当具有明确、合理的目的,并应当与处理目的直接相关。\n\n3. **公开透明原则**:应当公开个人信息处理规则,明示处理的目的、方式、范围。\n\n4. **质量保障原则**:应当保证个人信息的质量,避免因个人信息不准确、不完整对个人权益造成不利影响。\n\n**关键点**:\n- 处理个人信息一般需取得个人同意,法律、行政法规另有规定的除外。\n- 未经同意不得超出约定的处理目的、处理方式等处理个人信息。\n- 违反核心原则处理个人信息,将依法承担民事、行政乃至刑事责任。", "system":"" } ``` ## 📖 应用场景 - **智能普法**:开发隐私保护法规AI助教,支持法条讲解、合规疑问解答与学习路径推荐。 - **企业合规**:为互联网、科技、金融等机构提供员工隐私合规培训与咨询支撑。 - **公众科普**:面向普通民众提供个人隐私保护法律知识问答,提升维权意识。 - **合规咨询**:快速查询隐私保护相关法律、法规、政策条文,提升工作效率。 - **智能普法助手**:面向公众提供隐私法规自动问答、维权流程讲解、典型案例解读。 - **企业合规培训**:为互联网、金融、医疗、政务等行业提供隐私合规在线学习与考核。 - **产品合规审查**:辅助 APP、小程序、网站做隐私政策校验、权限合规自查。 - **数据合规机器人**:自动回答员工关于数据收集、存储、共享、删除、跨境传输的合规疑问。 - **个人维权指导**:为用户提供投诉渠道、证据固定、维权步骤、举报流程等法律指引。 - **高校 / 培训机构教学**:用于网络法、数据合规、信息安全等课程的题库与实训材料。 - **监管科技系统**:支撑监管机构对企业隐私合规进行智能巡检、风险识别与预警。 - **隐私政策生成 / 审核**:基于法规自动生成合规隐私政策,或检测现有条款是否违法违规。 ## 🛠️ 使用指南 **加载方式** - 全量训练:使用 datasets.jsonl 流式读取,适用于大规模预训练或隐私保护法规知识注入。 - 场景微调:选择 data/ 下对应格式文件,如 sharegpt.json 用于隐私保护对话模型微调。 **微调建议** - 问答模型:优先使用 alpaca.json,强化隐私保护法规知识准确性与结构化表达。 - 合规培训系统:结合 sharegpt.json 训练多轮对话能力,模拟法规咨询场景。 - 跨境合规:利用 multilingual-thinking.json 提升跨境数据隐私保护法规分析能力。 ## ⚖️ 免责声明 - **版权说明**:内容版权所有,本数据集仅用于AI模型训练与隐私保护法规教育研究,禁止商业用途。(商业用途参考数据集文件中的**数据集使用许可说明.md**) - **数据使用**:使用者需遵守个人信息保护、数据安全等相关法律法规,不得用于侵犯个人隐私的违规活动。 ------ 📬 **维护单位**:青秋画影实验室 📅 **最后更新**:2026年4月 📄 **许可证**:CC BY-NC 4.0(署名-非商业性使用) ------ *让人工智能更懂隐私保护,助力数字时代个人权益保障。*🔒 \```

提供机构:
maas
创建时间:
2026-04-18
二维码
社区交流群
二维码
科研交流群
商业服务