遇见数据集

ethos-training-data-v1

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

Ethos-32B Training Data v1是由SustainAI Global(德克萨斯州非营利组织,501(c)(3)待批)创建的公开训练数据集,专为Ethos-32B (ESI)模型设计。该数据集包含8,000至25,000个经过精心筛选的指令调优示例,涵盖可持续经济学、可再生能源、绿色金融、公正转型、伦理人工智能推理以及就业优先对齐等多个领域。所有数据均为合成生成,并在纳入前经过数据委员会审核批准。数据集采用结构化格式,每条记录包含id、messages、domain、source_model、generation_method、committee_approved和review_date等字段,详细信息将在schema.json文件中提供。该数据集的主要发布目的是提高模型训练的透明度和公共问责,允许公众查看Ethos模型的训练内容,但根据CC BY-NC-ND 4.0许可证,禁止商业用途和创建衍生数据集。数据集目前处于开发阶段,完整训练集和模式文件尚未发布,代表性样本将在ethos-transparency仓库中单独提供。

Ethos-32B Training Data v1 is a publicly available training dataset created by SustainAI Global (a Texas nonprofit, 501(c)(3) pending), designed for the Ethos-32B (ESI) model. It contains 8,000 to 25,000 carefully curated instruction-tuning examples across domains such as sustainable economics, renewable energy, green finance, just transition, ethical AI reasoning, and jobs-first alignment. All data is synthetically generated and reviewed and approved by a data committee before inclusion. The dataset is structured with fields including id, messages, domain, source_model, generation_method, committee_approved, and review_date, with detailed information provided in a schema.json file. The primary release aims to enhance transparency and public accountability in model training, allowing the public to see what the Ethos model is trained on, but under the CC BY-NC-ND 4.0 license, commercial use and creation of derivative datasets are prohibited. The dataset is currently in development, with the full training set and schema files not yet released; representative samples will be provided separately in the ethos-transparency repository.

创建时间:
2026-06-01
原始信息汇总

数据集概述:Ethos-32B Training Data v1

  • 发布机构:SustainAI Global(美国德克萨斯州非营利组织,501(c)(3)状态待批)
  • 数据集名称:Ethos-32B Training Data v1
  • 许可证:CC BY-NC-ND 4.0(仅用于透明度和公共问责,禁止商业用途和衍生作品)
  • 语言:英语
  • 标签:伦理AI、可持续经济学、绿色金融、指令微调、合成数据
  • 数据规模:10,000 < n < 100,000(目标规模为8,000至25,000个精选样本)

内容描述

该数据集是为训练 Ethos-32B(ESI) 模型而准备的公共指令微调语料库。样本为合成生成,并需经过数据委员会审核后方可纳入。覆盖领域包括:

  • 可持续经济学
  • 可再生能源
  • 绿色金融
  • 公正转型
  • 伦理AI推理
  • “就业优先”(Jobs First)对齐

文件结构

文件名 说明
train.jsonl 委员会批准的完整训练集(尚未发布)
schema.json 字段定义和来源规范(即将发布)

数据预览

约50至100个代表性样本将单独发布在 ethos-transparency/data/sample,但不替代完整数据集。

数据溯源

每条记录将包含以下字段:idmessagesdomainsource_modelgeneration_methodcommittee_approvedreview_date。详细定义待 schema.json 发布。

当前状态

数据集目前处于 进行中 状态,完整训练数据尚未公开。

联系方式

  • 邮箱:ai@sustainai.global
  • 官网:https://sustainai.global/
  • 透明度文档:https://github.com/SustainAI-Global/ethos-transparency
搜集汇总
数据集介绍
ethos-training-data-v1 数据集图片
构建方式
Ethos-Training-Data-v1是由SustainAI Global组织精心策划的指令微调语料库,专注于可持续经济学、可再生能源、绿色金融、公正转型、伦理AI推理及就业优先对齐等前沿领域。该数据集通过合成生成技术与人工审核相结合的方式构建:先利用先进语言模型生成候选样本,再经由专门的数据委员会逐一审查与批准,确保每条记录在内容准确性与伦理合规性上的双重保障。每个样本均包含id、messages、domain、source_model、generation_method、committee_approved及review_date等字段,并配有详细的schema.json文件以明晰数据谱系。
特点
该数据集的核心特点在于其高度的专业聚焦性与严格的质控流程。样本规模精心控制在8,000至25,000条之间,兼顾了模型训练的效率与知识覆盖的广度。所有数据均经过数据委员会的人工评审,保证了在可持续经济与伦理AI这一交叉学科中的专业深度与可靠性。数据集采用CC BY-NC-ND 4.0许可发布,仅用于透明性与公共问责目的,禁止商业复用或衍生数据集,彰显了项目对开源伦理与知识产权保护的审慎态度。
使用方法
使用者可通过HuggingFace平台获取该数据集的核心训练文件train.jsonl,以及用于字段定义的schema.json。数据集以JSONL格式提供,便于直接加载至常见深度学习框架中。在微调模型时,建议将数据集划分为训练集与验证集,并依据domain字段进行领域特定的调整。由于数据集规模适中,可高效用于对开源大语言模型进行可持续经济与伦理AI方向的指令微调。完整的样本预览与透明度文档可在SustainAI Global的GitHub仓库中查阅,以辅助数据理解与复现验证。
背景与挑战
背景概述
由得克萨斯州非营利组织SustainAI Global于2024年开发的ethos-training-data-v1数据集,旨在为Ethos-32B(ESI)模型提供指令微调训练数据。作为可持续经济学与伦理人工智能交叉领域的前沿资源,该数据集聚焦绿色金融、可再生能源、公正转型及就业优先对齐等核心研究议题,通过合成生成与数据委员会审核相结合的方式构建高质量实例。其影响力体现在推动AI系统在可持续发展和伦理决策中的可信应用,为负责任AI的透明度与可解释性树立了标杆。
当前挑战
该数据集应对的领域挑战是解决通用大语言模型在可持续经济学与伦理推理领域缺乏领域特异性知识且易产生偏差的问题,确保AI输出符合绿色金融与公正转型的规范。构建过程中面临四大挑战:一是合成数据需跨越可持续经济学、伦理推理等多元主题的复杂性与一致性;二是数据委员会审核机制需在专家资源有限下保证大规模实例的准确性与代表性;三是8,000至25,000条目标数量的质与量平衡;四是在CC BY-NC-ND 4.0许可证下平衡开放透明度与知识产权保护。
常用场景
经典使用场景
Ethos-32B Training Data v1 数据集的核心应用场景在于指导大型语言模型在可持续经济学、绿色金融、可再生能源与公正转型等前沿议题上的指令微调。该数据集通过人工审核的合成样本,为模型注入关于能源政策、碳金融机制及伦理AI推理的领域知识,使其能够准确理解并生成符合可持续发展目标的专业内容。其在训练中尤为注重与“就业优先”原则的协调,确保模型输出兼顾经济效率与社会公平,从而成为衔接ESG理念与人工智能技术的桥梁性资源。
实际应用
在实际产业层面,该数据集支撑的模型已应用于ESG报告自动分析、绿色投资组合风险预警及企业碳足迹诊断等场景。例如,金融机构可借助经此数据微调的模型,从非结构化的可持续发展报告中提取关键指标并生成合规建议;政策制定者则能利用其模拟不同碳税方案对区域就业结构的影响。此外,该数据集在可再生能源项目可行性评估中展现出潜力,能够整合技术参数、补贴政策与地理环境等多源信息,输出具备可操作性的决策辅助方案,显著降低跨领域协作的认知门槛。
衍生相关工作
围绕该数据集已衍生出多项具有影响力的学术与实践成果:其透明度文档仓库(ethos-transparency)开创了私有模型训练数据审计的先河,为AI治理研究提供了程序性标准;部分研究者基于其域标签体系,开发了针对绿色金融谣言的跨模态检测方法;另有团队借鉴其“委员会审核”的数据质量控制流程,构建了面向司法判决摘要的领域审核框架。该数据集所强调的合成数据伦理评估规范,还直接启发了关于气候声明生成中语言偏见的系统性研究,形成了从数据构建到应用验证的完整学术生态链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务