hermes-tool-use-rl-env
收藏资源简介:
Hermes Tool Use RL Env 是一个用于工具使用强化学习实验的非表格数据集仓库,专为 SakThai 家族实验设计。该仓库提供完整的强化学习环境,包括环境服务器(server/app.py、server/hermes_tool_env.py)、任务定义(tasks.py)、训练入口(train.py)、RL 客户端(client.py)、模型定义(models.py)、TRL 集成(trl_env.py)、数据集构建脚本(build_rl_dataset.py)以及实验产物(results/*.json)等共 15 个文件。数据集本身不包含结构化表格数据,因此无法通过传统的数据集查看器预览。用户可通过克隆仓库并运行相应脚本(如 python train.py)来使用该环境进行工具调用强化学习训练和评估。该数据集采用 CC BY 4.0 许可证,适用于研究和开发工具使用 RL 策略。
Hermes Tool Use RL Env is a non-tabular dataset repository for tool-use reinforcement learning experiments, designed specifically for the SakThai family experiments. The repository provides a complete reinforcement learning environment, including environment server, task definitions, training entry point, RL client, model definitions, TRL integration, dataset building scripts, and experiment artifacts, totaling 15 files. The dataset itself does not contain structured tabular data and therefore cannot be previewed through traditional dataset viewers. Users can clone the repository and run scripts (e.g., python train.py) to use this environment for tool-calling reinforcement learning training and evaluation. The dataset is licensed under CC BY 4.0, suitable for research and development of tool-use RL strategies.
Hermes Tool Use RL Env 数据集详情
数据集概述
Hermes Tool Use RL Env 是一个用于 SakThai 工具使用强化学习实验的非表格型(non-tabular)数据集仓库。该仓库包含环境服务器、任务定义、训练工具及实验产物,用于评估工具使用策略。由于不包含表格数据文件,因此无法通过 Hugging Face Datasets Server 查看器进行查询。
元数据信息
| 项目 | 详情 |
|---|---|
| 数据集 ID | Nanthasit/hermes-tool-use-rl-env |
| 许可证 | CC BY 4.0 |
| 大小类别 | n<1K |
| 任务类别 | 强化学习 / 工具使用 |
| 下载次数 | 68 |
| 点赞数 | 0 |
| 最后修改时间 | 2026-08-01 09:55:02+00:00 |
| 修订版本 SHA | 519752055e9e59ab9f7c6ffb56408ba50bc085c8 |
| 文件数量 | 15 |
仓库内容
- 服务器端:
server/app.py,server/Dockerfile,server/hermes_tool_env.py - 训练与强化学习:
train.py,client.py,models.py,tasks.py,trl_env.py - 工具类:
build_rl_dataset.py,verify_tasks.py,pyproject.toml - 实验产物:
results/*.json - 配置文件:
openenv.yaml
数据字段
该仓库不是表格型数据集,不存在数据行或结构化划分,而是以代码、配置和强化学习实验产物的形式分发。
文件详情
| 文件路径 | 类型 |
|---|---|
server/app.py |
Python 模块 |
server/Dockerfile |
容器配置 |
server/hermes_tool_env.py |
环境实现 |
train.py |
训练入口 |
client.py |
强化学习客户端 |
models.py |
模型定义 |
tasks.py |
任务定义 |
trl_env.py |
TRL 集成 |
build_rl_dataset.py |
数据集构建脚本 |
verify_tasks.py |
任务验证脚本 |
openenv.yaml |
环境配置 |
pyproject.toml |
项目元数据 |
results/*.json |
实验产物 |
数据划分
该仓库不是表格型数据集,无可用数据划分。仅存在默认配置(default),但无划分数据文件。
使用说明
该仓库用于访问 Hermes 工具使用强化学习环境,适用于涉及工具调用强化学习训练的研究与开发工作流。可通过克隆仓库并直接运行服务器或训练脚本使用。
引用方式
如需引用本数据集,请使用以下格式:
@misc{hermes-tool-use-rl-env, title = {Hermes Tool Use RL Env}, author = {Nanthasit / Beer}, year = {2026}, url = {https://huggingface.co/datasets/Nanthasit/hermes-tool-use-rl-env} }





