官方服务:
资源简介:
Best-aligned model for Austria (AT)
应用场景:
创建时间:
2025-03-21
相关数据集
H-D-T/Buzz-slice-9-10-V1.2
Buzz数据集是一个高质量的预训练规模助手数据集,结合了强化学习(RL)和监督微调(SFT)。该数据集包含了435个高质量的指令跟随和对话数据集,去重后格式化为保持和扩展训练类型与当前本地生态系统之间的兼容性。数据集包括各种高质量的指令跟随、对话、故事讲述和编码数据集,以及超过500万行新数据和数百万行重新增强的数据,总计约8500万轮对话。数据集的结构和格式与Axolotl和lmsys的Fast
Hugging Face2024-09-02 更新100
math-extraction-comp/princeton-nlp__Mistral-7B-Instruct-RRHF
该数据集包含多个字段,主要用于存储问题、答案以及与问题回答相关的预测和评分信息。具体字段包括:问题文本(question)、标准答案(gold)、预测答案(target)、实际预测结果(prediction)、数据子集标识(subset),以及三个不同工具提取的答案和对应的评分。数据集分为训练集(train),包含1324个示例,文件大小为3072316字节。数据集的总下载大小为1447887字节
Hugging Face2025-01-11 更新40
W-61/llama-multi-beta-testing-margin_dpo-hh-helpful-beta-0p8-20260429-085449-margin
这是一个从Margin-DPO训练运行中导出的每步边际摘要统计数据。数据集包含了训练过程中的各种统计指标,如均值、标准差、最小值、百分位数等,以及每个步骤的样本边际。数据来源于一个特定的训练运行,使用了Anthropic/hh-rlhf数据集作为混合器,训练参数包括beta值为0.8,f_divergence_type为reverse_kl等。
Hugging Face2026-04-29 更新10
zjhhhh/qwen3b_488_shard_00000_sel4_cur6_base6
该数据集包含了用户提示、要求以及多个选择的响应文本,同时还包含了这些响应相对于基础响应的统计数据,如均值和多数指标。数据集分为训练集,共有2000个示例。
Hugging Face2025-10-15 更新80
jihuny/llama_mag_10k_sky_active_mgopt_a03
--- dataset_info: features: - name: prompt dtype: string - name: prompt_idx dtype: int32 - name: response_a dtype: string - name: response_b dtype: string - name: response_
Hugging Face2026-03-22 更新20



