登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Samuel y Audrey: Bilingual YouTube Transcripts
Samuel y Audrey: Bilingual YouTube Transcripts
收藏
kaggle
2026-02-16 更新
2026-03-21 收录
双语语料库
语言模型对齐
数据链接:
https://www.kaggle.com/datasets/samuelandaudreymedia/youtube-transcripts-es-en-ledger
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Parallel ES/EN Corpus for Conversational LLM Alignment
应用场景:
创建时间:
2026-02-16
相关数据集
SaranaAbidueva/buryat-russian_parallel_corpus
机器翻译
双语语料库
该数据集包含41,000对俄语和布里亚特语的平行语料,其中包括19,411对句子和20,058对单词。数据来源多样,包括圣经、书籍、Tatoeba、诗歌、Nimbuev的诗歌、词典、维基百科、法律和儿童剧本等。数据集的结构包括训练集,其中包含40,979个示例,总大小为9,502,247字节。
Hugging Face
2024-06-19 更新
16
0
alvarobartt/Anthropic_HH_Golden_Formatted
语言模型对齐
数据格式化
该数据集旨在测试ULMA技术,如论文《Unified Language Model Alignment with Demonstration and Point-wise Human Preference》中所述。通过用高质量演示数据(黄金数据)替换偏好数据集中的正样本,可以显著提高各种对齐方法(如RLHF、DPO、ULMA)的性能。特别是,ULMA方法通过以不同方式处理正样本和负样本,并移除正样
Hugging Face
2023-12-14 更新
8
0
Picard1203/ccmatrix_en_he
机器翻译
双语语料库
这是一个包含英语(en)和希伯来语(he)平行文本的数据集,共有25,228,938个示例,适用于机器翻译任务。数据集采用单一拆分方式,即训练集。每个条目都包含一个唯一的ID和对应的英-希伯来语翻译。
Hugging Face
2025-01-25 更新
5
0
mc-shared/mcu.dpo.innodata.prompts.2025-07-08
语言模型对齐
指令调优优化
该数据集包含了多个特征,如UD、S等字符串类型特征,以及 Prompt ID等整数类型特征。它还包括了对话内容(conversation)和角色(role)。数据集被划分为训练集(train),并提供了相应的字节数和示例数。数据集的配置信息中包含了默认配置和数据文件路径。
Hugging Face
2025-08-06 更新
9
0
stefanocarrera/autophagycode_D_he_Qwen3-8B_strategy_trust_g4
语言模型对齐
AI安全
--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: prompt dtype: string - name: completion dtype: string - name: test d
Hugging Face
2026-03-27 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广