数据链接:
官方服务:
资源简介:
English and Spanish language models for the NLP Assistant
应用场景:
创建时间:
2020-01-24
相关数据集
ToxicityPrompts/RealToxicityPrompts
Real Toxicity Prompts数据集包含100k个从网络上提取的句子片段,旨在帮助研究人员进一步解决神经网络模型中的毒性退化问题。每个实例包括提示及其元数据,使用了Perspective API生成毒性评分。数据集基于OPEN-WEBTEXT CORPUS创建,通过从Reddit的URL中提取的英文网页文本,并按照毒性范围进行分层采样。数据集的语言为英文,许可证为Apache 2.0。
Hugging Face2024-05-08 更新2160
showerthoughts-dataset
该数据集源自r/Showerthoughts Reddit社区,用于研究大型语言模型在特定领域写作风格适应中的机智、创造力和可检测性。数据集通过Pushshift API服务提供,但由于Reddit在2023年更改了其条款,限制了对数据的访问,因此本仓库不提供原始Reddit数据的下载链接,仅提供AI生成的Showerthoughts数据。
github2024-04-29 更新200
Ultra Chat 200k Dutch
Ultra Chat 200k Dutch数据集是由鲁汶大学和荷兰语言研究所创建的高质量对话数据集,旨在提升荷兰语生成语言模型的对话能力。该数据集包含192,598条对话,涵盖了技术、艺术、创业等多个主题,通过GPT-4生成,强调了多样性和覆盖范围。数据集的创建过程包括使用GPT-4进行多轮对话生成,并模拟不同用户角色以增加数据的多样性。该数据集主要应用于荷兰语生成语言模型的微调,旨在解决荷兰语对
arXiv2024-12-05 更新170
DeepMath-103K
DeepMath-103K是一个精心策划的大规模数学数据集,旨在推动语言模型在数学推理方面的边界。其主要特点包括:1. 挑战性问题:专注于难度较高的数学问题(主要为5-9级),显著提高了复杂性;2. 广泛的主题多样性:涵盖代数、微积分、数论、几何、概率和离散数学等多个数学领域;3. 严格的净化:通过语义匹配对常见基准进行了细致的净化,最小化测试集泄漏并促进公平的模型评估;4. 丰富的数据格式:每个
github2025-04-17 更新1360
rewoo/sotu_qa_2023
这是一个关于2023年国情咨文的问答基准数据集,特别适用于工具增强的语言模型(LMs)或增强语言模型(ALMs)来测试模型在回答私有文档问题上的能力。
Hugging Face2023-05-22 更新200



