登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
gemmaSwahiliDataset
gemmaSwahiliDataset
收藏
kaggle
2025-01-01 更新
2025-02-22 收录
自然语言处理
斯瓦希里语
数据链接:
https://www.kaggle.com/datasets/samu2505/gemmaswahilidataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
swahili dataset generated by Gemini 1.5 Flash
由 Gemini 1.5 Flash 生成的斯瓦希里语数据集
应用场景:
创建时间:
2024-12-24
相关数据集
Marcus2112/minipile_loss-sampled
自然语言处理
机器学习
该数据集包含三个主要分割:训练集、验证集和测试集。训练集包含999,998个样本,验证集包含9,999个样本,测试集包含501个样本。每个样本包含两个特征:text(文本数据,类型为字符串)和pile_idx(索引,类型为整数)。数据集总大小为6,315,395,155字节,下载大小为3,568,305,514字节。
Hugging Face
2025-01-23 更新
4
0
ManySstubs-Synth
自然语言处理
机器学习
该数据集包含用于训练和评估模型的特征,包括标签和多个输入序列及其注意力掩码。数据集分为训练集、测试集和验证集,每个集都有相应的样本数量和字节大小。数据集的配置文件指定了数据文件的路径。
Hugging Face
2024-11-27 更新
1
0
GQVis
癌症基因组数据
自然语言处理
GQVis是一个大规模的数据集,旨在支持基因组数据可视化的自然语言查询研究。它包含102万条与Gosling规范配对的基因组数据的自然语言查询。该数据集还包括用于研究更复杂工作流程的多步骤交互链接、链和数据集。
Hugging Face
2025-08-22 更新
1
0
pbelcak/pmc-train-2900000-to-3000000-GemmaTokens
自然语言处理
机器学习
--- dataset_info: features: - name: input_ids sequence: int32 - name: attention_mask sequence: int8 splits: - name: train num_bytes: 6772595362 num_examples: 1371014 downlo
Hugging Face
2024-05-08 更新
3
0
toy-multistep-nn_10-na_20-nab_40-seed_2
文本生成
自然语言处理
该数据集是一个文本数据集,包含提示文本、完成文本、遮蔽令牌数量和原始文本字段。它被划分为训练集和两个测试集,每个集合包含相同数量的示例。数据集适用于文本生成相关任务。
Hugging Face
2025-04-07 更新
1
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广