登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
ALL_TOKENS Simulations
ALL_TOKENS Simulations
收藏
kaggle
2025-09-22 更新
2025-10-25 收录
文本生成
自然语言处理
数据链接:
https://www.kaggle.com/datasets/vincenzopresta/all-tokens-simulations
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Monte Carlo text generation simulations
蒙特卡洛(Monte Carlo)文本生成模拟
应用场景:
创建时间:
2025-09-16
相关数据集
multi-train/nq-train-multikilt_1107
自然语言处理
机器学习
--- configs: - config_name: default data_files: - split: train path: data/train-* dataset_info: features: - name: query dtype: string - name: pos sequence: string - name: neg
Hugging Face
2023-11-10 更新
14
0
joaosanches/cleaned_tedtalks_total
TEDTalks
自然语言处理
--- dataset_info: features: - name: pt dtype: string - name: pt-br dtype: string splits: - name: train num_bytes: 66045930 num_examples: 314702 download_size: 41381774 da
Hugging Face
2024-01-30 更新
8
0
ZhentingNLP/code_pretraining_data
代码预训练
自然语言处理
该数据集包含了文本内容以及与LLaMA-2模型相关的token数量和文本来源信息。数据集被划分为训练集,共有26,680,129个示例,大小约为37.27GB。数据集的下载大小约为16.99GB。
Hugging Face
2025-03-12 更新
4
0
mehdie/fine_tune_dataset_new_format
自然语言处理
机器学习
--- dataset_info: features: - name: text dtype: string - name: labels dtype: int64 splits: - name: train num_bytes: 106945 num_examples: 3010 download_size: 32296 dataset
Hugging Face
2024-05-15 更新
9
0
nafisneehal/trialbrain_baseline_measures_instruct_v1
机器学习
自然语言处理
该数据集包含62,270个训练样本,每个样本包含instruction、input和output三个字符串类型的特征。数据集总大小为211,029,841字节,下载大小为96,199,241字节。数据文件路径为data/train-*。
Hugging Face
2024-12-19 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广