登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
tamil corpus
tamil corpus
收藏
kaggle
2024-11-02 更新
2025-05-03 收录
泰米尔语
语言模型
数据链接:
https://www.kaggle.com/datasets/arjunaaditiyaa/tamil-corpus
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Tamil Text For Fine Tuning LLms
泰米尔语文本用于大语言模型的微调
应用场景:
创建时间:
2024-11-02
相关数据集
quizgen
语言模型
测验生成
Quizgen LLM数据集是一个专门为训练和测试大型语言模型(LLMs)在测验生成和基于代理的工作流程中设计的问答对集合。该数据集包含494个样本,来源于三个主要类别:AWS测验样本、Langfuse工作流程样本和增强训练样本。每个样本包含一个问题、一个答案、样本来源和额外的上下文信息。数据集以JSON格式组织,旨在用于训练、微调和评估LLMs在测验相关任务中的应用。它特别适用于开发自适应测验生
Hugging Face
2024-10-29 更新
43
0
WikiText Long Term Dependency Language Modeling Dataset 长期依赖语言建模数据集
自然语言处理
语言模型
WikiText 长期依赖语言建模数据集包含 1 亿个英文词汇,其来自于 Wikipedia 优质文章和标杆文章。
超神经
2023-09-12 更新
18
0
universitytehran/PersianPerplexity
波斯语
语言模型
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 337466 num_examples: 287 download_size: 166877 dataset_size: 337466 configs: - config_na
Hugging Face
2024-01-09 更新
9
0
baoanhtran/guanaco-llama2-200
多语言处理
语言模型
CulturaX 是一个多语言数据集,包含 167 种语言的 6.3 万亿个标记,专为大规模语言模型(LLM)开发而设计。该数据集经过严格的清洗和去重处理,包括语言识别、基于 URL 的过滤、基于指标的清洗、文档精炼和数据去重等多个阶段。数据集结合了 mC4(版本 3.1.0)和所有可访问的 OSCAR 语料库,经过深度清洗和去重后,包含 16TB 的数据(解压后为 27TB)。超过一半的数据集用
Hugging Face
2023-09-24 更新
32
0
huggingface-deberta-v3-variants
自然语言处理
语言模型
A collection of microsoft v3 standard language models and derived & good ones.
kaggle
2022-11-30 更新
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广